TinyFish ha annunciato il lancio di BigSet, un sistema multi-agente open-source progettato per automatizzare la creazione di dataset strutturati partendo da semplici descrizioni in linguaggio naturale. Lo strumento elimina la necessità di scrivere scraper personalizzati o configurare manualmente pipeline di dati complesse.
Che cos'è BigSet e come semplifica l'estrazione dati
Costruire un dataset strutturato dal web è storicamente un problema di ingegneria: è necessario identificare la fonte, scrivere uno scraper (un software che estrae dati dai siti), progettare uno schema, gestire i duplicati e aggiornare il codice ogni volta che il sito di origine cambia grafica. BigSet si inserisce come uno strato intermedio tra il fabbisogno di dati e la tabella finale.
L'utente descrive ciò di cui ha bisogno, ad esempio: "Aziende di YC che stanno assumendo ingegneri, con fase di finanziamento, sede e numero di posizioni aperte". Il sistema interpreta la richiesta, definisce le colonne necessarie, attiva agenti IA per ricercare le informazioni e produce un file CSV o XLSX scaricabile. Non è richiesta la specifica di URL o selettori CSS manuali.
Una funzione di aggiornamento programmato permette ai dataset di restare attuali: è possibile impostare una cadenza (ogni 30 minuti, 6 ore, giornaliera o settimanale) in modo che gli agenti IA rieseguano la ricerca e aggiornino la tabella automaticamente.

L'architettura multi-agente a due livelli
A differenza di una semplice chiamata a un LLM (Large Language Model) con accesso al web, BigSet utilizza un'architettura strutturata basata su un sistema multi-agente (un insieme di agenti IA specializzati che collaborano).
- Inferenza dello Schema: Claude Sonnet (tramite OpenRouter) analizza la descrizione e definisce nomi delle colonne, tipi di dati e chiavi primarie prima ancora di accedere al web.
- Agente Orchestratore: Un modello Qwen esegue una scoperta ad ampio raggio utilizzando TinyFish Search per identificare quali entità corrispondono alla descrizione.
- Fan-Out dei Sub-Agenti: L'orchestratore lancia diversi sub-agenti in parallelo. Ogni agente gestisce una singola riga della tabella (un'entità). Ogni agente ha un budget massimo di 6 chiamate a strumenti di ricerca per estrarre i dati e validare le informazioni.
- Deduplicazione: Il sistema applica una logica di deduplicazione (rimozione dei duplicati) basata sulla chiave primaria. Ogni dato inserito mantiene un link tracciabile alla pagina web di origine.
Specifiche tecniche e Stack tecnologico
BigSet è costruito su un ecosistema moderno che garantisce velocità e scalabilità. Di seguito i componenti principali:
| Livello | Tecnologia utilizzata |
|---|---|
| Frontend | Next.js 16, React 19, Tailwind 4 |
| Backend | Fastify, TypeScript |
| Database | Convex (self-hosted) |
| Orchestrazione AI | Mastra workflows + Vercel AI SDK |
| Modelli LLM | Claude Sonnet e Qwen via OpenRouter |
| Estrazione Dati | TinyFish Search, Fetch e Browser |
Guida all'installazione e configurazione (Self-hosting)
BigSet è progettato per essere eseguito sulla propria infrastruttura tramite Docker. Il video seguente mostra il processo di configurazione rapida:
Come installare BigSet via Docker
- 1Clonazione del repositoryEsegui git clone https://github.com/tinyfish-io/bigset.git e accedi alla cartella.
- 2Configurazione variabili ambienteCopia il file .env.example in .env e inserisci le chiavi API di TinyFish, OpenRouter e Clerk.
- 3Avvio del sistemaEsegui il comando make dev. Il sistema configurerà automaticamente database, backend e frontend.
- 4Accesso all interfacciaApri localhost:3500 nel browser per iniziare a creare dataset.
Requisiti per le chiavi API
- TinyFish: Necessaria per la ricerca web e il recupero delle pagine.
- OpenRouter: Utilizzata per le chiamate ai modelli Claude e Qwen.
- Clerk: Gestisce l'autenticazione degli utenti (richiede la configurazione di un JWT Template per Convex).
Esempio pratico: Motori di inferenza LLM
Immaginiamo di inserire il prompt: "Motori di inferenza LLM open-source, con stelle GitHub, hardware supportato e licenza."
Il processo si sviluppa in queste fasi:
- Schema: Vengono create le colonne
engine_name(string),github_stars(integer),supported_hardware(string) elicense(string). - Scoperta: L'orchestratore identifica entità come vLLM, llama.cpp e Ollama.
- Estrazione: Un sub-agente visita la pagina GitHub di vLLM, rileva 48.200 stelle e licenza Apache-2.0, quindi cerca l'hardware supportato (NVIDIA, AMD, TPU).
- Risultato: Viene generata una riga pulita con l'attribuzione della fonte.
Confronto con strumenti simili
BigSet si distingue da altri strumenti di estrazione dati per il suo approccio "agent-native" e la flessibilità dello schema.
Mostra dati
| Voce | Grado di automazione (0-10) |
|---|---|
| Scraping Manuale | 2 |
| Apify (Pre-built) | 6 |
| BigSet (AI-Native) | 9 |
| Caratteristica | BigSet | Firecrawl | Apify |
|---|---|---|---|
| Input | Linguaggio naturale | URL forniti | Sito + Actor scelto |
| Schema | Auto-inferito | Manuale | Manuale |
| Licenza | AGPL-3.0 | AGPL-3.0 | Proprietaria |
| Refresh automatico | Sì (programmabile) | No | Sì |
Verdetto Tecnico
BigSet rappresenta un passo avanti significativo nell automazione dei dati. La capacità di dedurre lo schema e orchestrare agenti in parallelo riduce drasticamente i tempi di ricerca web, rendendolo uno strumento eccellente per analisti e sviluppatori.
Quanto costa generare un dataset?
Quanto tempo serve per creare una tabella?
Posso integrare BigSet con altri software?
È sicuro usare BigSet per dati sensibili?
Fonti e riferimenti




