TinyFish ha annunciato il lancio di BigSet, un sistema multi-agente open-source progettato per automatizzare la creazione di dataset strutturati partendo da semplici descrizioni in linguaggio naturale. Lo strumento elimina la necessità di scrivere scraper personalizzati o configurare manualmente pipeline di dati complesse.

2-5 min
Tempo di generazione
Durata media per la creazione di un dataset completo
$5-10
Costo iniziale
Crediti consigliati su OpenRouter per iniziare
AGPL-3.0
Licenza
Software open-source e modificabile

Che cos'è BigSet e come semplifica l'estrazione dati

Costruire un dataset strutturato dal web è storicamente un problema di ingegneria: è necessario identificare la fonte, scrivere uno scraper (un software che estrae dati dai siti), progettare uno schema, gestire i duplicati e aggiornare il codice ogni volta che il sito di origine cambia grafica. BigSet si inserisce come uno strato intermedio tra il fabbisogno di dati e la tabella finale.

L'utente descrive ciò di cui ha bisogno, ad esempio: "Aziende di YC che stanno assumendo ingegneri, con fase di finanziamento, sede e numero di posizioni aperte". Il sistema interpreta la richiesta, definisce le colonne necessarie, attiva agenti IA per ricercare le informazioni e produce un file CSV o XLSX scaricabile. Non è richiesta la specifica di URL o selettori CSS manuali.

Una funzione di aggiornamento programmato permette ai dataset di restare attuali: è possibile impostare una cadenza (ogni 30 minuti, 6 ore, giornaliera o settimanale) in modo che gli agenti IA rieseguano la ricerca e aggiornino la tabella automaticamente.

Interfaccia di BigSet che mostra la generazione di un dataset
Interfaccia utente di BigSet durante la fase di popolamento di un dataset strutturato.

L'architettura multi-agente a due livelli

A differenza di una semplice chiamata a un LLM (Large Language Model) con accesso al web, BigSet utilizza un'architettura strutturata basata su un sistema multi-agente (un insieme di agenti IA specializzati che collaborano).

  1. Inferenza dello Schema: Claude Sonnet (tramite OpenRouter) analizza la descrizione e definisce nomi delle colonne, tipi di dati e chiavi primarie prima ancora di accedere al web.
  2. Agente Orchestratore: Un modello Qwen esegue una scoperta ad ampio raggio utilizzando TinyFish Search per identificare quali entità corrispondono alla descrizione.
  3. Fan-Out dei Sub-Agenti: L'orchestratore lancia diversi sub-agenti in parallelo. Ogni agente gestisce una singola riga della tabella (un'entità). Ogni agente ha un budget massimo di 6 chiamate a strumenti di ricerca per estrarre i dati e validare le informazioni.
  4. Deduplicazione: Il sistema applica una logica di deduplicazione (rimozione dei duplicati) basata sulla chiave primaria. Ogni dato inserito mantiene un link tracciabile alla pagina web di origine.

Specifiche tecniche e Stack tecnologico

BigSet è costruito su un ecosistema moderno che garantisce velocità e scalabilità. Di seguito i componenti principali:

LivelloTecnologia utilizzata
FrontendNext.js 16, React 19, Tailwind 4
BackendFastify, TypeScript
DatabaseConvex (self-hosted)
Orchestrazione AIMastra workflows + Vercel AI SDK
Modelli LLMClaude Sonnet e Qwen via OpenRouter
Estrazione DatiTinyFish Search, Fetch e Browser

Guida all'installazione e configurazione (Self-hosting)

BigSet è progettato per essere eseguito sulla propria infrastruttura tramite Docker. Il video seguente mostra il processo di configurazione rapida:

Configurazione di BigSet - Video di Marktechpost
Guida passo-passo

Come installare BigSet via Docker

  1. 1
    Clonazione del repositoryEsegui git clone https://github.com/tinyfish-io/bigset.git e accedi alla cartella.
  2. 2
    Configurazione variabili ambienteCopia il file .env.example in .env e inserisci le chiavi API di TinyFish, OpenRouter e Clerk.
  3. 3
    Avvio del sistemaEsegui il comando make dev. Il sistema configurerà automaticamente database, backend e frontend.
  4. 4
    Accesso all interfacciaApri localhost:3500 nel browser per iniziare a creare dataset.

Requisiti per le chiavi API

  • TinyFish: Necessaria per la ricerca web e il recupero delle pagine.
  • OpenRouter: Utilizzata per le chiamate ai modelli Claude e Qwen.
  • Clerk: Gestisce l'autenticazione degli utenti (richiede la configurazione di un JWT Template per Convex).

Esempio pratico: Motori di inferenza LLM

Immaginiamo di inserire il prompt: "Motori di inferenza LLM open-source, con stelle GitHub, hardware supportato e licenza."

Il processo si sviluppa in queste fasi:

  • Schema: Vengono create le colonne engine_name (string), github_stars (integer), supported_hardware (string) e license (string).
  • Scoperta: L'orchestratore identifica entità come vLLM, llama.cpp e Ollama.
  • Estrazione: Un sub-agente visita la pagina GitHub di vLLM, rileva 48.200 stelle e licenza Apache-2.0, quindi cerca l'hardware supportato (NVIDIA, AMD, TPU).
  • Risultato: Viene generata una riga pulita con l'attribuzione della fonte.

Confronto con strumenti simili

BigSet si distingue da altri strumenti di estrazione dati per il suo approccio "agent-native" e la flessibilità dello schema.

Confronto capacità di automazione
Mostra dati
Confronto capacità di automazione
VoceGrado di automazione (0-10)
Scraping Manuale2
Apify (Pre-built)6
BigSet (AI-Native)9
Fonte: Analisi funzionale BigSet
CaratteristicaBigSetFirecrawlApify
InputLinguaggio naturaleURL fornitiSito + Actor scelto
SchemaAuto-inferitoManualeManuale
LicenzaAGPL-3.0AGPL-3.0Proprietaria
Refresh automaticoSì (programmabile)No
Il nostro verdetto
4.5/ 5

Verdetto Tecnico

BigSet rappresenta un passo avanti significativo nell automazione dei dati. La capacità di dedurre lo schema e orchestrare agenti in parallelo riduce drasticamente i tempi di ricerca web, rendendolo uno strumento eccellente per analisti e sviluppatori.

Quanto costa generare un dataset?
Il software è gratuito, ma richiede crediti OpenRouter per le chiamate LLM. In media, 5-10 dollari sono sufficienti per iniziare e generare diversi dataset.
Quanto tempo serve per creare una tabella?
La generazione richiede solitamente tra i 2 e i 5 minuti, poiché gli agenti eseguono ricerche reali sul web in tempo reale.
Posso integrare BigSet con altri software?
Al momento supporta l export in CSV e XLSX, ma il supporto per query SQL e un API nativa per agenti sono presenti nella roadmap ufficiale.
È sicuro usare BigSet per dati sensibili?
Sì, essendo self-hosted tramite Docker, i dati rimangono sulla tua infrastruttura.

Fonti e riferimenti

  1. GitHub - TinyFish BigSet Repository
  2. TinyFish Official Site
  3. Marktechpost Source Article