---
title: "BigSet: il sistema AI multi-agente per estrarre dati dal web"
date: "2026-06-02"
category: "Intelligenza Artificiale"
tags: ["automazione", "bigset", "data scraping", "intelligenza artificiale", "llm"]
author: "Giuseppe Carruezzo"
description: "Scopri BigSet, il sistema open-source basato su agenti IA per creare dataset strutturati dal web partendo da semplici richieste in linguaggio naturale."
source: "https://ainsights.it/blog/bigset-sistema-multi-agente-estrazione-dati"
---

# BigSet: il sistema AI multi-agente per estrarre dati dal web

![BigSet: il sistema AI multi-agente per estrarre dati dal web](/blogai/backend/uploads/6a1f6bde7576b.webp)

TinyFish ha annunciato il lancio di BigSet, un sistema multi-agente open-source progettato per automatizzare la creazione di dataset strutturati partendo da semplici descrizioni in linguaggio naturale. Lo strumento elimina la necessità di scrivere scraper personalizzati o configurare manualmente pipeline di dati complesse.

-   **2-5 min** — Tempo di generazione (Durata media per la creazione di un dataset completo)
-   **$5-10** — Costo iniziale (Crediti consigliati su OpenRouter per iniziare)
-   **AGPL-3.0** — Licenza (Software open-source e modificabile)

## Che cos'è BigSet e come semplifica l'estrazione dati

Costruire un dataset strutturato dal web è storicamente un problema di ingegneria: è necessario identificare la fonte, scrivere uno **scraper** (un software che estrae dati dai siti), progettare uno schema, gestire i duplicati e aggiornare il codice ogni volta che il sito di origine cambia grafica. **BigSet** si inserisce come uno strato intermedio tra il fabbisogno di dati e la tabella finale.

L'utente descrive ciò di cui ha bisogno, ad esempio: _"Aziende di YC che stanno assumendo ingegneri, con fase di finanziamento, sede e numero di posizioni aperte"_. Il sistema interpreta la richiesta, definisce le colonne necessarie, attiva agenti IA per ricercare le informazioni e produce un file CSV o XLSX scaricabile. Non è richiesta la specifica di URL o selettori CSS manuali.

Una funzione di aggiornamento programmato permette ai dataset di restare attuali: è possibile impostare una cadenza (ogni 30 minuti, 6 ore, giornaliera o settimanale) in modo che gli agenti IA rieseguano la ricerca e aggiornino la tabella automaticamente.

![Interfaccia di BigSet che mostra la generazione di un dataset](/blogai/backend/uploads/6a1f6bde7576b.webp)

Interfaccia utente di BigSet durante la fase di popolamento di un dataset strutturato.

## L'architettura multi-agente a due livelli

A differenza di una semplice chiamata a un **LLM** (Large Language Model) con accesso al web, BigSet utilizza un'architettura strutturata basata su un sistema multi-agente (un insieme di agenti IA specializzati che collaborano).

```mermaid
flowchart TD
  A[Input dell'utente] --> B[Inferenza Schema - Claude Sonnet]
  B --> C[Agente Orchestratore - Qwen]
  C --> D[Sub-Agenti in parallelo]
  D --> E[Deduplicazione e Attribuzione fonti]
  E --> F[Export CSV/XLSX]
```

1.  **Inferenza dello Schema:** Claude Sonnet (tramite OpenRouter) analizza la descrizione e definisce nomi delle colonne, tipi di dati e chiavi primarie prima ancora di accedere al web.
2.  **Agente Orchestratore:** Un modello Qwen esegue una scoperta ad ampio raggio utilizzando _TinyFish Search_ per identificare quali entità corrispondono alla descrizione.
3.  **Fan-Out dei Sub-Agenti:** L'orchestratore lancia diversi sub-agenti in parallelo. Ogni agente gestisce una singola riga della tabella (un'entità). Ogni agente ha un budget massimo di 6 chiamate a strumenti di ricerca per estrarre i dati e validare le informazioni.
4.  **Deduplicazione:** Il sistema applica una logica di **deduplicazione** (rimozione dei duplicati) basata sulla chiave primaria. Ogni dato inserito mantiene un link tracciabile alla pagina web di origine.

La sicurezza contro la **prompt injection** (tecnica per manipolare l'IA tramite input malevoli) è gestita a livello infrastrutturale: i sub-agenti che visitano siti web sconosciuti non hanno visibilità sull'ID del dataset in scrittura, impedendo a un sito malevolo di sovrascrivere dati di altri utenti.

## Specifiche tecniche e Stack tecnologico

BigSet è costruito su un ecosistema moderno che garantisce velocità e scalabilità. Di seguito i componenti principali:

| Livello | Tecnologia utilizzata |
| --- | --- |
| Frontend | Next.js 16, React 19, Tailwind 4 |
| Backend | Fastify, TypeScript |
| Database | Convex (self-hosted) |
| Orchestrazione AI | Mastra workflows + Vercel AI SDK |
| Modelli LLM | Claude Sonnet e Qwen via OpenRouter |
| Estrazione Dati | TinyFish Search, Fetch e Browser |

## Guida all'installazione e configurazione (Self-hosting)

BigSet è progettato per essere eseguito sulla propria infrastruttura tramite Docker. Il video seguente mostra il processo di configurazione rapida:

_Configurazione di BigSet - Video di Marktechpost_

## Come installare BigSet via Docker

1.  **Clonazione del repository**: Esegui git clone https://github.com/tinyfish-io/bigset.git e accedi alla cartella.
2.  **Configurazione variabili ambiente**: Copia il file .env.example in .env e inserisci le chiavi API di TinyFish, OpenRouter e Clerk.
3.  **Avvio del sistema**: Esegui il comando make dev. Il sistema configurerà automaticamente database, backend e frontend.
4.  **Accesso all interfaccia**: Apri localhost:3500 nel browser per iniziare a creare dataset.

### Requisiti per le chiavi API

-   **TinyFish:** Necessaria per la ricerca web e il recupero delle pagine.
-   **OpenRouter:** Utilizzata per le chiamate ai modelli Claude e Qwen.
-   **Clerk:** Gestisce l'autenticazione degli utenti (richiede la configurazione di un JWT Template per Convex).

## Esempio pratico: Motori di inferenza LLM

Immaginiamo di inserire il prompt: _"Motori di inferenza LLM open-source, con stelle GitHub, hardware supportato e licenza."_

Il processo si sviluppa in queste fasi:

-   **Schema:** Vengono create le colonne `engine_name` (string), `github_stars` (integer), `supported_hardware` (string) e `license` (string).
-   **Scoperta:** L'orchestratore identifica entità come vLLM, llama.cpp e Ollama.
-   **Estrazione:** Un sub-agente visita la pagina GitHub di vLLM, rileva 48.200 stelle e licenza Apache-2.0, quindi cerca l'hardware supportato (NVIDIA, AMD, TPU).
-   **Risultato:** Viene generata una riga pulita con l'attribuzione della fonte.

## Confronto con strumenti simili

BigSet si distingue da altri strumenti di estrazione dati per il suo approccio "agent-native" e la flessibilità dello schema.

> _\[Grafico interattivo — visibile nella versione web dell'articolo\]_

| Caratteristica | BigSet | Firecrawl | Apify |
| --- | --- | --- | --- |
| Input | Linguaggio naturale | URL forniti | Sito + Actor scelto |
| Schema | Auto-inferito | Manuale | Manuale |
| Licenza | AGPL-3.0 | AGPL-3.0 | Proprietaria |
| Refresh automatico | Sì (programmabile) | No | Sì |

## Punti chiave

-   BigSet trasforma descrizioni testuali in tabelle di dati strutturati e pronti per l export in CSV o XLSX.
-   Utilizza un architettura a due livelli: un orchestratore per la scoperta e sub-agenti paralleli per l estrazione dei dettagli.
-   Il sistema include funzioni di aggiornamento programmato (da 30 minuti a settimanale) per mantenere i dati sempre freschi.
-   Essendo open-source (AGPL-3.0), può essere ospitato sui propri server garantendo il controllo totale sui dati.

### Verdetto Tecnico — 4.5/5

BigSet rappresenta un passo avanti significativo nell automazione dei dati. La capacità di dedurre lo schema e orchestrare agenti in parallelo riduce drasticamente i tempi di ricerca web, rendendolo uno strumento eccellente per analisti e sviluppatori.

## FAQ

### Quanto costa generare un dataset?

Il software è gratuito, ma richiede crediti OpenRouter per le chiamate LLM. In media, 5-10 dollari sono sufficienti per iniziare e generare diversi dataset.

### Quanto tempo serve per creare una tabella?

La generazione richiede solitamente tra i 2 e i 5 minuti, poiché gli agenti eseguono ricerche reali sul web in tempo reale.

### Posso integrare BigSet con altri software?

Al momento supporta l export in CSV e XLSX, ma il supporto per query SQL e un API nativa per agenti sono presenti nella roadmap ufficiale.

### È sicuro usare BigSet per dati sensibili?

Sì, essendo self-hosted tramite Docker, i dati rimangono sulla tua infrastruttura.

## Fonti e riferimenti

1.  [GitHub - TinyFish BigSet Repository](https://github.com/tinyfish-io/bigset)
2.  [TinyFish Official Site](https://pxllnk.co/6vgsr6e)
3.  [Marktechpost Source Article](https://www.marktechpost.com/2026/06/02/tinyfish-launches-bigset-an-open-source-multi-agent-system-that-builds-structured-live-datasets-from-plain-english-descriptions/)

---

*Fonte: [https://ainsights.it/blog/bigset-sistema-multi-agente-estrazione-dati](https://ainsights.it/blog/bigset-sistema-multi-agente-estrazione-dati)*
