> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Elaborazione dei documenti

> Estrai testo e conteggio dei token da file PDF, DOCX, PPTX, XLSX e di testo semplice fino a 25 MB con l'API Venice Text Parser, senza inferenza.

L'API Text Parser estrae il testo da un documento senza eseguire inferenza di modello. Usala quando la tua applicazione ha bisogno di ispezionare, memorizzare, indicizzare o riutilizzare il contenuto di un documento prima di inviarlo a un modello.

Gli input supportati includono file PDF, DOCX, PPTX, XLSX e file di testo semplice fino a 25 MB.

## Analizzare un documento

Carica il file come `multipart/form-data`:

```bash theme={null}
curl https://api.venice.ai/api/v1/augment/text-parser \
  -H "Authorization: Bearer $VENICE_API_KEY" \
  -F "file=@document.pdf" \
  -F "response_format=json"
```

Il formato di risposta predefinito `json` restituisce il testo estratto e il suo conteggio dei token. Usa `response_format=text` quando ti serve solo il testo estratto.

## Text Parser o file input della chat?

Entrambe le funzionalità estraggono il contenuto dei documenti, ma servono flussi di lavoro diversi:

| Esigenza                                                        | Utilizza                                              |
| --------------------------------------------------------------- | ----------------------------------------------------- |
| Interrogare immediatamente un modello su un documento           | [File input della chat](/guides/features/file-inputs) |
| Estrarre testo senza inferenza                                  | Text Parser                                           |
| Verificare il conteggio dei token prima di scegliere un modello | Text Parser                                           |
| Memorizzare, indicizzare o riutilizzare il contenuto estratto   | Text Parser                                           |
| Usare lo stesso documento in diversi prompt                     | Text Parser                                           |

## Pipeline tipica

<Steps>
  <Step title="Analizza il file">
    Carica il documento sorgente e richiedi una risposta JSON.
  </Step>

  <Step title="Ispeziona l'output">
    Confronta il conteggio dei token con la finestra di contesto del modello di destinazione. Riduci o suddividi i documenti di grandi dimensioni prima dell'inferenza.
  </Step>

  <Step title="Usa il testo">
    Aggiungilo a un prompt della chat, genera embedding per il retrieval oppure salvalo nel tuo data store.
  </Step>
</Steps>

<Info>
  L'analisi viene eseguita in memoria con zero retention dei dati. Venice elabora il documento caricato e lo scarta immediatamente senza memorizzarne o registrarne il contenuto.
</Info>

<Warning>
  L'API Text Parser è sperimentale. Il formato di richiesta e risposta può cambiare senza preavviso.
</Warning>

## Trasformare il testo in record

Il testo estratto è un punto di partenza, non un risultato. [Estrarre dati strutturati dai documenti](/guides/tools/document-extraction) prosegue da qui: vincola l'output a uno schema JSON in modo che ogni documento produca gli stessi campi, e passa a un modello vision quando il parser segnala che un file non ha testo da estrarre.

## Risorse correlate

* [Estrarre dati strutturati dai documenti](/guides/tools/document-extraction)
* [Riferimento API Text Parser](/api-reference/endpoint/augment/text-parser)
* [File Inputs](/guides/features/file-inputs)
* [Embeddings](/guides/features/embeddings)
* [Modelli di testo](/models/text)
