Esempi di fatturazione

Esempi di calcolo dei prezzi per modelli tipici di LLM, video, immagine e audio — fatturazione a token per gli LLM, video fatturato a token, video al secondo, per immagine, immagine fatturata a token e audio fatturato a caratteri

Questa pagina illustra calcoli di fatturazione reali per alcuni modelli tipici, uno per ogni stile di prezzo. I meccanismi dietro ogni stile sono spiegati in Come vengono fatturati i modelli.

Le tariffe mostrate sono istantanee

Le tariffe riportate di seguito sono prezzi di listino, accurate al momento della stesura (luglio 2026), e possono cambiare. Qualsiasi sconto piattaforma o di account viene applicato automaticamente in aggiunta. La pagina di dettaglio del modello e l'API di stima dei costi restituiscono sempre il prezzo attuale e autorevole.

Token LLM — zai-org/glm-5.2

I modelli LLM vengono fatturati per milione di token, con tariffe separate per i token di input (prompt), di input in cache e di output (completamento) (consulta i modelli LLM):

Tipo di tokenPrezzo di listino
Token di input$1.40 per 1M
Token di input in cache$0.26 per 1M
Token di output$4.40 per 1M

Cost=Fresh Input1M×$1.40+Cached Input1M×$0.26+Output1M×$4.40Cost = \frac{Fresh\ Input}{1M} \times \$1.40 + \frac{Cached\ Input}{1M} \times \$0.26 + \frac{Output}{1M} \times \$4.40

L'addebito avviene al completamento della richiesta, in base ai conteggi di token riportati nel campo usage della risposta — le richieste in streaming e non in streaming vengono fatturate in modo identico, e le richieste fallite non vengono addebitate.

Esempio — una richiesta di chat con 12,000 token di prompt (di cui 10,000 serviti dalla cache del prompt) e 1,500 token di output:

  1. Input nuovo: 2,000 × $1.40 ÷ 1M = $0.0028
  2. Input in cache: 10,000 × $0.26 ÷ 1M = $0.0026
  3. Output: 1,500 × $4.40 ÷ 1M = $0.0066
  4. Totale: $0.0120

Senza il caching del prompt, la stessa richiesta fatturerebbe tutti i 12,000 token di input alla tariffa di input piena — $0.0168 + $0.0066 = $0.0234, quasi il doppio. Mantenere un prompt di sistema stabile tra le richieste consente di applicare la tariffa della cache alla porzione ripetuta.

Video fatturato a token — bytedance/seedance-2.0/reference-to-video

Seedance 2.0 reference-to-video viene fatturato in token video di output al completamento dell'attività (consulta i modelli video fatturati a token). Si applicano due tariffe token, a seconda dei tuoi input:

Tipo di inputTariffa token
Solo immagini di riferimento (nessun video in input)$11.20 per 1M di token video
Include video di riferimento$6.88 per 1M di token video

Moltiplicatori di risoluzione: 480p / 720p / 1080p × 1.0, 4k × 0.57, 720p-sr / 1080p-sr × 1.8, 1440p-sr × 3.2. I token fatturati vengono misurati dall'output generato (e, per le richieste con video di riferimento, includono il contributo del video di input), quindi usa /calculate per un preventivo esatto sui livelli 4K e SR.

I token crescono con risoluzione, frame rate e durata:

Video Tokens≈Width×Height×FPS×Duration(seconds)1024Video\ Tokens \approx \frac{Width \times Height \times FPS \times Duration(seconds)}{1024}

A 1080p (1920 × 1080, 24 fps) questo corrisponde a 48,600 token al secondo di video.

Esempio A — solo immagini di riferimento, 10s a 1080p:

  1. Token di output: 48,600 × 10s = 486,000 token
  2. Prezzo di listino: 486,000 ÷ 1,000,000 × $11.20 × 1.0 = $5.44

Esempio B — con un video di riferimento di 8s, output di 10s a 1080p:

  1. I token fatturati contano il video di input più l'output: (10s + 8s) × 48,600 = 874,800 token
  2. Si applica la tariffa più bassa con video: 874,800 ÷ 1,000,000 × $6.88 × 1.0 = $6.02

Al momento dell'invio viene applicato un piccolo blocco temporaneo, rilasciato una volta che l'attività viene fatturata; le attività fallite non vengono addebitate.

Video al secondo — alibaba/wan-2.7/image-to-video

Wan 2.7 image-to-video usa il classico prezzo al secondo: una tariffa base di $0.10 al secondo, scalata in base alla risoluzione di output, con un minimo di 5 secondi:

RisoluzioneTariffa effettiva
720p$0.10 / secondo
1080p$0.15 / secondo
1080p-SR (upscalato da 720p)$0.12 / secondo
1440p-SR (upscalato da 720p)$0.2133 / secondo

Cost=$0.10×max(5, Duration)×Resolution MultiplierCost = \$0.10 \times max(5,\ Duration) \times Resolution\ Multiplier

Esempio — 8s a 1080p:

$0.10 × 8 × 1.5 = $1.20, riservato dal tuo saldo all'invio e incassato quando il video viene consegnato.

Esempio — 3s a 720p:

La durata è sotto il minimo, quindi vengono fatturati 5 secondi: $0.10 × 5 × 1.0 = $0.50.

Per immagine con opzioni — google/nano-banana-pro/edit

Nano Banana Pro (variante edit) ha un prezzo per immagine di output, con un livello di risoluzione e un sovrapprezzo opzionale per la ricerca web:

VocePrezzo di listino
Immagine fino a 2K$0.14 / immagine
Immagine 4K$0.24 / immagine
Ricerca web (opzionale)$0.014 / richiesta

Cost=Images×Tier Price (+ $0.014 if web search)Cost = Images \times Tier\ Price\ (+\ \$0.014\ if\ web\ search)

Esempio — 2 immagini a 4K con ricerca web abilitata:

  1. Immagini: 2 × $0.24 = $0.48
  2. Ricerca web: + $0.014 (aggiunta una volta per richiesta)
  3. Totale di listino: $0.494

L'importo viene riservato all'invio e rilasciato automaticamente se l'attività fallisce.

Immagine fatturata a token — openai/gpt-image-2/edit

GPT Image 2 viene fatturato come un LLM — a token — ma i conteggi di token vengono calcolati dai parametri della tua richiesta al momento dell'invio:

Tipo di tokenTariffaCome viene conteggiato
Token immagine di output$30 per 1MDa size e quality dell'output
Token immagine di input$8 per 1MDalle dimensioni effettive di ogni immagine di input
Token testo di input$5 per 1M1,000 token fissi per immagine generata

Conteggi di token di output per un'immagine 1024×1024: 196 (low), 1,756 (medium), 7,024 (high). Dimensioni maggiori producono proporzionalmente più token; le immagini di input usano sempre la base token medium indipendentemente da quality.

Esempio — modifica di un'immagine 1024×1024, quality: medium, size: 1024x1024, n: 1:

  1. Testo di input: 1,000 token × $5/1M = $0.0050
  2. Immagine di input: 1,756 token × $8/1M = $0.0140
  3. Immagine di output: 1,756 token × $30/1M = $0.0527
  4. Totale: ≈ $0.072 per immagine

Richiedere n immagini moltiplica l'intero importo per n.

Audio fatturato a caratteri (TTS) — xai/tts-v1 e bytedance/seed-audio-1.0

Entrambi i modelli text-to-speech hanno un prezzo basato sulla lunghezza del testo di input, a $0.015 per 1,000 caratteri:

Cost=Characters(text)1,000×$0.015Cost = \frac{Characters(text)}{1{,}000} \times \$0.015

I caratteri vengono conteggiati come caratteri Unicode, quindi un carattere CJK conta come un carattere, esattamente come una lettera latina.

Esempio — uno script di 1,200 caratteri:

1,200 ÷ 1,000 × $0.015 = $0.018, addebitato all'invio.

Esempio — un prompt breve di 300 caratteri:

300 ÷ 1,000 × $0.015 = $0.0045.

Verifica tu stesso qualsiasi modello

Ogni esempio qui sopra può essere riprodotto con l'API di stima dei costi — invia il corpo esatto della tua richiesta a /api/v1/model/calculate e ottieni il prezzo di listino, il tuo prezzo effettivo e lo sconto applicato senza creare alcuna attività.

Last updated on

On this page