MiniMax H3 Developer è ora disponibile — 60% di sconto, a partire da 0,02 $ al secondo
Hero background 1
ERNIE Image API for Readable Text in Images

ERNIE Image API for Readable Text in Images

L'API ERNIE Image porta nel tuo stack il Diffusion Transformer open-weight 8B di Baidu, rilasciato dall'ERNIE-Image Team con licenza Apache 2.0. Ottiene il miglior risultato su LongTextBench con 0.9733, mantenendo leggibili i titoli dei poster e i balloon dei fumetti, mentre una variante Turbo distillata riduce l'inferenza da 50 step a 8. Atlas Cloud lo rende disponibile tramite un unico endpoint compatibile con OpenAI, con prezzi pay-as-you-go trasparenti. Inizia a creare oggi stesso.

ERNIE Image è sviluppato da Baidu. Atlas Cloud (gestita da Atlas Cloud AI LLC) ne fornisce l’accesso ma non ne è proprietaria. Tutti i marchi appartengono ai rispettivi titolari.

Esplora i Modelli di Punta

Atlas Cloud ti fornisce i più recenti modelli creativi leader del settore.

Confronto degli endpoint ERNIE Image API: Text-to-Image Standard e Turbo

Abbina ogni endpoint text-to-image alle tue esigenze di velocità e qualità.

ModalitàDescrizione
ERNIE Image API (Text To Image)Mentre l’endpoint Turbo dà priorità al throughput, l’ERNIE Image API standard punta alla massima fedeltà dell’output per la stessa attività text-to-image. È adatta al lavoro di produzione finale, come poster, grafiche editoriali e layout commerciali, dove ottenere ogni dettaglio corretto conta più dei tempi di consegna.
ERNIE Image Turbo API (Text To Image)Trasforma un singolo prompt testuale in un massimo di dieci immagini per richiesta su sette aspect ratio, dal formato quadrato da 1024 pixel fino a 1376 pixel sul lato lungo. Ottimizzata per una bassa latenza, usa per impostazione predefinita otto passaggi di inferenza e include un Prompt Enhancer integrato che espande i prompt sintetici prima della generazione. Sceglila quando iterazioni rapide, anteprime in tempo reale ed esecuzioni batch ad alto volume sono più importanti dell’ultimo incremento di qualità.

Progettata per testo, layout e controllo: ERNIE Image API

Dal rendering del testo leader di settore e dai layout strutturati multi-pannello al prompting bilingue nativo, a un Prompt Enhancer attivo per impostazione predefinita, sette dimensioni di output e batch Turbo riproducibili, ERNIE Image API trasforma istruzioni precise in immagini pronte per la produzione.

Rendering del testo leggibile con ERNIE Image API

Rendering del testo leggibile con ERNIE Image API

Un punteggio LongTextBench di 0.9733, tra i migliori del settore, consente al modello di inserire nelle immagini generate testo leggibile e scritto correttamente. Fumetti con balloon, titoli di poster, etichette di infografiche e testi per mockup UI restano tutti nitidi e facili da leggere.

Layout strutturati multi-pannello

Layout strutturati multi-pannello

Le primitive di generazione, modifica, composizione e upscale lavorano insieme alla comprensione delle relazioni spaziali basate su griglia. Insieme producono sequenze multi-pannello coerenti e design formattati che i designer possono gestire tramite un’unica pipeline centralizzata.

Prompting bilingue in ERNIE Image API

Prompting bilingue in ERNIE Image API

I prompt in inglese e cinese vengono elaborati nativamente dalla stessa pipeline di encoder, catturando formulazioni idiomatiche in entrambe le lingue. Questa doppia competenza supporta uno storytelling visivo autentico sia per campagne globali sia per contenuti localizzati.

Prompt Enhancer attivo per impostazione predefinita

Prompt Enhancer attivo per impostazione predefinita

Attivo per impostazione predefinita, un Prompt Enhancer leggero riscrive input brevi trasformandoli in descrizioni più ricche e strutturate prima che raggiungano il backbone di diffusione. Puoi disattivarlo per singola richiesta quando il controllo letterale sulla formulazione esatta è più importante.

Sette dimensioni di output native

Sette dimensioni di output native

Le sette dimensioni di output native coprono il formato quadrato 1024x1024, inquadrature orizzontali fino a 1376x768 e formati verticali fino a 768x1376. Ogni rapporto viene generato direttamente, quindi l’inquadratura resta intatta in tutti i formati.

ERNIE Image API in modalità Turbo

ERNIE Image API in modalità Turbo

Ti serve volume senza attese? La modalità Turbo esegue anche solo 8 passaggi di inferenza e restituisce fino a 10 immagini per richiesta, mentre un seed esplicito mantiene ogni risultato riproducibile.

ERNIE Image testa a testa: un prompt, tre modelli

Dai lo stesso identico brief al modello di punta ERNIE Image, a un concorrente popolare e al suo fratello più veloce, poi valuta fianco a fianco come ciascuno rende tipografia, layout e luce.

Prompt

Natura morta flatlay ripresa dall’alto, fotocamera bloccata perfettamente in posizione zenitale, guardando dritto verso il basso su un bancone da speziale in olmo chiaro invecchiato di una tradizionale erboristeria cinese per tisane. Una luce dura e direzionale di tarda mattina entra bassa da destra attraverso la finestra, vera protagonista dell’inquadratura: proietta ombre lunghe, nette e allungate che si estendono verso sinistra attraverso la venatura grezza del legno e funzionano come linee guida. Sul lato destro, denso, barattoli di vetro trasparente fittamente raggruppati brillano mentre il sole li attraversa: boccioli essiccati di crisantemo traslucidi, bacche di goji rosse, scorza di mandarino ambrata arricciata (chenpi) e petali essiccati di roselle cremisi intenso che catturano la luce. Una piccola bilancia a mano in ottone ossidato con patina opaca, un mortaio e pestello in pietra consumati e spolverati di polvere fine, e foglietti di prescrizione in carta a fibre grossolane scritti a mano, con ordinati caratteri cinesi in calligrafia a pennello nello stile kaishu tradizionale ("甘草三钱", "桂花蜜"), bordi sfrangiati e fibrosi. Colto nel mezzo dell’azione: un contenitore in peltro rovesciato su un fianco, con l’imboccatura aperta, diverse bacche di goji ancora in rotolamento e sparse verso l’esterno, ognuna con la propria ombra sottile e lunga come un ago. La composizione respira attraverso densità e vuoto: il gruppo compatto a destra bilanciato da un’ampia distesa di spazio negativo in legno nudo a sinistra. Palette calda monocromatica in tutto il fotogramma: ambra, arancione mandarino, oro ottone invecchiato, interrotta da una singola nota di rosso scuro roselle. Le texture devono reggere all’ingrandimento: la sottigliezza fragile dei petali essiccati, l’ottone ossidato opaco, i bordi irregolari delle fibre della carta, la grana della polvere sparsa. Luce naturale direzionale, nessun bagliore artificiale, ombre pulite e nitide, resa realistica dei materiali, sobria ed elegante, fotografia di natura morta food-and-herb macro-dettagliata, scattata con obiettivo 85mm, ampia inquadratura orizzontale landscape, ampio aspect ratio 16:9, full-bleed.

Generated with Baidu ERNIE Image Turbo on Atlas Cloud

Generated with Baidu ERNIE Image Turbo on Atlas Cloud

Generated with Qwen Image 2.0 on Atlas Cloud

Generated with Qwen Image 2.0 on Atlas Cloud

Generated with Baidu ERNIE Image Turbo on Atlas Cloud

Generated with Baidu ERNIE Image Turbo on Atlas Cloud

Prompt

Una striscia manga orizzontale a tre vignette che segue una ragazza inventrice adolescente nel suo laboratorio in soffitta pieno di oggetti. Nella prima vignetta disegna una piccola macchina volante alla calda luce di una lampada, nella seconda l’aggeggio borbotta e si solleva a mezz’aria spargendo bulloni, nella terza alza entrambi i pugni sorridendo trionfante. Puliti balloon bilingui contengono lettering nitido in inglese e giapponese, disegnati con tratto a inchiostro sicuro e ombreggiatura screentone, caldo bagliore ambrato della lampada bilanciato da fredde ombre del laboratorio. Il design del personaggio rimane coerente in tutte e tre le vignette, i gesti restano espressivi e la storia si legge da sinistra a destra con un flusso sequenziale chiaro. Vivace stile di illustrazione anime cel-shaded con contorni netti e marcati. Ampio aspect ratio 16:9, full-bleed.

Generated with Baidu ERNIE Image Turbo on Atlas Cloud

Generated with Baidu ERNIE Image Turbo on Atlas Cloud

Generated with Qwen Image 2.0 on Atlas Cloud

Generated with Qwen Image 2.0 on Atlas Cloud

Generated with Baidu ERNIE Image Turbo on Atlas Cloud

Generated with Baidu ERNIE Image Turbo on Atlas Cloud

Lavori di produzione reali gestiti da ERNIE Image API

Dai poster con testo perfetto e fumetti multipanel alle campagne bilingui, cataloghi prodotto, mockup di interfacce e infografiche etichettate, ERNIE Image API trasforma prompt precisi in visual accurati nel layout per ogni pipeline di contenuti.

Produzione di marketing e poster con ERNIE Image API

Titoli, prezzi e testi di prodotto leggibili vengono renderizzati direttamente in poster e banner per campagne grazie all'elevata accuratezza testuale del modello. I team marketing pubblicano asset pronti per la stampa senza bisogno di un passaggio separato di impaginazione.

Fumetti e narrazione sequenziale

Poiché il modello comprende layout basati su griglia e strutture multipanel, renderizza pagine di fumetto coerenti con dialoghi inseriti nei balloon. Creator indipendenti e studi possono abbozzare storyboard completi senza ridisegnare ogni vignetta a mano.

Localizzazione di campagne bilingui con ERNIE Image API

Il supporto nativo ai prompt in inglese e cinese consente a un unico workflow di produrre visual coerenti con il brand per entrambi i mercati, con testo renderizzato correttamente in ciascun sistema di scrittura. I team globali localizzano la creatività senza dover creare pipeline di design separate per ogni lingua.

Visual per e-commerce su larga scala

Genera scene lifestyle, mockup di prodotto e immagini promozionali per un intero catalogo tramite una singola chiamata API. La variante Turbo comprime l'inferenza in otto passaggi, così gli store ad alto volume possono aggiornare interi cataloghi in pochi minuti.

Mockup di interfacce e prodotti

Servono schermate realistiche per un pitch? Il modello renderizza interfacce app e mockup di siti web con etichette, pulsanti e body copy leggibili, offrendo ai team prodotto prototipi pronti per la presentazione prima ancora che venga sviluppato un singolo componente.

Infografiche educative con ERNIE Image API

La solida aderenza alle istruzioni combina immagini con diagrammi, grafici e callout chiaramente etichettati in una singola generazione. Educatori e analisti trasformano materiali di partenza complessi in grafiche esplicative che restano leggibili su schermi di qualsiasi dimensione.

ERNIE Image a confronto con modelli Text-to-Image rivali

Scopri dove si colloca ERNIE Image rispetto ad altri generatori open e proprietari per provenienza dello sviluppatore, modello di accesso, rendering di testo bilingue e costo per immagine.

ModelloSviluppatoreModello di accessoRendering di testo bilingue (EN + ZH)Prezzo (per immagine)
ERNIE-ImageBaidu (ERNIE-Image Team)Pesi aperti, Apache 2.0Leader di settore, LongTextBench 0.9733Pagamento a consumo
ERNIE-Image TurboBaidu (ERNIE-Image Team)Pesi aperti, Apache 2.0Mantenuto grazie all’inferenza in 8 step distillata con DMDPagamento a consumo
Qwen Image 2.0Alibaba (Tongyi)Pesi aperti, Apache 2.0Solido sui layout tipografici da 1K token$0.035
Z-Image TurboAlibaba (Tongyi Lab)Pesi aperti, Apache 2.0Gestisce segnaletica cinese complessa insieme all’inglese$0.005
Seedream v4.5ByteDanceProprietarioRendering di livello designer in 4K nativo$0.04

Come Utilizzare ERNIE Image API for Readable Text in Images su Atlas Cloud

Inizia in pochi minuti — segui questi semplici passaggi per integrare e distribuire i modelli tramite la piattaforma Atlas Cloud.

Crea un Account Atlas Cloud

Registrati su atlascloud.ai e completa la verifica. I nuovi utenti ricevono crediti gratuiti per esplorare la piattaforma e testare i modelli.

Perché Usare ERNIE Image API for Readable Text in Images su Atlas Cloud

Combinando i modelli avanzati di ERNIE Image API for Readable Text in Images con la piattaforma GPU-accelerata di Atlas Cloud, ottieni prestazioni, scalabilità ed esperienza di sviluppo senza pari.

Prestazioni e Flessibilità

Bassa Latenza:
Inferenza ottimizzata su GPU per elaborazione in tempo reale.

API Unificata:
Esegui ERNIE Image API for Readable Text in Images, GPT, Gemini e DeepSeek con un'unica integrazione.

Prezzi Trasparenti:
Fatturazione prevedibile per token con opzioni Serverless.

Enterprise e Scalabilità

Esperienza Sviluppatore:
SDK, analytics, strumenti di fine-tuning e template.

Affidabilità:
99,99% di uptime, RBAC e logging conforme alle normative.

Sicurezza e Conformità:
SOC 2 Type II, allineamento HIPAA, sovranità dei dati negli USA.

ERNIE Image API: le domande più frequenti degli sviluppatori

ERNIE Image API offre agli sviluppatori accesso programmatico al modello text-to-image open-weight di Baidu: un Diffusion Transformer single-stream da 8B abbinato a un Prompt Enhancer che espande prompt brevi in descrizioni più ricche e strutturate. Su Atlas Cloud lo usi tramite un unico endpoint compatibile con OpenAI, con prezzi pay-as-you-go e accesso Day-0.

Il suo punto di forza distintivo è il testo leggibile all’interno delle immagini. Il modello ottiene 0.9733 su LongTextBench in English, il risultato migliore tra i modelli open-weight, il che lo rende affidabile per poster, fumetti con balloon, infografiche e mockup UI in cui ogni carattere deve essere scritto correttamente.

Entrambe le varianti condividono la stessa architettura da 8B, ma bilanciano qualità e velocità in modo diverso. Il modello Standard esegue 50 passaggi di inferenza con guidance scale 4.0 per la massima fedeltà sugli asset finali, mentre la variante Turbo è distillata con DMD e reinforcement learning fino a circa 8 passaggi per una generazione rapida e ad alto volume.

Sì. I prompt sono supportati in English, Chinese e Japanese tramite lo stesso encoder, e il testo resta affidabile tra diversi sistemi di scrittura, con un punteggio di 0.9661 sul Chinese LongTextBench. Mentre diversi modelli concorrenti peggiorano drasticamente sui caratteri cinesi, questo mantiene puliti il cinese semplificato, il tradizionale e i testi bilingue misti.

L’endpoint Turbo accetta sette dimensioni preimpostate tramite un unico parametro size, da un formato quadrato 1024x1024 ai formati landscape 1376x768 e portrait 768x1376. Puoi anche richiedere fino a dieci immagini per chiamata, fissare un seed per risultati riproducibili e attivare o disattivare il Prompt Enhancer integrato con il flag use_pe.

Per iniziare basta una singola API key. Registrati su Atlas Cloud, configura il tuo client compatibile con OpenAI esistente puntandolo all’endpoint e invia un prompt con size e seed opzionali per ricevere URL delle immagini nella risposta. La fatturazione è pay-as-you-go per chiamata, con accesso Day-0 al modello.

Nei benchmark pubblicati, il modello supera release open comparabili come FLUX.2-klein-9B, ottenendo 0.8856 contro 0.8481 su GenEval complessivo. Il vantaggio più ampio è nel rendering del testo, dove FLUX.2 scende a 0.2183 sul Chinese mentre ERNIE Image resta sopra 0.96. Per workload basati su testo leggibile all’interno delle immagini e layout strutturati, è attualmente la scelta open-weight più solida.

Sì. ERNIE Image è rilasciato con licenza Apache 2.0, che consente uso commerciale, modifica e redistribuzione. Le immagini generate possono essere usate in pubblicità, merchandising, pubblicazioni e altri prodotti commerciali senza complicazioni di licenza.

Esplora Altre Famiglie

Seedance 2.5

L'API Seedance 2.5 è ora disponibile su Atlas Cloud! Offre agli sviluppatori il più recente modello video di ByteDance. Genera fino a 30 secondi di video nativo in un unico passaggio da testo, una singola immagine o fino a 50 riferimenti multimodali, con audio sincronizzato e testo multilingue nell'inquadratura. Su Atlas Cloud vi si accede tramite un'unica chiave, con la coerenza del soggetto e la fisica migliorata che mantengono coerenti le riprese lunghe.

Visualizza Famiglia

Wan 3.0

L'API Wan 3.0 è la generazione successiva della famiglia di video Wan di Alibaba, creata per spingere la generazione di formati lunghi, il controllo multi-riferimento e la qualità audiovisiva a nuovi livelli. Atlas Cloud ospita già Wan 2.7, 2.6 e 2.5, e Wan 3.0 funziona sulla stessa chiave unificata senza alcuna configurazione separata. Inizia a costruire oggi stesso. Scorri verso il basso fino alla vetrina per vedere cosa è in grado di creare Wan 3.0.

Visualizza Famiglia

MiniMax H3

L’API MiniMax H3 rende disponibile il modello video multimodale generico di MiniMax, che interpreta testo, immagini, video e audio come un unico contesto, anziché come attività separate. I clip durano da 5 a 15 secondi a 24 FPS, con rapporti d’aspetto da 21:9 a 9:16, e un singolo prompt può sostituire personaggi, cambiare sfondi, riscrivere dialoghi o clonare una voce da una clip di riferimento. Atlas Cloud offre tutto tramite un unico endpoint compatibile con OpenAI. Inizia a sviluppare oggi stesso.

Visualizza Famiglia

Seedream 5.0 Pro

L'API Seedream 5.0 Pro offre agli sviluppatori il modello di editing delle immagini controllabile di ByteDance su Atlas Cloud. Posiziona le modifiche con precisione tramite ancore e coordinate, separa le immagini in livelli modificabili, fonde più riferimenti e abbina colori e materiali esatti, con testo multilingue a 2K e 3K. Su Atlas Cloud puoi accedervi tramite una sola chiave!

Visualizza Famiglia

Seedance 2.0

L'API Seedance 2.0 ti offre l'accesso in produzione al modello video multimodale di ByteDance: input quadrimodali (testo, immagine, video, audio) e un sistema "Universal Reference" leader del settore che blocca la composizione, i movimenti di macchina e le azioni dei personaggi tra le diverse inquadrature. Integra un controllo di livello registico con una sola chiamata API, una tariffa fissa di $0,09/s, chiave istantanea e nessuna lista d'attesa, il tutto supportato da uptime e conformità di livello enterprise. Seedance 2.0 Native 4K è ora disponibile!

Visualizza Famiglia

GPT Image 2

L'API GPT Image 2 offre agli sviluppatori l'accesso all'ultimo modello di immagini di OpenAI, il successore di GPT Image 1.5. Genera e modifica immagini con un rendering accurato del testo nei caratteri latini e CJK, oltre a una solida composizione per poster, mockup e infografiche. Su Atlas Cloud puoi accedervi tramite un'unica API unificata insieme a oltre 300 modelli, con crediti gratuiti, un tempo di attività del 99,99% e nessuna verifica dell'organizzazione OpenAI richiesta.

Visualizza Famiglia

Gemini Omni Flash

La Gemini Omni API porta nel tuo stack il modello multimodale di generazione ed editing video di Google DeepMind, presentato a Google I/O 2026. Gemini Omni fonde il motore di ragionamento di Gemini con i media generativi, accettando qualsiasi combinazione di testo, immagini, video e audio per produrre output coerenti e fondati sulla conoscenza. Perfeziona i risultati con una conversazione naturale: sostituisci oggetti, riscrivi scene e cambia stile, mentre fisica, personaggi e continuità restano intatti. Atlas Cloud offre l'intera gamma Gemini Omni Flash — text-to-video, image-to-video con fino a 7 immagini di riferimento e reference-to-video — tramite un'unica API unificata, con prezzi trasparenti al secondo a partire da $0.112 e senza abbonamento. Inizia a sviluppare oggi stesso.

Visualizza Famiglia

Grok Imagine

L'API Grok Imagine supporta i modelli di immagine, video e sintesi vocale di xAI, da Image 2.0 a Video 1.5 e xAI TTS v1. Genera immagini statiche 1K o 2K su 14 proporzioni d'aspetto, crea scene fino a 15 secondi di movimento 1080p, guida gli scatti con fino a 7 immagini di riferimento, o narrarli in 20 lingue. Atlas Cloud esegue ogni modalità su un singolo endpoint, con prezzi pay-as-you-go da $0,02 per immagine e $0,05 al secondo. Inizia a sviluppare oggi.

Visualizza Famiglia

Google

I modelli creativi più potenti di Google sono tutti disponibili su Atlas Cloud. Veo 3.1 offre la generazione di video cinematografici, Nano Banana 2 alimenta la creazione di immagini ad alta fedeltà e Gemini porta l'intelligenza multimodale in ogni flusso di lavoro. Accedi alla suite completa di modelli Google tramite una singola API key con disponibilità Day-0 e prezzi a consumo (pay-as-you-go).

Visualizza Famiglia

Seedance 2.0 Mini

Seedance 2.0 Mini porta la generazione video multimodale di ByteDance nei flussi di lavoro in cui velocità e costi sono fondamentali. Offre le capacità principali di Seedance 2.0 con un impatto minore: generazione più rapida, costi inferiori per video e la stessa integrazione API che utilizzi già. Per i team che gestiscono pipeline ad alto volume o prototipazione su larga scala, Mini è l'opzione predefinita pratica.

Visualizza Famiglia

ByteDance

Dalla generazione di video cinematografici alla creazione di immagini ad alta fedeltà, i modelli più potenti di ByteDance sono disponibili su Atlas Cloud. Esegui Seedance e Seedream su larga scala con i prezzi di inferenza più bassi e zero costi generali di infrastruttura.

Visualizza Famiglia

Alibaba

Atlas Cloud riunisce l'intera linea di modelli di Alibaba in un'unica API: Qwen per attività linguistiche e di immagine, Wan per la generazione di video fino a 1080p. Accedi a ogni modello in modalità pay-as-you-go senza abbonamenti. L'API di Alibaba è disponibile tramite una singola base URL utilizzando il tuo attuale client compatibile con OpenAI.

Visualizza Famiglia

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli