一張包含 16 個姿勢的圖需要進行播放檢查:手部移動是否自然、雙腳是否保持貼地、最後一幀是否與第一幀重新銜接?
這些 GPT Image 2.5 靜幀動畫測試結果正在等待下方所述的基準測試。生成環境目前顯示的是存取登入頁面。尚未測得任何動畫品質結果、通過數量或模型勝出者。這份草稿保留了完整的實驗與重現說明;它不是一份已完成的結果報告。
在此,_靜幀動畫_是指生成一張包含連續靜止幀的圖、提取其單元格,並依序播放這些單元格。
這是我們的工作用語,不是經官方驗證的功能名稱。動畫風格的靜態圖是單張圖片;連續幀圖包含多張圖片;原生影片生成則透過不同的工作流程產生動態。
規劃的比較涵蓋五項任務、兩個模型,以及每個組合三次獨立請求。GIF 組裝在影像生成後於本機進行。測量在沒有新幀或隱藏修復的情況下,有多少動作得以保留。
重點摘要
- 基準測試請求尚未完成任何項目;無法取得的測量數據不應被解讀為模型失敗。
- 應將連續轉場、接觸點與迴圈接縫的判斷,與角色外觀分開評估。
- 編列預算時須涵蓋生成以外的提取與檢查工作,並將原始播放與修復版本分開保存。
我們測試了什麼,以及如何評分
此基準測試指定用於 GPT Image 2.5 Sunburst Text-to-Image 與 GPT Image 2.5 Flare Text-to-Image。生成預計在已登入的 Atlas Cloud 測試環境中執行。其等待時間(若可測量)描述的是該環境與工作階段,而非生產環境服務的承諾。
| 控制項 | 預先註冊設定 |
| 輸入 | 每個對應任務使用相同的文字提示詞;無參考圖像 |
| 影像輸出 | PNG、2048×1152、quality=max、n=1 |
| 背景 | 揮手、倒咖啡、旋轉、踩踏使用不透明;走路使用透明 |
| 重複次數 | 每項任務與每個模型各三次獨立請求;共 30 次請求 |
| 版面配置 | 四欄四列;目標單元格尺寸 512×288 |
| 提取 | 由左至右,再由上至下;保留全部 16 個名義裁切區塊 |
| 播放 | 目標每幀 125ms、8fps、約兩秒 |
| 處理 | 不進行插值、重新排序或穩定化處理,也不刪除失敗幀 |
一張 2048×1152 的圖,每個等分單元格提供 512×288 像素。放大 GIF 無法還原這些單元格中不存在的細節。480 個目標單元格屬於 30 次請求,因此它們是相關的觀察值,而非 480 次獨立試驗。
針對每張圖,檢查版面配置、身分一致性、15 個相鄰轉場,以及任務特定的物理關係。迴圈任務還需加上 16→1 的轉場。合格的原始圖必須通過所有適用的檢查;幀層級的計數維持獨立。將模糊或被遮擋的細節記為未解決,而不是給予無依據的通過。
執行時依序交替使用 Sunburst 與 Flare,每次請求各自獨立。顯示每組中第一個完成的請求,並保留先前失敗的請求。完成但動作不正確的影像仍保留在資料集中。三次重複無法確立整體成功率。
先前發表的一項實驗生成了十組關鍵幀格線,並記錄了不均等的面板邊界。其分鏡腳本與設定與我們不同,因此其結果僅供背景參考。(Genflick,2026 年 9 月。)
GPT Image 2.5 靜幀動畫測試結果:毛毛蟲變蝴蝶
變形序列用於測試模型能否在主題改變狀態的同時,維持一個小世界的穩定。黏土毛毛蟲從同一根彎曲樹枝下方開始,垂下身體、結成繭,最後羽化為蝴蝶。攝影機固定在桌面高度,讓樹枝、桌面邊緣與背景明確扮演參考點的角色。
第一項檢查追蹤毛毛蟲從樹枝下彎曲的姿勢,轉變為垂掛姿勢的過程。其身體應以小幅步進移動,同時樹枝分叉處、基部與附著點保持在同一位置。在孤立幀中可辨識的毛毛蟲,並不能證明牠沿著連續路徑進入繭中。
序列中段是場景必須特別保持穩定的地方。隨著動作推進,繭的形狀可以改變,但樹枝不應變長、移動或出現新的質感。除了主題之外,也要留意地平線與樹枝基部,因為背景漂移可能讓真正的姿勢變化看起來像是攝影機移動。
最後幾幀出現蝴蝶。檢查牠是否從繭的清晰位置羽化而出,以及其尺寸相對於樹枝是否保持合理。當觀看者能將一個保持不變的場景與一個持續推進的主題進行對比時,變形過程會更加清晰,而不是需要在重建的場景之間推斷變化。
**目前證據:**此案例提供了簡短單向變形的清晰視覺範例。它不提供符合資格的基準測試分數、通過數量或模型之間的比較。

黏土毛毛蟲在固定的樹枝下變成蝴蝶
請將樹枝、桌面與鎖定的攝影機,與毛毛蟲變蝴蝶的變化分開檢查。
此序列應向前播放。反向播放會將羽化完成的蝴蝶變回繭,削弱原本的動作意圖。正式製作流程應保留每一張原始靜態幀,以便任何跳動都能被定位,並在對應的狀態下修正。
GPT Image 2.5 靜幀動畫測試結果:DNA 連續性比較
旋轉的 DNA 雙螺旋是結構連續性的精簡測試。動作可以很簡單,但物體具有容易察覺漂移的重複特徵:兩條外側軌道、間距均勻的橫桿、底部尖端,以及物體下方的柔和陰影。這些錨點在序列推進時應保持彼此的相對關係。
並排呈現方式讓相鄰轉場更容易檢查。先從輪廓開始:方向改變是預期中的,但螺旋高度、寬度或扭轉的突然變化,並不屬於受控旋轉的一部分。接著追蹤橫桿與底部尖端,確認物體是否保持為一個連貫的結構。
在這裡,光線與構圖和幾何形狀同樣重要。如果陰影改變方向,或螺旋向側面滑動,觀看者就無法分辨明顯的移動是來自物體旋轉、攝影機漂移,還是重建的場景。穩定的背景之所以有用,正是因為它消除了這種模糊性。
這類範例應逐幀判斷,而不是挑選最出色的一張靜態圖。一張吸引人的最後影像可能隱藏了中段的斷裂轉場。請記錄第一對出現不符合預期動作之形狀、位置或光線變化的相鄰幀。
**目前證據:**此案例展示了如何檢查短物件序列的形狀、位置、光線與構圖連續性。它不是整體效能分數,也不是模型排名的主張。

並排的綠色 DNA 序列,用於連續性檢查
在相鄰幀之間追蹤外側軌道、橫桿、底部尖端、構圖與陰影。
只有當最終姿勢能與最初的姿勢乾淨地銜接時,序列才能迴圈播放。如果結束狀態的方向不同,請以向前播放的序列呈現,而不是用乒乓效果隱藏重置。
GPT Image 2.5 靜幀動畫測試結果:牡丹綻放序列
牡丹綻放測試的是整個物體上的受控變化。花朵從緊閉的花苞開始,經過數個花瓣狀態逐步綻放,最後盛開。預期的變化幅度很大,因此需要明確說明應保持固定的元素:花莖、葉片著生點、攝影機、背景與光線。
先沿著花莖從土線追蹤到花頭。花莖應保持直立,並在花瓣展開時維持相同粗細。葉片應保持在相同的節點上;如果葉片移動到花莖的其他位置,代表物體被重建,而非連續綻放。
接下來檢查花瓣。花瓣的開展應從花苞向外逐步推進,而不是直接從閉合跳到完全綻放。盛開的花朵可以變大,但花心應保持與花莖對齊。花瓣顏色、邊緣質感或光線方向的突然變化,應記入轉場筆記。
深色背景與固定視角讓這種單向變化易於判讀。它們也與花朵本身形成有用的對比:花瓣可以演變,但周圍的世界不應改變。這種區分是檢視產品揭曉、角色反應與其他漸進狀態變化的基礎。
**目前證據:**此案例展示了具有穩定場景錨點的清晰單向展開動作。它不能確立合格的基準測試結果,也不能保證其他提示詞的可靠成果。

牡丹從花苞到盛開的綻放過程
在花莖、葉片著生點、背景、攝影機與光線保持穩定的同時,檢查花瓣的進展。
此序列應播放一次。乒乓迴圈會讓花朵再次閉合,並添加不屬於原本綻放意圖的動作。將原始靜態幀與最終 GIF 並列保存,讓審查者能隔離任何故障步驟,而不致與壓縮偽影混淆。
其他地方獨立進行的重複測試,也已分別評估提示遵循度與一致性,結果因任務而異。他們的評分標準並不為本文提供動畫分數。(PromptFrenzy,2026 年 9 月查閱。)
重現工作流程並計算實際成本
- 開啟模型並確認設定。
第一個請求使用 Sunburst 遊樂場,對應的請求使用 Flare 遊樂場。選擇最高品質、2048×1152、PNG 與單張影像。A、B、C、E 設定為不透明;D 設定為透明。
官方影像指南記載了最高品質、自訂尺寸,以及 PNG 或 WebP 透明格式。這些輸出控制並不保證能產生均勻分割的幀圖。(OpenAI,2026 年 9 月查閱。)
離開每個控制項後,請確認所選數值。保留報價與實際請求設定。下方的完成畫面截圖保留給真實輸出使用;模型頁面的範例影像不能證明實驗確實執行過。
- 在兩個模型之間使用相同的提示詞,不要改寫。
提示詞 A:揮手
plaintext1Create one 2048x1152 image containing exactly 16 consecutive animation frames arranged in a strict 4-column by 4-row grid, read left to right and then top to bottom. Each cell is exactly 512x288 pixels. No gutters, borders, captions, numbers, or text. 2 3Show the same adult office worker seated at a plain wooden desk in every frame. They have short dark hair, a teal long-sleeved shirt, and no accessories. Use natural window light, a plain light-gray wall, and a locked eye-level medium camera shot. Keep the face, clothing, desk, background, lighting, and camera identical. 4 5Animate one greeting: frames 1-4 gradually raise the right hand from the desk; frames 5-10 show one small side-to-side wave; frames 11-15 gradually lower the hand; frame 16 returns to the resting pose. Keep the left hand on the desk. Preserve five fingers and the same sleeve length. The transition from frame 16 to frame 1 should be continuous. Advance the action by small readable increments.
提示詞 B:倒咖啡
plaintext1Create one 2048x1152 image containing exactly 16 consecutive animation frames in a strict 4-column by 4-row grid, read left to right and then top to bottom. Each cell is exactly 512x288 pixels. No gutters, borders, captions, numbers, or text. 2 3Use a locked side-view close-up of a clear glass cup on a wooden kitchen counter. One adult hand holds a small stainless-steel coffee pot above and to the left of the cup. Use soft daylight and keep the camera, counter, cup, hand, and pot design unchanged. 4 5Frames 1-3 show the pot tilting toward the empty cup. Frames 4-11 show a continuous narrow stream of black coffee entering the cup while its liquid level rises progressively. Frames 12-14 show the pot returning upright and the stream stopping. Frames 15-16 show the cup half full and the upright pot held still. Keep the stream connected to the spout while pouring. Do not spill or change the cup shape. This is a one-way action, not a loop. The coffee must remain in the cup at the end.
提示詞 C:產品旋轉
plaintext1Create one 2048x1152 image containing exactly 16 consecutive product-rotation frames in a strict 4-column by 4-row grid, read left to right and then top to bottom. Each cell is exactly 512x288 pixels. No gutters, borders, captions, numbers, logos, or text. 2 3Show one unbranded white low-top canvas sneaker with six pairs of eyelets, white laces, a thin navy stripe around the rubber sole, and a small red fabric tab centered on the heel. Place it on a neutral light-gray seamless surface. 4 5Keep the camera locked at product height with a slight downward view. Rotate only the shoe around a fixed vertical axis. Frame 1 is the front view. Each following frame advances the rotation by 22.5 degrees in the same direction. Frame 16 is at 337.5 degrees so the next frame can return smoothly to frame 1. Keep the shoe scale, rotation center, materials, eyelets, sole stripe, heel tab, and lighting consistent. Reveal physically plausible side, rear, and opposite-side views.
提示詞 D:走路循環
plaintext1Create one 2048x1152 transparent PNG containing exactly 16 consecutive animation frames in a strict 4-column by 4-row grid, read left to right and then top to bottom. Each cell is exactly 512x288 pixels. No gutters, borders, ground line, captions, numbers, or text. 2 3Show one full-body adult pedestrian in a clean, flat 2D game-prototype style, facing right in strict side view. The pedestrian has short black hair, a mustard jacket, navy trousers, and white shoes. Keep the character centered at the same horizontal position and the feet on the same baseline in every cell. Preserve the same character scale, clothing shapes, and colors. 4 5Create one complete in-place walking cycle. Frame 1 has the left foot forward at contact; frame 5 is a passing pose; frame 9 has the right foot forward at contact; frame 13 is the opposite passing pose. Fill all intervening frames with progressive motion. Frame 16 should lead naturally into frame 1 without repeating it. Keep the arms swinging opposite the legs and preserve left-right limb identity throughout.
提示詞 E:踩踏
plaintext1Create one 2048x1152 image containing exactly 16 consecutive animation frames in a strict 4-column by 4-row grid, read left to right and then top to bottom. Each cell is exactly 512x288 pixels. No gutters, borders, captions, numbers, or text. 2 3Show a full-body adult cyclist on a plain stationary exercise bicycle in strict side view. The cyclist wears a blue short-sleeved shirt, black shorts, and white shoes. Use a light-gray studio background and a locked camera. Keep the bicycle frame, saddle, handlebars, rider identity, clothing, and lighting unchanged. 4 5Animate exactly one complete crank revolution. Start with the visible near-side pedal at the top. Advance the crank by 22.5 degrees per frame in one consistent direction. Keep the opposite pedal 180 degrees away. Each shoe must remain attached to its own pedal, with the knees and hips moving plausibly. Keep both hands on the handlebars. Frame 16 should connect naturally to frame 1. Do not swap the legs, detach the feet, or deform the bicycle.
- 提取並檢查原始檔案。
儲存下載的 PNG,而非網頁縮圖。使用提供的本機腳本:
plaintext1python slice-grid.py sheet.png --rows 4 --cols 4 --out frames --fps 8
沖泡咖啡任務請加上 --once。腳本會儲存編號 PNG、GIF 與 JSON 裁切記錄。檢查記錄中的實際尺寸與 alpha 值,然後檢查每個裁切區塊是否含有相鄰面板的碎片。自動分割並不驗證圖示的邊界。
GIF 以百分之一秒為單位儲存延遲,因此無法在單一幀延遲中精確編碼 125ms。輔助腳本交替使用 120ms 與 130ms,為 16 幀保留總共兩秒的長度。記錄會揭露這種量化方式;PNG 序列仍可在其他地方進行精確的 8fps 播放。
- 將修正工作與原始序列分開。
| 問題 | 如何識別 | 本機處理可解決的範圍 |
| 不均勻的面板邊界 | 相鄰影像進入名義裁切區塊 | 手動分開裁切(若內容完整存在) |
| 錨點或尺寸漂移 | 固定場景點在單元格之間移動 | 在標示的修復版本中進行測量對齊 |
| 身分或幾何形狀變化 | 服裝、肢體或物體結構改變 | 裁切無法還原缺失的結構 |
| 錯誤的動作階段 | 姿勢順序跳過、反轉或重複 | 調整時間無法創造不存在的動作 |
| 物理矛盾 | 液體消失或雙腳脫離 | 需要超越原始提取的內容修正 |
分別記錄裁切、時間調整與修復的實際花費時間。保留兩個版本並描述每個操作。修復後的動畫可能適合專案使用,但原始圖仍然無法通過基準測試。
- 根據實際測量的用量計算成本。
截至 2026 年 9 月 15 日查閱時,模型目錄 顯示每張圖片約 $0.004 與 $0.003 的取整起價,兩個模型均標示 20% 折扣。這些是目錄起價。所選的最高品質設定需要單獨報價,且以 token 計價的結算方式可能有所不同。
| 成本欄位 | Sunburst | Flare |
| 規劃設定 | max、2048×1152、PNG | max、2048×1152、PNG |
| 所選設定的精確報價 | 未測量 | 未測量 |
| 實際帳單總額 | 未測量 | 未測量 |
| 已確認提交的基準請求數 | 0 | 0 |
| 合格圖數 | 未測量 | 未測量 |
| 每張合格圖的實際生成成本 | N/A | N/A |
| 裁切、時間調整與修復人力 | 未測量 | 未測量 |
只有當兩個數值都存在時,才將實際帳單生成成本除以合格圖數。如果沒有圖合格,請回報 N/A。將人力成本分開計算,或明確套用你自己的時薪。以起價相乘無法確立可用動畫的成本。
在檢查完整原始序列之後,使用你自己的主題執行相同的提示詞。最終的 GPT Image 2.5 靜幀動畫測試結果必須以下載的證據支持這項決定;這份受存取限制的草稿尚未確立任何結果。
常見問題
GPT Image 2.5 能否直接生成動畫 GIF?
此工作流程會請求 PNG 幀圖,並在本機組裝 GIF。影像輸出設定不應被描述為原生動畫或影片生成。每個展示的動作結果都必須標明其來源圖與處理方式,包括播放順序與延遲。
此測試中的『靜幀動畫』是什麼意思?
它是指在一張影像中生成連續的靜態幀,將其提取出來,並依序顯示。我們將其用作操作性的描述用語。它不是經官方驗證的模型功能名稱,單張動畫風格的圖片也不符合這項定義。
對於一致的動畫幀,Flare 或 Sunburst 哪個比較好?
這項比較尚未有結論,因為沒有任何基準請求完成。一旦取得結果,應針對所有三次請求逐項任務回報。圖內的身分一致性、轉場品質與物理連貫性需要分開檢查;單一選定的範例無法確立整體勝出者。
為什麼我的 sprite sheet 看起來一致,但播放時會抖動?
請檢查面板邊界、角色錨點、尺寸變化、動作階段與幀持續時間。外觀相似的靜態幀可能位於其單元格內的不同位置。在測試修正時保留原始的等尺寸裁切,這樣你才能判斷對齊是否有幫助,還是來源動作本身需要修改。
GPT Image 2.5 在此工作流程中是否比 GPT Image 2 有所改進?
此基準測試未包含同時進行的 GPT Image 2 對照組。因此它無法確立改進百分比、相對於該模型的速度優勢,或更低的可用動畫成本。外部實驗使用不同的提示詞與設定;它們提供的是背景脈絡,而非缺失的對照組。
建立一個可用動畫需要多少成本?
請使用每個已提交請求的實際費用,包括已計費的失敗請求,再加上檢查與修復輸出所需的工作。將生成費用除以符合你驗收標準的數量。在此處,精確設定的報價、結算方式與可用成果均未測量,因此目前尚無法提出合理的每個動畫數值成本。






