一個創意團隊需要在週五前交出六張連貫的人物動作視覺畫面。草稿影像很容易產生。但要讓一個人的姿勢、腳踏車的方向或工作場景在第十次修改時依然可用,才是視覺管線真正展現價值的地方。
直接的答案是:把 MAI Image 2.6 API 當作一個路由問題。用 Flash 探索人物場景,然後將選定的一張草稿或已核准的參考影像送入標準模型,進行一次受控的精修。評估這條路線的標準是每輪執行產出多少已核准資產,而不是第一張影像有多驚豔。
本指南以河畔自行車騎士、陶瓷工作坊和巴黎夜間散步三個案例來驗證這套邏輯。生成的場景有助於創意發展,但不能作為真實人物身分、當前地點或真實事件的依據。
重點摘要
- Flash 用於有限的探索;標準模型用於最終精修。
- 在批次作業前先測試保真度、留白和比例變更。
- 一次編輯只應變更一個類別的細節。
- 成本指的是每項已核准資產所需的執行次數,而非名目上的單張影像價格。

MAI Image 2.6 API 主視覺:一名成人自行車騎士在早晨經過河畔花市
一個虛構的旅遊生活風格場景,作為受控構圖測試之用。請勿將其呈現為真實人物或當前地點的依據。
完成的騎士畫面在任何人撰寫標題前,提供團隊四項可檢查的重點:可信的騎乘姿勢、明確的腳踏車方向、雙手與把手之間的穩定接觸,以及足夠的留白空間供日後加入文案。這張畫面刻意保持聚焦,目的是暴露偏差,而不是用擁擠的人群或裝飾性佈景來掩蓋。
這張畫面背後的路線也很單純:Flash 先產生一組少量的構圖候選,然後將選定的畫面送入影像編輯,在保留騎士、腳踏車與攝影機關係的同時,只改善環境。這個交接過程是場景製作工作流程中可重複的部分。
為什麼 MAI Image 2.6 API 炙手可熱,而初次嘗試卻容易失敗
為什麼 MAI Image 2.6 API 備受關注
Microsoft 將 MAI-Image-2.6 定位為精準選項,而 MAI-Image-2.6-Flash 則用於對延遲敏感、高吞吐量的工作。2026 年 9 月 4 日的公告指出,兩者都支援多影像參考編輯、網頁接地(web grounding)和動態長寬比;公告中也引用了當時的 Arena 與 Artificial Analysis 排名。這些排名和速度數據是當時的宣稱,並非永久事實(Microsoft AI 發布文章,2026 年 9 月)。
對 API 團隊來說,最有用的是控制面。文字轉影像和影像轉影像涵蓋了從新視覺方向到選定來源影像的常見交接流程。Microsoft Foundry 將 2.6 兩種變體列為公開預覽(Public Preview),支援單一 PNG 輸出、32K 提示詞上下文、每邊最小 768 像素,以及總輸出面積上限 1,048,576 像素(Microsoft Foundry 文件,2026 年 9 月)。
公開預覽階段需要營運上的審慎。預覽功能可能會變動,且在 Foundry 文件中不附帶 SLA。請將網頁接地視為情境輔助,而非地點、商業主張、日期或人物身分的權威依據。
四個應優先測試的 MAI Image 2.6 API 失敗模式
角色漂移(character drift)會表現為手部位置改變、腳踏車方向錯誤,或騎士多出一隻手臂。修正方式是建立一份簡短的「必須保留」清單,然後逐項與來源比對驗證。
指令衝突發生在單一提示詞同時要求保留人物、替換場景、變更攝影機、加入文字排版並改變動作時。請將這種情況拆分成多次編輯,一次編輯只改變一類事物。
文字即使看起來可讀,仍可能不精確或無法使用。請在後續階段使用受控的設計工具加入價格、優惠、日期、認證、商標和 CTA 文案,不要讓影像模型自行編造任何法律相關文字。
當團隊沒有記錄淘汰原因就不斷重試時,看似省錢的路線反而會變成最昂貴的路線。請為探索性執行設定上限,記錄每個候選失敗的原因,並且只將勝出者推進到最終階段。
MAI Image 2.6 API 工作流程:Flash 草稿、最終主檔
將兩種變體當作小型生產線中的工序,而不是一場排名競賽。
| 工作階段 | 建議模型 | 任務 | 執行規則 | 成本欄位 |
|---|---|---|---|---|
| 概念探索 | MAI Image 2.6 Flash | 測試構圖、光線、留白 | 每次執行只變更一個變數 | 發布前記錄當下每張影像報價 |
| 最終場景 | MAI Image 2.6 | 產出一張高保真度主檔 | 只精修一次已核准的草稿或參考影像 | 記錄模型頁面價格與日期 |
| 受控編輯 | MAI Image 2.6 編輯路線 | 保留人物、姿勢、動作或場景細節 | 明確標示保留/變更/不得新增 | 分別檢查輸入影像與輸出的計費方式 |
| 批次變化 | MAI Image 2.6 Flash | 將已驗證的方向重新排版或在地化 | 先試行小批次並記錄淘汰原因 | 檢視已核准資產的單位成本 |
供應商的 Foundry 上市定價以 Token 計費,其中 Flash 的文字輸入起價為每百萬 Token 1.75 美元,因此這不是 Atlas Cloud 的單張影像報價(Microsoft Foundry 上市與定價文章,2026 年 9 月)。
在 2026 年 9 月 11 日的發布檢查中,Atlas 線上模型目錄並未揭露已驗證的英文 MAI Image 2.6 或 Flash 詳細路線。因此本文不會虛構模型 ID、價格、折扣、最大 UI 解析度或參考影像費用。在交付整合之前,請查閱當下的 Atlas Cloud 模型目錄,並使用其中揭露的確切路線、輸入項目和報價。當團隊想比較線上路線與其他已核准的鄰近選項時,單一瀏覽器工作區確實方便,但正式生產來源仍以當日可取得的頁面為準。
MAI Image 2.6 API 教學:建立三個符合品牌調性的視覺畫面
步驟 1:使用 Flash 草擬河畔騎乘場景
使用 Flash 進行四次構圖測試。固定騎士、腳踏車和行進方向,只變更背景色溫或攝影機距離。選擇騎乘姿勢最清晰、右上角留白最乾淨的畫面,而不是最豐富的畫面。
plaintext1Create an editorial travel photograph of one young adult woman riding a vintage bicycle through a quiet European riverside market in early morning. She is mid-motion, turning her head toward a flower stall while one hand steadies a small paper bag in the bicycle basket. Sunlight enters from the left through plane trees, casting dappled shadows across wet cobblestones. Include a softly blurred foreground bicycle wheel, leading lines from the riverside path, muted sage green, warm cream, and terracotta color palette, natural fabric texture and realistic skin detail, cinematic 35mm documentary photography. Leave open, uncluttered space in the upper-right third. No logos, readable text, watermarks, duplicate people, distorted hands, or extra limbs.
選擇 16:9,使用已驗證模型頁面上提供的最高線上 16:9 設定,每次執行輸出 1 張。如果 API 需要明確的尺寸,請使用發布的像素面積限制內的值,例如 1024 × 768 或受支援的 16:9 預設值,而不是將未經驗證的 1.5K 宣稱直接複製到程式碼中。

真實的 MAI Image 2.6 Flash 遊樂場(playground)執行完成輸出,對應河畔自行車騎士提示詞
騎乘場景構圖測試的執行完成擷圖。在重現之前,請在線上頁面確認模型名稱、採用的比例、解析度和提示詞版本。
步驟 2:將勝出草稿轉為最終動作場景
將選定的草稿上傳作為編輯來源。這裡唯一的工作是環境精修。保留騎士、腳踏車和動作是具體指令,因此請重述他們的姿勢、方向、比例、攝影機角度和位置。
plaintext1Use the uploaded image as the source of truth. Preserve the same adult rider, bicycle frame, bicycle direction, riding posture, hand placement, basket, camera angle, and position in the frame. Refine only the environment: make the wet cobblestones more tactile, improve the dappled left-side morning light and natural wheel shadows, and keep the upper-right copy space uncluttered. Do not add text, logos, watermarks, extra people, a second bicycle, distorted hands, or extra limbs.
選擇 16:9 以及模型頁面上最高且已驗證的 16:9 設定。將騎士姿勢、腳踏車幾何、手部位置、行進方向和文案空間當作獨立的檢查項目。任何一項失敗,都意味著應縮短編輯提示詞並重新執行編輯,而不是疊加更多的修復要求。

真實的 MAI Image 2.6 標準編輯遊樂場執行完成輸出,保留了騎士與腳踏車方向
編輯執行完成擷圖:保留的騎士與腳踏車幾何、精修後的街道質感,以及保留的文案空間,皆在生成影像外側標示。
步驟 3:使用 Flash 建立原生直式社群場景
如果線上標準編輯頁面沒有提供 9:16,請勿將強制裁切描述為編輯輸出。請改用 Flash 生成原生直式場景。維持相同的場景摘要,但讓新的構圖明顯是直式的,而不是水平草稿的拉伸或加邊複製。
plaintext1Create a genuinely native vertical 9:16 editorial travel photograph of one young adult woman riding a vintage bicycle through a quiet European riverside market in early morning. Use a slightly elevated street-level viewpoint. Show the full bicycle and both wheels, with the rider traveling diagonally from the lower-left toward the center. Extend the scene upward through the frame with plane-tree canopy, a flower stall, wet cobblestones, and a visible strip of river at the far right. Keep the rider within the lower 45 percent of the frame. Leave the upper-right 35 percent as clean, softly lit open space for later copy. Sunlight enters from the left through plane trees, casting dappled shadows across the street. Use muted sage green, warm cream, and terracotta color palette, natural fabric texture and realistic skin detail, cinematic 35mm documentary photography. Do not create a crop, resize, padded canvas, or close duplicate of a horizontal composition. Do not add text, logos, watermarks, extra people, a second bicycle, distorted hands, extra limbs, or cropped wheels.
選擇 MAI Image 2.6 Flash、9:16 以及最高且已驗證的直式設定。凡是拉伸腳踏車、裁切到手部或輪子、將影像變成加邊的水平裁切,或失去接地陰影的輸出,都應拒絕。這些是結構性錯誤,而非美學偏好。

真實的 MAI Image 2.6 Flash 遊樂場輸出,對應原生直式河畔騎乘場景
這項直式測試旨在確認 Flash 能否以原生 9:16 建立動作場景,且不會出現變形的動作、人為加邊或意外的裁切。
步驟 4:執行陶瓷工作坊參考影像測試
第二個案例測試兩張不同的參考影像:一張自有產權的陶瓷工作坊參考照片,以及一張已授權的成人動作姿勢參考。請明確說明哪張影像控制哪個屬性。這樣的區隔能為 QA 提供一份實用的比對清單。
plaintext1Use reference image 1 as the source of truth for the ceramic workshop's pale green tiled wall, wood workbench, clay tools, and warm window light. Use reference image 2 only for one adult ceramic artist's leaning working posture. Create a documentary photograph of the same adult shaping a large wet clay bowl on a spinning wheel, captured mid-action as the clay rises between both hands. Preserve the workshop environment from reference 1 and the action posture from reference 2. Natural skin texture, clay-splattered linen apron, soft window light, documentary photography, 50mm lens, vertical 4:5 framing. Do not add logos, readable text, extra people, duplicate limbs, distorted hands, or a second wheel.
選擇 4:5、兩張參考影像上傳,以及頁面上最高且已驗證的設定。將磁磚顏色、工作檯、身體前傾、手部動作和轉盤方向與提供的參考影像比對。如果五項中有兩項偏離,就拒絕該輸出。請將原始參考影像及其授權紀錄與執行紀錄一併保存。

MAI Image 2.6 API 工作坊編輯功能示範,展示環境與動作參考影像及陶瓷成果
功能示範卡片:左側為各參考影像的職責,右側為生成的工作坊動作,底部為五點場景 QA。
步驟 5:執行巴黎夜間散步構圖測試
第三個案例從物件保留轉向場景構圖。Flash 產生 3 張水平草稿;標準精修只保留給那一張能呈現清晰可辨的艾菲爾鐵塔、並留下可用左上角標題區域的草稿。
plaintext1Create a cinematic travel photograph of one adult traveler walking along a quiet Paris side street at blue hour, seen from behind at a natural walking pace. The Eiffel Tower is visible in the distance between elegant stone buildings, warm window lights are beginning to glow, and the deep blue sky has soft clouds. Include a subtle rain sheen on the pavement and a small out-of-focus café awning in the foreground. Use leading lines from the street, warm-cool color balance, realistic fabric movement, cinematic photographic realism, 35mm lens, horizontal 16:9 composition. Keep the Eiffel Tower clear but not oversized. Reserve clean dark-sky negative space in the upper-left third for later headline placement. Do not include logos, watermarks, prices, dates, readable text, maps, vehicles, or extra people.
選擇 16:9 以及最高且已驗證的水平設定。請將輸出僅視為氛圍概念。它不能作為地圖、交通公告、活動列表或巴黎的當前寫照。任何出現在其旁的地點主張,仍需由人工審核把關。

MAI Image 2.6 API 巴黎夜間散步構圖功能示範,展示提示詞與生成的旅遊場景
功能示範卡片:提示詞指定單一旅人的動作、地標層級與標題空間;結果以行銷活動概念來評估,而非旅遊資訊。
MAI Image 2.6 API 變化應用與生產 QA
以下三種較安全的變化應用,可在保留來源真實場景的同時,只改變其交付情境:
- 將同一名已核准的騎士放入另一種天氣條件,同時鎖定騎士、腳踏車方向和手部位置。
- 將同一名已核准的陶瓷工作者放入新的裁切構圖,同時鎖定前傾角度、手部動作、轉盤方向和工作坊細節。
- 將同一個巴黎散步概念重新調整為新的比例,同時將生成的城市影像視為氛圍而非事實。
在創意素材離開測試資料夾之前,請使用這份淘汰檢查清單:
- 針對人物,確認成年狀態、肢體數量、手部、皮膚細節,以及任何隱含的身分。
- 針對動作場景,將姿勢、接觸點、行進方向、道具,以及場景中唯一預期的變更,與已核准的來源進行比對。
- 在影像 QA 之後,以手動方式加入所有價格、日期、折扣、認證、商標和 CTA。
- 只上傳你擁有或獲准使用的參考影像。
將勝出的提示詞以版本化模板的形式放入應用程式。不要將猜測的 MAI Image 2.6 模型 ID 寫死。請在實作時從線上模型詳細頁面複製目前的 ID、端點、輸入欄位名稱和限制。每次執行結果都保存 prompt_version、reference_asset_id、model、ratio、resolution、cost 和 qa_verdict。發布前,請查閱線上模型路線與報價,而不是依賴部落格文章或過時的程式碼範例。
MAI Image 2.6 API 成本、權利與部署注意事項
請在發布當日填寫這份營運表格,以避免草稿價格變成生產承諾。
| 成本項目 | 發布時填寫 | 驗證點 |
|---|---|---|
| Flash 文字轉影像 | $X.XXXX / image,如有顯示折扣條件則一併列入 | Atlas 模型目錄與 Flash 詳細頁面 |
| 標準文字轉影像 | $X.XXXX / image | 標準模型詳細頁面 |
| 標準編輯 | $X.XXXX / image,包含參考影像計費 | 標準模型詳細頁面 |
| 三個案例的實際成本 | 總執行次數 × 當日價格 ÷ 已核准資產 | 執行紀錄與當下報價 |
Flash 只有在限制重試次數並記錄淘汰原因時,才能降低探索成本。可發布資產的單位成本比最低的名目單張影像價格更重要。Foundry 以 Token 計費的上市價格是實用的供應商背景資訊,但無法回答其他供應商每張輸出的收費標準。
請在作業中附上一份簡短的法律與安全備忘:切勿將生成內容呈現為真實人物的身分、當前地點的描繪、事件紀錄、認證、價格、庫存主張或客戶推薦。請保存所有參考媒體的來源檔案、授權與 QA 紀錄。並遵守平台內容規範,以及廣告投放地區適用的廣告揭露規定。
常見問題
MAI Image 2.6 API 有什麼用途?
MAI Image 2.6 API 支援文字轉影像與影像轉影像工作流程。本文的三個案例涵蓋騎乘動作場景、工作坊參考測試和旅遊構圖測試。它們呈現的是不同的生產風險,而不是把一張好影像變成對所有視覺任務的籠統主張。
MAI Image 2.6 與 MAI Image 2.6 Flash 有什麼差別?
Microsoft 將 Flash 定位為快速迭代與高吞吐量工作,而標準模型則是針對最終資產與更高要求精修的精準選項。請將此視為路線選擇的指導原則,然後用你自己的參考影像和 QA 標準,測試目前線上的實際實作。
MAI Image 2.6 API 支援影像編輯嗎?
支援。Microsoft Foundry 文件記載兩種 Preview 2.6 變體都具備文字轉影像與影像轉影像功能。由於 Preview 的可用性與產品介面可能會變動,請在整合前確認目前啟用的供應商路線、模型 ID、接受的影像格式與限制。
如何在 MAI Image 2.6 API 中保持人物與動作的一致性?
從一張已核准的來源影像開始,列出所有要保留的特徵,說明一類變更,並在發布前將輸出與來源進行比對。在本指南中,騎士姿勢、腳踏車方向、手部位置、攝影機關係和接觸陰影都是獨立的檢查項目。
MAI Image 2.6 API 的費用是多少?
Foundry 的上市定價以 Token 計費。實際的單張影像價格、參考影像計費與折扣會因供應商而異,且可能隨時變動。請確認當下的報價,並以已核准資產為基準計算成本,而不是以總輸出數量為基準。
可以在廣告中使用 MAI Image 2.6 的影像嗎?
只有在品牌、法律與來源真實性 QA 完成後,才能使用已核准的概念。不要讓生成的視覺內容虛構真實身分、事件、地點主張、認證、日期、價格、庫存或推薦見證。這道最終審查是安全的 MAI Image 2.6 API 生產工作流程的一部分。






