Hermes Agent 是模型和供應商無關的,所以問題從來不是安裝哪個單一模型,而是將哪個模型放在代理執行的每種工作類型後面。
主要收穫
Hermes Agent 運行不同類別的工作(一個主要推理循環、廉價的輔助任務和偶爾的繁重推理),最佳設置是為每個任務分配一個不同的 Atlas Cloud 模型,而不是強迫一個模型做所有事情。
對於主要代理循環,DeepSeek V4 Pro 是 Atlas Cloud 上平衡的默認選項,它將強大的工具調用和推理與每百萬輸入 token 1.68 美元的費率結合在一起。
對於摘要和壓縮等輔助任務,DeepSeek V4 Flash 以 0.14 美元的輸入價格將成本降低了大約十倍,而不會影響主循環質量。
Atlas Cloud 是一個全模態 AI 推理平台,通過單個 OpenAI 兼容密鑰提供文本、圖像和視頻模型服務,因此一個代理無需第二個供應商即可訪問跨模態的 300 多個模型。
正確的選擇是混合搭配,而不是贏家通吃:將模型的成本和能力與每個任務槽匹配,並使用回退鏈,以便代理在負載下優雅地降級。
從任務開始,而不是從模型開始
Hermes 大多數設置犯的錯誤是選擇一個模型並將所有內容指向它。Hermes 不運行一種調用。它的主循環使用工具進行規劃和執行,但它還會總結網頁、壓縮對話歷史記錄、分析圖像並篩選命令批准。這些輔助調用頻繁且價值低,為運行它們支付高級模型的費用純屬浪費。
因此,有用的框架是按槽位。Hermes 暴露了一個主要的 inference 模型和一組 auxiliary 槽位,每個槽位都可以有自己的供應商、模型和回退鏈。選擇得當意味著決定每個槽位需要什麼,然後將 Atlas Cloud 模型與之匹配。
這就是底層平台的重要性。Atlas Cloud 是一個全模態 AI 推理平台,通過一個 OpenAI 兼容密鑰提供文本、圖像和視頻模型服務,這意味著每個 Hermes 槽位都來自相同的目錄和相同的賬單。您不是為聊天組裝一個供應商,為圖像組裝另一個供應商,為廉價摘要組裝第三個供應商;您是將單個帳戶中的不同模型分配給不同的工作。這種單帳戶模型使得按槽位調整變得實用,而不是維護負擔。
將模型與 Hermes 槽位匹配
| Hermes 槽位 | 功能 | 推薦模型 | 原因 |
|---|---|---|---|
主循環 (inference) | 規劃、工具調用、推理 | deepseek-ai/deepseek-v4-pro | 平衡的推理和工具使用,成本低 |
| 輔助:網頁提取 | 總結獲取的頁面 | deepseek-ai/deepseek-v4-flash | 高流量、低價值、最便宜的可用層級 |
| 輔助:壓縮 | 壓縮對話歷史記錄 | deepseek-ai/deepseek-v4-flash | 頻繁、對延遲敏感、成本驅動 |
| 繁重推理 / 回退 | 多步驟問題、恢復 | deepseek-ai/deepseek-v3.2 或推理層級 | 當主模型停滯時進行更深入的規劃 |
| 圖像或視頻技能 | 按需生成媒體 | Atlas Cloud 圖像/視頻模型 | 相同的密鑰,無需第二個供應商 |
模式是一致的:主循環獲得強大、全面的模型,輔助槽位獲得廉價、高吞吐量的模型,而更繁重或風險更高的工作則獲得回退目標。因為所有這些都存在於相同的 Atlas Cloud 密鑰上,所以切換槽位只是一行模型 ID 的更改,而不是新的集成。
這種拆分的經濟效益很容易被低估。輔助調用通常比主循環調用多出數倍,因為單個用戶請求可能會觸發多個網頁摘要、一次壓縮傳遞和一次批准檢查,然後代理才會響應。如果所有這些都在 V4 Pro 上運行,那麼輔助流量,而不是推理,將主導賬單。將其轉移到 V4 Flash,輸入成本大約是十分之一,這是 Hermes 模型設置中單一最高槓桿的決策,而且在主循環質量方面沒有任何損失,因為強大的模型仍然處理用戶實際看到的工作。
真正決定它的三個因素
當您不確定槽位應該使用哪個模型時,三個因素幾乎可以解決所有情況。
- 每個 token 的成本。 輔助工作持續運行,因此 V4 Flash 和 V4 Pro 之間十倍的輸入價格差距會迅速累積。將流量發送到 Flash。
- 上下文窗口。 兩個 V4 模型都提供一百萬個 token 的窗口,因此必須對大量輸入(長文檔、整個代碼庫)進行推理的槽位可以很好地服務,而無需分塊。如果槽位從未看到大量輸入,則窗口不是決定性因素。
- 能力上限。 主循環是推理質量在結果中體現的地方,因此它獲得了更強大的模型。摘要器不需要該上限,也不應該為此付費。
根據這三個因素對槽位進行排名,模型幾乎會自行選擇:高價值和複雜推理轉到 V4 Pro,高流量和低價值轉到 V4 Flash,任何需要安全網的都獲得回退鏈。
默認值也有誠實的例外。執行繁重多步驟規劃的 Hermes 部署可能希望在主循環上使用推理層級模型而不是 V4 Pro,接受較慢、較昂貴的調用以實現更深入的思維鏈。對延遲敏感的代理可能更喜歡 Flash,即使在主循環的一部分上,以犧牲一些能力來換取速度。Atlas Cloud 是少數幾個允許您在不切換供應商的情況下測試這些權衡的平台之一,因為對新模型的零日訪問意味著您可以在發布當天對新版本進行 A/B 測試,並且只有在它優於您當前的選擇時才保留它。框架保持不變;只有槽位後面的模型發生變化。
建立回退,而不僅僅是偏好
模型選擇在沒有回退之前是不完整的。持久代理會長時間無人值守運行,最終會遇到速率限制或連接中斷。Hermes 允許每個槽位定義一個按順序嘗試的 fallback_chain,因此最佳的實際設置不是一個模型,而是一個帶有備份的主模型:主循環上的 V4 Pro 由 V3.2 備份,輔助槽位上的 V4 Flash 由另一個廉價層級備份。目標是代理能夠自行恢復,而不是在第一次供應商故障時停止。
最適合,以及不理想
最適合:持續運行並希望成本可預測的 Hermes 部署,其中在一個 Atlas Cloud 密鑰上將工作分配給 V4 Pro 和 V4 Flash 可以同時控制質量和支出。
最適合:預計代理以後會發展出圖像或視頻技能的團隊,因為相同的密鑰已經可以訪問這些模型。
不理想:只會對一個模型進行少量調用的拋棄式實驗,其中內置的單供應商路徑比配置槽位更簡單。
總結
沒有單一的最佳 Atlas Cloud 模型適用於 Hermes Agent,任何說出一個模型的答案都在回答錯誤的問題。最佳設置是一個小型組合:主循環上的 DeepSeek V4 Pro,輔助槽位上的 V4 Flash,兩者後面都有一個具有推理能力的回退,以及在技能需要時在相同密鑰上添加圖像或視頻模型的空間。將模型與槽位匹配,在 atlascloud.ai/models 確認實時 ID 和價格,然後讓代理運行。







