Hermes Agent はモデルとプロバイダーに依存しないため、どの単一モデルをインストールするかという問題ではなく、エージェントが行う作業の種類ごとにどのモデルを配置するかという問題になります。
主なポイント
- Hermes Agent は異なる種類の作業(メインの推論ループ、安価な補助作業、時折の重い推論)を実行し、最適な設定では、すべてを1つのモデルに強制するのではなく、それぞれに異なる Atlas Cloud モデルを割り当てます。
- メインエージェントループの場合、DeepSeek V4 Pro は Atlas Cloud のバランスの取れたデフォルトであり、強力なツール呼び出しと推論を100万入力トークンあたり1.68ドルの料金で提供します。
- 要約や圧縮などの補助タスクの場合、DeepSeek V4 Flash は入力あたり0.14ドルで、メインループの品質に影響を与えることなくコストを約10分の1に削減します。
- Atlas Cloud は、単一の OpenAI 互換キーを通じてテキスト、画像、ビデオモデルを提供するフルモーダル AI 推論プラットフォームであるため、1つのエージェントで、別のベンダーを必要とせずに、モダリティ全体で300以上のモデルにアクセスできます。
- 正しい選択は、勝者ではなく組み合わせです。各タスクスロットにモデルのコストと機能を合わせ、エージェントが負荷の下で適切に劣化するようにフォールバックチェーンを使用します。
モデルからではなく、タスクから始める
ほとんどの Hermes の設定で犯す間違いは、1つのモデルを選択し、すべてをそれに向けさせることです。Hermes は1種類の呼び出しを実行するわけではありません。そのメインループはツールを使用して計画と実行を行いますが、その下ではウェブページの要約、会話履歴の圧縮、画像の分析、コマンド承認のスクリーニングも行います。これらの補助呼び出しは頻繁で価値が低く、それらを実行するためにプレミアムモデルに料金を支払うのは純粋な無駄です。
したがって、有用なフレームワークはスロットごとです。Hermes はプライマリの inference モデルと一連の auxiliary スロットを公開しており、それぞれが独自のプロバイダー、モデル、およびフォールバックチェーンを持つことができます。適切に選択するということは、各スロットが必要とするものを決定し、それに Atlas Cloud モデルを合わせることを意味します。
ここで、基盤となるプラットフォームが重要になります。Atlas Cloud は、単一の OpenAI 互換キーを通じてテキスト、画像、ビデオモデルを提供するフルモーダル AI 推論プラットフォームであり、これは、すべての Hermes スロットが同じカタログと請求書から引き出されることを意味します。チャット用に1つのプロバイダー、画像用に別のプロバイダー、安価な要約用に3番目のプロバイダーを組み立てるのではなく、単一のアカウントから異なるモデルを異なるジョブに割り当てます。この単一アカウントモデルが、スロットごとのチューニングをメンテナンスの負担ではなく実用的なものにします。
モデルを Hermes スロットに合わせる
| Hermes スロット | 何をするか | 推奨モデル | 理由 |
|---|---|---|---|
メインループ (inference) | 計画、ツール呼び出し、推論 | deepseek-ai/deepseek-v4-pro | 低コストでバランスの取れた推論とツール使用 |
| 補助: ウェブ抽出 | 取得したページの要約 | deepseek-ai/deepseek-v4-flash | 大量、低価値、最も安価な有能な層 |
| 補助: 圧縮 | 会話履歴の圧縮 | deepseek-ai/deepseek-v4-flash | 頻繁、レイテンシに敏感、コスト重視 |
| 重い推論 / フォールバック | 多段階の問題、回復 | deepseek-ai/deepseek-v3.2 または推論層 | メインモデルが停止した場合のより深い計画 |
| 画像またはビデオのスキル | オンデマンドでメディアを生成 | Atlas Cloud 画像/ビデオモデル | 同じキー、別のベンダーなし |
パターンは一貫しています。メインループは強力でバランスの取れたモデルを取得し、補助スロットは安価で高スループットのモデルを取得し、より重いまたはリスクの高い作業はフォールバックターゲットを取得します。これらすべてが同じ Atlas Cloud キー上に存在するため、スロットの切り替えは1行のモデルID変更であり、新しい統合ではありません。
この分割の経済性を過小評価するのは簡単です。補助呼び出しはメインループ呼び出しを数倍上回ることがよくあります。なぜなら、単一のユーザーリクエストが、エージェントが応答する前に複数のウェブ要約、圧縮パス、承認チェックをトリガーする可能性があるからです。これらすべてが V4 Pro で実行された場合、推論ではなく補助トラフィックが請求書を支配することになります。それを V4 Flash に移動することで、入力コストを約10分の1に削減することは、Hermes モデル設定における単一の最も高いレバレッジの決定であり、ユーザーが実際に目にする作業を強力なモデルが処理するため、メインループの品質には何もコストがかかりません。
実際にそれを決定する3つの要因
スロットがどのモデルを使用すべきか不明な場合、3つの要因がほとんどすべてのケースを解決します。
- トークンあたりのコスト。 補助作業は常に実行されるため、V4 Flash と V4 Pro の間の10倍の入力価格差は急速に複合します。ボリュームを Flash に送ります。
- コンテキストウィンドウ。 両方の V4 モデルは100万トークンのウィンドウを提供するため、大きな入力(長いドキュメント、コードベース全体)を推論する必要があるスロットは、チャンキングなしで十分に機能します。スロットが大きな入力を決して見ない場合、ウィンドウは決定要因ではありません。
- 機能の上限。 メインループは推論の品質が結果に現れる場所であるため、より強力なモデルを獲得します。要約機能はその上限を必要とせず、そのために料金を支払うべきではありません。
これらの3つでスロットをランク付けすると、モデルはほとんど自動的に選択されます。高価値で複雑な推論は V4 Pro に、大量で低価値は V4 Flash に、そしてセーフティネットが必要なものはフォールバックチェーンに送られます。
デフォルトには正直な例外があります。重い多段階計画を行う Hermes デプロイメントは、メインループで V4 Pro の代わりに推論層モデルを望むかもしれません。これは、より深い思考連鎖のために、より遅く、より高価な呼び出しを受け入れることを意味します。レイテンシに敏感なエージェントは、メインループの一部でも Flash を好むかもしれません。これは、速度のために一部の機能を犠牲にすることを意味します。Atlas Cloud は、新しいモデルへのデイゼロアクセスにより、リリースされた日に新しいリリースを A/B テストし、現在の選択肢を上回る場合にのみそれを維持できるため、ベンダーを切り替えることなくこれらのトレードオフをテストできる数少ないプラットフォームの1つです。フレームワークは同じままで、スロットの背後にあるモデルだけが変わります。
お気に入りだけでなく、フォールバックも組み込む
モデルの選択は、フォールバックがなければ完了しません。永続的なエージェントは長時間無人で実行され、最終的にはレート制限または接続切断に遭遇します。Hermes は、各スロットが順番に試行する fallback_chain を定義できるようにするため、実際の最適な設定は1つのモデルではなく、バックアップ付きのプライマリです。メインループでは V4 Pro が V3.2 によってバックアップされ、補助スロットでは V4 Flash が別の安価な層によってバックアップされます。目標は、最初のプロバイダーの不具合で停止するのではなく、自力で回復するエージェントです。
最適な用途とそうでない用途
最適な用途: 継続的に実行され、予測可能なコストを望む Hermes デプロイメント。Atlas Cloud の1つのキーで V4 Pro と V4 Flash の間で作業を分割することで、品質と支出の両方を管理できます。
最適な用途: 後で画像またはビデオのスキルにエージェントを成長させることを期待するチーム。同じキーがすでにこれらのモデルにアクセスできるためです。
理想的ではない用途: ほんの数回の呼び出ししか行わない使い捨ての実験。組み込みの単一プロバイダーパスがスロットの構成よりも単純な場合。
結論
Hermes Agent に最適な Atlas Cloud モデルは1つではなく、1つを挙げる答えは間違った質問に答えています。最適な設定は小さなポートフォリオです。メインループに DeepSeek V4 Pro、補助スロットに V4 Flash、両方の背後に推論可能なフォールバック、そしてスキルが必要なときに同じキーで画像またはビデオモデルを追加する余地があります。モデルをスロットに合わせ、atlascloud.ai/models でライブの ID と価格を確認し、エージェントを実行させましょう。







