
Kling O1は、マルチモーダル・ビジュアル言語技術で構築されたKuaishouの動画モデルファミリーです。テキストから動画、画像から動画へのワークフローにより、プロンプトやソース画像から言語コンテキストと視覚コンテキストを結び付け、シームレスなシーン展開を生成できます。Atlas Cloudでは、コールドスタートなしのすぐに利用できるREST APIを通じて両方のモードを提供し、透明性の高い従量課金制の料金体系を採用しています。今日から開発を始めましょう。
Kling o1 は Kuaishou が開発したモデルです。Atlas Cloud(運営:Atlas Cloud AI LLC)は本モデルへのアクセスを提供するものであり、その所有者ではありません。すべての商標は各所有者に帰属します。
プロジェクトに適した動画生成エンドポイントを選べるよう、Kling O1 のテキストおよび画像ワークフローを比較します。
| モダリティ | 説明 |
|---|---|
| Kling O1 T2V API (Text To Video) | Kling O1 Text to Video endpoint を使用して、テキストプロンプトをシネマティックな動画に変換します。MVL テクノロジーにより、正確な意味理解、一貫した被写体表現、自然な物理シミュレーションを実現します。ストーリーのコンセプト作成、プロダクトナラティブ、テキストで演出するシーンに適しています。 |
| Kling O1 I2V API (Image To Video) | 静止画を起点に、Kling O1 Image to Video endpoint が動きのあるシネマティックな動画を生成します。被写体の一貫性を保ちながら、自然な動き、物理シミュレーション、シームレスなシーン展開を加えます。画像アニメーション、ビジュアルストーリーテリング、シネマティックなシーン開発に適したワークフローです。 |
Kling O1 は、被写体の一貫性、自然な物理表現、精密なプロンプト理解、最初と最後のフレーム制御、柔軟な 5 秒/10 秒の長さ設定、3 種類のアスペクト比、そして透明性の高い従量課金で利用できる Atlas Cloud REST アクセスを備え、text-to-video と image-to-video の生成を組み合わせます。
Kling O1 は、Atlas Cloud の専用 text-to-video/image-to-video エンドポイントを通じて、テキストプロンプトまたは入力画像からシネマティックな動画を生成します。MVL アーキテクチャが、言語入力と視覚入力の両方からシーンの意図を解釈します。基盤となるモデルファミリーを変更せず、開始アセットに合ったモードを選択できます。この柔軟性は、初期コンセプトからアニメーション化されたキャンペーン映像やストーリーショットへ展開するチームに適しています。
カメラが動き、シーンが展開しても、アクションの進行中に被写体の認識性を維持します。image-to-video 生成では入力画像の視覚的アイデンティティを動きへ引き継ぎ、text-to-video ではプロンプトから一貫性のあるキャラクターを構築します。被写体が安定することで、フレーム間の気になる変化を抑えられます。キャラクター主導のストーリー、プロダクトショット、映像の連続性が重要なシーケンスに活用できます。
自然な物理シミュレーションにより、動きに重みや慣性が加わり、周囲のシーンとの説得力のある相互作用を実現します。Kling O1 は、人や物、環境要素を、後付けのようではなく互いに結び付いたダイナミクスでアニメーション化します。プロンプトでは、具体的な動作指示とカメラワークを組み合わせてください。動きの質が映像の完成度を左右するスポーツ、料理、自然、アクション映像に適しています。
1 枚の画像から開始することも、任意の最後の画像を指定して動きの終点を定義することもできます。Atlas Cloud の image-to-video スキーマは 5 秒または 10 秒のクリップに対応しており、短いビートから長めのトランジションまで、明確なテンポ設計が可能です。モデルはプロンプトの指示に従い、視覚的な状態の間をつなぐ動きを合成します。プロダクトのお披露目、変形、短い物語展開に適した制御機能です。
精密な意味理解により、Kling O1 は詳細なプロンプトを被写体、アクション、シーンの動き、シネマティックなカメラワークへ変換します。16:9、9:16、1:1 の出力から構図を設定し、自然言語で動きや雰囲気を記述できます。複雑な演出指示も、手作業によるアニメーションではなく、構造化された生成リクエストとして扱えます。ソーシャル向けクリップ、絵コンテ、完成度の高いビジュアルコンセプトに役立ちます。
Atlas Cloud の統合 REST API を通じて、text-to-video と image-to-video の両方の生成を組み込めます。Atlas Cloud はコールドスタートなしを掲げており、生成時間に応じて出力 1 秒あたり標準料金 $0.112 が課金されます。プロンプト、入力フレーム、時間、アスペクト比を構造化パラメータとして送信できます。これにより、開発者は予測しやすいコストで、本番の動画ワークフローへ直接統合できます。
Kling O1、Seedance 2.0、Kling V3.0 Turboが、シネマティックなリアリズム、動きの連続性、物理的なインタラクション、スタイライズされたストーリーテリングにおいて、同じ2つのプロンプトをどのように解釈するかを見てみましょう。
日の出の混雑した花市場を、ゴールデンレトリバーが花束をくわえて駆け抜ける10秒間の写実的なシネマティック動画を作成してください。濡れた石畳の上を犬が疾走し、花びらをまき散らしながら動く荷車の間を縫う様子を、ローアングルのトラッキングショットで始めます。ホイップパンで、後ろから追いかける花売りへと視点を移し、その後、犬が倒れた籠を飛び越えて自然に着地する様子を周回撮影します。最後は犬が子どものそばで立ち止まり、花束を差し出し、笑いながら追いついた花売りが受け取る瞬間へ素早くプッシュインして終えます。暖かな逆光、リアルな毛並み、布や花びらの物理表現、途切れのない躍動的な動き、16:9のアスペクト比。
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
月明かりに照らされたベーカリーで、小さなキツネのシェフが魔法のペイストリーを作る8秒間のスタイライズされたクレイ・ストップモーション動画を作成してください。キツネが生地を回し、ベリーを放り投げ、跳ね回る調理器具をかわす様子を、俯瞰のクレーンショットで始めます。ペイストリーがオーブンへ駆け込み、光り始める様子をカウンタートップのトラッキングビューで捉えます。キツネの周囲を素早く回り込みながら、オーブンが勢いよく開き、小さなペイストリー・ドラゴンが飛び出して、舞い漂う小麦粉の中を旋回し、シェフの帽子に着地する様子を描きます。手作り感のある粘土の質感、表情豊かな動き、遊び心のある青とアンバーのライティング、シームレスなアクションの連続性、16:9のアスペクト比。
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
プロンプト駆動のシネマティックなコンセプトから、動きのある商品ビジュアルまで、Kling O1は映像制作者、マーケター、コマースチーム、アプリ開発者に、テキストや静止画から一貫性のある物理演算対応の動画を制作するための実践的な道筋を提供します。
詳細なプロンプトを、意味を正確に理解し自然な物理法則に基づいたシネマティックなシーケンスへと変換します。映像制作者やプリビジュアライゼーションチームは、高コストな実写制作にリソースを投じる前に、ムード、アクション、カメラワークのアイデアを検討できます。
静止した商品画像にシームレスなシーンの動きを加えながら、被写体の特徴を維持します。コマースチームは、カタログ画像をローンチ、オンラインストア、キャンペーン用クリエイティブに活用できる洗練されたモーションアセットへと変換できます。
文章で書かれたコンセプトから始め、自然な物理法則に従う動きのシネマティックな動画を生成します。ソーシャルチームは、告知、季節キャンペーン、迅速なチャネル別クリエイティブテストに向けて、新しいビジュアルの方向性を生み出せます。
物語性のあるプロンプトを、意味を正確に理解し、一貫性のある動くシーンへと変換します。監督、エージェンシー、ゲームスタジオは、初期のクリエイティブ開発や企画段階で、キャラクターの動き、環境の動き、シネマティックな雰囲気を可視化できます。
Kling O1のimage modeが被写体の一貫性を保ちながら、静止したポートレートに自然な動きを加えます。クリエイターは、既存のアートワークから表情豊かなプロフィール動画、キャラクター紹介、ビジュアルストーリーテリング用アセットを制作できます。
プロンプトが複雑な動きを描写すると、Kling O1は自然な物理シミュレーションと正確な意味理解を適用します。アクションデザイナーやコンセプトチームは、制作開始前に、説得力のある動きを備えたダイナミックなシーンをプレビューできます。
プロバイダー、生成モード、モデルID、標準カタログ価格に基づいて、Kling O1と他のAtlas Cloud動画モデルを比較します。
| モデル | プロバイダー | 生成モード | AtlasモデルID | 掲載基本価格 |
|---|---|---|---|---|
| Kling Video O1 Text-to-video | Kuaishou | テキストから動画 | kwaivgi/kling-video-o1/text-to-video | $0.112、単位の記載なし |
| Kling Video O1 Image-to-video | Kuaishou | 画像から動画 | kwaivgi/kling-video-o1/image-to-video | $0.112、単位の記載なし |
| Seedance 2.0 Text-to-Video | ByteDance | テキストから動画 | bytedance/seedance-2.0/text-to-video | $0.112、単位の記載なし |
| Wan-2.7 Image-to-video | Qwen | 画像から動画 | alibaba/wan-2.7/image-to-video | $0.10、単位の記載なし |
| Veo 3.1 Lite Text-to-video | テキストから動画 | google/veo3.1-lite/text-to-video | $0.05、単位の記載なし | |
| MiniMax H3 Image-to-Video | MiniMax | 画像から動画 | minimax/h3/image-to-video | $0.038/秒 |
数分で始められます — 以下の簡単なステップに従って、Atlas Cloud プラットフォームでモデルを統合・デプロイしましょう。
atlascloud.ai でサインアップし、認証を完了します。新規ユーザーには無料クレジットが付与され、プラットフォームの探索やモデルのテストに使用できます。
高度なKling o1モデルとAtlas CloudのGPU加速プラットフォームを組み合わせることで、比類のないパフォーマンス、スケーラビリティ、開発者エクスペリエンスを提供。
低レイテンシ:
リアルタイム推論のためのGPU最適化推論。
統合API:
1つの統合でKling o1、GPT、Gemini、DeepSeekを実行。
透明な料金:
サーバーレスオプション付きの予測可能なtoken単位の課金。
開発者エクスペリエンス:
SDK、分析、ファインチューニングツール、テンプレート。
信頼性:
99.99%の稼働率、RBAC、コンプライアンス対応ロギング。
セキュリティとコンプライアンス:
SOC 2 Type II、HIPAA準拠、米国内のデータ主権。
Kling O1は、マルチモーダル・ビジュアル・ランゲージ技術を用いてKuaishouが開発した、統合型マルチモーダル動画モデルです。Atlas Cloudでは、検証済みのファミリーとしてtext-to-videoとimage-to-videoのエンドポイントが提供されています。意味的なプロンプト理解、被写体の一貫性、自然な物理シミュレーションに重点を置いています。
text-to-videoを使うと、文章によるシーンの指示を映画的なクリップに変換できます。また、image-to-videoモードでは、元画像に動きを加えられます。どちらのエンドポイントも、一貫した被写体、制御された動き、リアルなシーンの動態を活かしたワークフローに対応しています。
プロジェクトが文章によるシーン説明から始まる場合はtext-to-videoを選択してください。既存の画像を被写体や構図、または最初のフレームの基準として使用してから動きを加える場合は、image-to-videoを選択してください。
選択したモデルIDと入力値を指定し、認証済みのPOSTリクエストをhttps://api.atlascloud.ai/api/v1/model/generateVideoに送信します。kwaivgi/kling-video-o1/text-to-videoまたはkwaivgi/kling-video-o1/image-to-videoを使用し、返されたprediction IDで結果を取得してください。
text-to-videoでは、promptを指定し、ドキュメントに記載されたアスペクト比と長さの設定を使用します。image-to-videoではpromptとimageが必須で、last_imageは任意です。検証済みのアスペクト比は16:9、9:16、1:1で、長さは5秒または10秒に対応しています。
Atlas Cloudでは、検証済みの両動画エンドポイントに標準価格として1秒あたり$0.112が設定されています。料金は指定した出力時間に応じて変動するため、標準料金では10秒の生成に5秒の生成の2倍の費用がかかります。
生成は、prediction IDと処理ステータスを返すPOSTリクエストから始まります。タスクが完了または失敗するまで、https://api.atlascloud.ai/api/v1/model/prediction/{prediction_id}をポーリングしてください。成功時のレスポンスでは、生成された動画URLがoutputs配列に格納されます。
被写体の一貫性は、利用可能な両モードで文書化されている機能です。image-to-videoでは、元のフレームを基準にして視覚的なアイデンティティと構図を維持します。ただし、結果は入力の品質やプロンプトの複雑さによって変わる可能性があるため、明瞭な元画像と具体的な動きの指示を用意することをおすすめします。
このファミリーページで検証済みのAtlas Cloudエンドポイントには含まれていません。現在の選択肢はtext-to-videoとimage-to-videoのみです。そのため、Atlas Cloudが互換性のあるエンドポイントとスキーマを公開しない限り、Elements、reference video、編集用パラメータは送信しないでください。
Atlas Cloud を最大限に活用するためのガイド、チュートリアル、製品アップデート。