10年以内の「超知能」と1.4兆ドルのインフラ計画、OpenAI サム・アルトマン氏らが明かす新ビジョン
mail@yanagiya.biz
ITライター柳谷智宣
Tencent Hunyuanが開発したゲーム世界モデル「Hunyuan-GameCraft-2」を解説しています。動画を「見る」段階から実際に「遊ぶ」段階へ進んだモデルで、テキスト指示とキーボード操作を統合し、因果関係のある世界を生成します。ベースは140億パラメータのMoE画像生成モデルで、「アサシン クリード」「サイバーパンク2077」など150以上のAAAタイトルのプレイ映像を集め、VLMでインタラクションの説明文を自動生成する学習データのパイプラインを構築しました。
処理は毎秒16フレームのリアルタイムで、KV-recacheという仕組みにより500フレームを超える長いシーケンスでも一貫性を保てます。InterBenchによる評価では環境変化0.962、アクター0.983という実行率を示し、物理的整合性でも他モデルを上回りました。ドラゴンのような未知のオブジェクトも自然に描けた一方、長時間の生成での一貫性維持や複雑なタスク処理は依然として課題です。
この要約は生成AIで作成しました。
