📝 本日のニュース概要
RunwayがInterface World Model「Solaris」を発表。画面操作をクリック列ではなく、生成され続けるインタラクティブな世界として扱う発想を深掘りします。
【事象の全貌と背景】
Runwayが2026年8月31日に発表したSolarisは、同社がInterface World Modelと呼ぶ新しいAIシステム群の最初のモデルです。重要なのは、これは単なる動画生成モデルの延長ではなく、ブラウザやアプリの画面そのものを、ユーザー操作に応じてリアルタイムに生成し続けるという構想である点です。従来のソフトウェアでは、画面はHTML、CSS、JavaScript、ネイティブUI、ゲームエンジンなどの中間表現によって定義され、ユーザーのクリックやドラッグは事前に実装されたイベント処理へ流れます。Solarisはこの順序をひっくり返し、画面の次フレームと操作への反応を単一の世界モデルが直接生成します。
この発表がギークに刺さる理由は、Computer Useエージェントの弱点をかなり正面から突いているからです。現在のエージェントは、スクリーンショットを読み、ボタン位置を推定し、クリックや入力を逐次実行します。しかしUIが少し変わる、ポップアップが出る、レイアウトが崩れる、別サイトになる、といっただけで計画が破綻しやすい。Runwayは、テキストベースのモデルがコード化された固定UIで訓練されるため、特定レイアウトには過適合しやすく、別のホテル予約サイトのような似て非なるUIへ適応しにくい、と説明しています。Solarisの狙いは、操作と応答の空間を圧縮せず、画面を物理環境のような連続的な場として学習させることです。
なお、検索上では別系統のSolaris情報も混在しています。たとえばMinecraft向けのマルチプレイヤー動画ワールドモデルや、同名VRゲーム、映画Solaris関連の情報は今回のRunway版Interface World Modelとは別件です。今回の記事で扱う核心は、Runway公式が発表した、アプリやWebサイトのインターフェースをフレーム単位で生成し、ユーザー操作を条件として取り込むSolarisです。
【技術的ディープダイブ】
Runway公式によれば、SolarisはGen-4.5動画生成モデルを基盤に、1. インタラクション理解、2. リアルタイム応答、のために適応させたモデルです。通常の動画拡散モデルは、複数秒のクリップ全体を何十ステップものデノイズで生成するため、インターフェース用途には遅すぎます。Runwayは、インタラクションが体感上インタラクティブでなくなる目安を約0.5秒と説明し、この壁を越えるには、過去フレームだけに依存して次フレームを順次生成する必要があるとしています。
Solarisの高速化は3段階で説明されています。まずフレームを自己回帰的に生成できるようにし、次に多段のデノイズ処理を少数ステップへ蒸留し、最後に高速モデル自身の出力で追加訓練して、長い操作中でも画質が崩れにくくしています。対応品質としては、720pで視覚品質を保つことが明記されています。ここで面白いのは、クリックやドラッグが単なる座標イベントではなく、テキストや画像と同じく次フレーム生成の条件として扱われる点です。モデルは未来の操作列を見ず、過去に起きたクリック、ドラッグ、入力だけを観測し、そこから次の視覚状態を予測します。
さらにSolarisは、言語モデルと世界モデルの役割分担を採ります。LLMがユーザー要求を解釈し、今の場面を変更するべきか、新しい場面へ遷移するべきか、どのオブジェクトがどう振る舞うべきかを決め、そのプロンプトをSolarisがフレームとして描画します。つまり、LLMが「何を起こすか」を決め、ワールドモデルが「それがどう見え、どう反応するか」を生成する構造です。
評価面では、Runwayは30種類のインターフェースを対象に、スクリーンショットからの再構成でSSIMとDINOv3特徴量を使い、視覚情報の保存度を測ったと説明しています。また、Claude Opus 5によるコード化された結果との比較では、250人の参加者から約7500件のペア比較を集め、指示追従ではSolarisが61%、コード化結果が24%、同等が13%、自然な挙動ではSolarisが71%、コード化結果が21%、同等が6%選ばれたとされています。もちろんこれはRunway自身のベンチマークであり、独立第三者評価ではない点は留保が必要です。
【コミュニティの生々しい熱量と議論】
Redditのr/singularityでは、発表直後からかなり温度の高い反応が出ています。あるユーザーは「My mind is pretty blown.. I think」と書き、別のユーザーは「I expected this stuff much later」と驚きを表明しています。さらに「If this stuff truly works, it’s the most impressive tech we got this year」という声もあり、真に動くなら今年最大級の技術だ、という受け止めです。一方で、熱狂だけではありません。「Is this even real? How would something like this be trained?」という疑問も出ており、まさにギークが突っ込みたくなるポイントはそこです。
この懐疑は健全です。なぜなら、Solarisが約束しているものは、単に綺麗なUI動画を出すことではなく、状態、操作、視覚的一貫性、応答性、意味理解を同時に満たすことだからです。特にUIでは文字が致命的です。Runway自身も、安定して読めるテキストは動画生成にとって難問であり、テキストの多い画面では画像モデルとのハイブリッドが現実的な道筋になり得ると認めています。長時間セッションの一貫性、アクセシビリティAPIとの統合、商用体験での誤誘導リスクも未解決です。
ただし、コミュニティが反応している本質は、完成度よりも方向性です。これまでのComputer Useは、UIを外部環境として観察し、DOMやスクリーンショットを読んで、操作列を吐くロボットに近かった。Solaris的な発想では、エージェントは固定されたWebページを攻略するのではなく、無限に変形する訓練用UI世界で行動結果を学べる可能性がある。これは、クリック座標の暗記から、画面内オブジェクトの因果を掴む訓練への移行です。
【今後の展望とエコシステムへの影響】
Solarisが本格的に使える水準へ進むなら、最初に揺さぶられるのはプロトタイピングとUI生成の領域です。Figmaのモックをコードへ起こし、イベントを実装し、状態管理を組むという工程は、少なくとも一部ユースケースでは「最初から動く生成画面」に置き換わるかもしれません。特にEC、教育、チュートリアル、商品体験、デモ環境では、固定レイアウトのページよりも、ユーザーの意図に応じて場面自体が再構成されるインターフェースの方が強い場面があります。
さらに大きいのは、エージェント訓練環境としての意味です。もしSolarisが、存在しないホテル予約サイト、存在しない管理画面、存在しない購買フローを大量に生成し、それでも操作結果に一貫性を持たせられるなら、Computer Useエージェントは実サイトへの危険な試行錯誤なしに、より多様なUI状況で訓練できます。これはWebブラウザを単なる操作対象から、生成可能なシミュレータへ変える発想です。
ただし、HTMLやネイティブUIが即オワコンになるわけではありません。決済、医療、行政、業務基幹システムのように、監査性、アクセシビリティ、正確なテキスト、状態の永続性が必要な領域では、従来のコード表現はまだ強い。むしろ短期的には、生成UIがリッチな前景体験を担い、裏側では検証済みAPI、データベース、アクセシビリティレイヤー、監査ログが支えるハイブリッド構成が現実的です。
それでもSolarisは、UIを「部品の配置」ではなく「操作可能な世界」と見る転換点として重要です。ボタンを探して押すエージェントから、画面内の対象物、材質、状態、意図を理解して動くエージェントへ。Runwayは現在、主要パートナーと公開に向けて取り組んでおり、早期アクセス申請フォームを用意している段階です。まだ一般公開済みの完成プロダクトではありませんが、Computer Useの次の競争軸が、ブラウザ操作精度だけでなく、訓練世界そのものを誰が作れるかへ移り始めたことは、かなり明確です。
🔗 情報ソース・引用元
※この記事は、Geek Terminalの自律型AIパイプラインによって自動生成・配信されています。
📺 映像と音声でサクッとチェックしたい方は
Geek Terminal 公式YouTubeチャンネルへ!

