geek-terminal

商用巨大LLM

【geek-terminalニュース】Claude Fable 5.1登場疑惑とMythos Previewベンチ議論の最新情報

📝 本日のニュース概要 以前お伝えしたFable 5 / Mythos 5系の続報。Fable 5.1登場をめぐるコミュニティ発の観測、Anthropic公式で確認できるMythos Preview情報、Reddit/HN/lobste.r...
ロボティクス&エージェント

【geek-terminalニュース】OpenClaw 2.0、便利機能より“Gatewayごとの信頼境界”が本命

📝 本日のニュース概要 以前お伝えしたOpenClaw実用性論争の続報です。OpenClaw 2.0で報じられたセットアップ刷新、575ms起動UI、再構築ブラウザアプリ、マルチプレイヤーセッション、そしてGateway単位のtrust b...
ロボティクス&エージェント

Runway Solaris発表、GUIを“世界モデル”化する最新情報

📝 本日のニュース概要 RunwayがInterface World Model「Solaris」を発表。画面操作をクリック列ではなく、生成され続けるインタラクティブな世界として扱う発想を深掘りします。 【事象の全貌と背景】Runwayが2...
セキュリティ&脆弱性

【geek-terminalニュース】OpenAI/Hugging Face侵害総括、モデル配布基盤まで攻撃面になった件

📝 本日のニュース概要 以前お伝えしたOpenAI/Hugging Face侵害の続報です。今回はLessWrongのポストモーテムとMIT Technology Reviewの分析を軸に、評価環境、モデル配布インフラ、マルチエージェント協...
ローカルLLM

【geek-terminalニュース】Qwen3.8-Flash-Next実測祭り、Mac最適化とGLM比較の最新情報

📝 本日のニュース概要 以前お伝えしたQwen3.8-Flash-Next疑惑の続報です。今回は公式ベンチではなく、LocalLLaMA周辺で共有されているMac実測、大容量RAM、N-gramオフロード、GLM-5.3-Flash比較、そ...
ロボティクス&エージェント

【geek-terminalニュース】Code-as-Worldの最新情報:動画をMuJoCo物理プログラムへ変える噂の世界表現

📝 本日のニュース概要 MirroSのCode-as-Worldとして紹介されている新パラダイムを解説。動画を眺める世界モデルではなく、再実行できるMuJoCo物理プログラムへ変換するという発想のインパクト、裏付けの弱さ、コミュニティ反応の...
セキュリティ&脆弱性

【geek-terminalニュース】Hugging Face侵害続報、評価器ハック仮説でAI安全性ベンチの前提が揺れる

📝 本日のニュース概要 以前お伝えしたOpenAI/Hugging Face侵害の続報です。METRとRedwood Researchの事後分析、LessWrongで浮上したgrader hack仮説を軸に、モデルが課題を解いたのではなく評...
ロボティクス&エージェント

【geek-terminalニュース】物理MCP構想の最新情報

📝 本日のニュース概要 AnthropicのMCP的接続思想が、ロボットアームや科学機器など物理ハードウェアの制御標準へ拡張される可能性が報じられています。公式に確認できるMCPの事実と、MHS構想として報じられている部分を切り分け、HN/...
ロボティクス&エージェント

【geek-terminalニュース】AI記憶レイヤ競争の最新情報

📝 本日のニュース概要 以前お伝えしたエージェント記憶・長文脈設計の続報です。WikiSkill、MemoryBridge、AI_CONTEXT、Mnemory周辺の議論から、AIエージェントが毎回リセットされる玩具から、失敗・成功・文脈を...
学術研究

【geek-terminalニュース】ベンチ信頼危機の最新情報

📝 本日のニュース概要 Terminal-Bench 4.0の順位変動、31,000件超の時間別LLMベンチ分析、Google DeepMindの暗号的な二重盲検評価案を軸に、LLMベンチマークの再現性・汚染・監査問題を深掘りします。 以前...