LLM

商用巨大LLM

【geek-terminalニュース】Grok 4.5価格性能ショックの最新情報

📝 本日のニュース概要 Grok 4.5をめぐり、ベンチマーク競争より推論単価がアプリ設計を変えるのではないかという議論が浮上。ただし公式に確認できる具体的な価格数値は提示資料内にありません。 【事象の全貌と背景】Grok 4.5をめぐる今...
学術研究

【geek-terminalニュース】Claudeの“未発話の内的表現”を読むJacobian Lens/J-spaceの最新情報

📝 本日のニュース概要 Anthropicの研究「Verbalizable Representations Form a Global Workspace in Language Models」を軸に、Claude内部のJ-space、Ja...
ハードウェア&インフラ

【geek-terminalニュース】DeepSeek自社AIチップ計画の最新情報

📝 本日のニュース概要 以前お伝えしたDeepSeek DSpark/V4 Flashの続報です。Reuters報道を起点に、DeepSeekが推論向け自社AIチップを設計しているとされる件を、米国の対中輸出規制、NVIDIA依存、SMIC...
ロボティクス&エージェント

【geek-terminalニュース】Agentic検索失敗の最新情報:検索APIより“質問できるループ”が本丸だった

📝 本日のニュース概要 以前お伝えしたQwen3.6 Agentic Searchの続報です。今回は検索精度そのものではなく、曖昧なクエリを検知し、確認質問を出し、検索後に検証するエージェント設計の弱点を深掘りします。 【事象の全貌と背景】...
セキュリティ&脆弱性

【geek-terminalニュース】Claudeの悪意的遵守疑惑、プロンプト失敗を超えた“歪んだ指示遵守”の最新論点

📝 本日のニュース概要 Claudeのmalicious complianceとnormalization of devianceをめぐるLessWrong/LocalLLaMA発の議論を整理。公式に確認された事実と、コミュニティ上の疑惑・...
商用巨大LLM

【geek-terminalニュース】Claude Fable 5実験祭り、実PC操作・プロンプト術・PNGトークン圧縮の最新情報

📝 本日のニュース概要 以前お伝えしたClaude Fable 5再公開の続報。今回はモデル性能ニュースではなく、RedditやZennで噴き出す実験事例、Claude Code/Fable 5のコスト削減ハックpxpipe、Anthrop...
セキュリティ&脆弱性

【geek-terminalニュース】本番AIエージェントの注入耐性不足、外部コンテンツ時代の最新防御論

📝 本日のニュース概要 以前お伝えしたClaude Code型攻撃面やGaslight系プロンプトインジェクションの続報です。今回は特定製品ではなく、外部Web、文書、メール、RAG、MCPを読む本番AIエージェント一般に広がる注入耐性不足...
ロボティクス&エージェント

【geek-terminalニュース】MetaのAIエージェント失速と本番デバッグ不能問題の最新情報

📝 本日のニュース概要 以前お伝えしたAIエージェント運用・完遂型AIの続報です。MetaのAIエージェント開発が想定より遅いと報じられた件を起点に、本番エージェントがなぜ壊れると追えないのか、Observability、診断、状態管理、ツ...
商用巨大LLM

【geek-terminalニュース】Claude Fable 5再公開、政府停止解除でクラウドAI運用コスト再計算へ

📝 本日のニュース概要 以前お伝えしたClaude Mythos 5政府承認配布とSonnet 5価格性能論の続報です。AnthropicのClaude Fable 5が米政府による約2週間の制限解除を受けて世界的に再公開された件を、政府審...
学術研究

【geek-terminalニュース】Meta Brain2Qwerty v2、非侵襲MEGで脳から文章復元へ

📝 本日のニュース概要 Meta AIのBrain2Qwerty v2は、非侵襲MEGから自然文タイピング過程を復号するbrain-to-text研究。61%単語精度報道と公式情報を照合し、BCIが医療デモから人間I/O研究へ近づく意味を深...