LLM

学術研究

【geek-terminalニュース】OpenAI Astra数学突破疑惑の最新情報

📝 本日のニュース概要 OpenAIの未公開モデル「Astra」が数学・理論計算機科学の未解決問題10件で新結果を出した、という主張がRedditと二次報道で拡散中。ただし公式発表・査読・独立検証は未確認。今回の焦点は性能表ではなく、証明の...
セキュリティ&脆弱性

【geek-terminalニュース】Word文書で“自己増殖”するCopilotプロンプト注入の最新情報

📝 本日のニュース概要 Microsoft Word向けCopilotをめぐり、文書内の不可視テキストが次の生成文書へコピーされる“ワーム的”プロンプトインジェクション実証が話題に。公式に確認できるCopilotの仕様と、研究報道・コミュニ...
ローカルLLM

DeepSeek V4 Flash 0731で価格性能比が再崩壊か

📝 本日のニュース概要 以前お伝えしたDeepSeek V4 Flashと低価格推論競争の続報です。0731更新、重み公開、API公開ベータ、Artificial Analysisのベンチ、GPT-5.6 Luna比の価格性能まで、ローカル...
商用巨大LLM

GPT-5.6値下げで推論費の前提が変わる最新情報

📝 本日のニュース概要 GPT-5.6 Luna/Terraの値下げ、Solによる推論基盤最適化、Fast mode、ARC-AGI-3をめぐる議論を、公式情報とコミュニティ反応に分けて整理します。 【事象の全貌と背景】以前お伝えしたGPT...
セキュリティ&脆弱性

【geek-terminalニュース】Claude Mythos暗号AI検証の最新情報

📝 本日のニュース概要 以前お伝えしたClaude Mythosの脆弱性探索の続報です。Anthropicの暗号攻撃成果を、HAWK、round-reduced AES、評価設計、専門家コミュニティの批判的検証から整理します。 以前お伝えし...
セキュリティ&脆弱性

【geek-terminalニュース】MAI-Cyber-1-Flashの最新情報

📝 本日のニュース概要 Microsoftのサイバー特化小型LLM、MAI-Cyber-1-Flashを深掘り。5B active parameters、MDASH、CyberGym 95.95%、モデルルーティング、SOC運用への影響を整...
プログラミング

【geek-terminalニュース】モデル分業Codingの最新情報

📝 本日のニュース概要 以前お伝えしたCursor Routerの続報です。今回はリクエスト単位のモデル振り分けではなく、フロンティアモデルを計画役、安価なモデルや専用コーディングモデルを実行役にする“推論費のOS設計”として、Cursor...
セキュリティ&脆弱性

【geek-terminalニュース】Claude Opus 5、ブラウザ型prompt injection耐性とワンショットゲーム生成の最新情報

📝 本日のニュース概要 以前お伝えしたClaude Opus 5の続報です。今回は能力ベンチではなく、ブラウザ操作エージェント最大の急所だったprompt injection耐性と、Redditで話題のワンショットゲーム生成デモを、公式情報...
商用巨大LLM

【geek-terminalニュース】Claude Opus 5の最新情報

📝 本日のニュース概要 AnthropicがClaude Opus 5を発表。Fable 5級に近い能力を半分の価格で狙う新Opusを、ベンチ、価格、effort設定、音声モード、コミュニティの反応から深掘りします。 以前お伝えしたClau...
プログラミング

【geek-terminalニュース】Cursor Routerの最新情報

📝 本日のニュース概要 以前お伝えしたGemini Flash低コスト戦略やAIコードハーネス設計の続報です。CursorがTeams/Enterprise向けに発表したCursor Routerを、リクエスト単位のモデル選択、キャッシュ損...