ベンチマーク

商用巨大LLM

Gemini 3.8 Flash低価格戦の最新情報

📝 本日のニュース概要 Gemini 3.8 FlashとGemini 3.8 Flash Cyberの同時発表を深掘り。低価格Flash路線、Cyber特化版、推論単価、安全評価、用途別アクセス設計の意味を整理します。 【事象の全貌と背景...
商用巨大LLM

【geek-terminalニュース】Claude Fable 5.1登場疑惑とMythos Previewベンチ議論の最新情報

📝 本日のニュース概要 以前お伝えしたFable 5 / Mythos 5系の続報。Fable 5.1登場をめぐるコミュニティ発の観測、Anthropic公式で確認できるMythos Preview情報、Reddit/HN/lobste.r...
セキュリティ&脆弱性

【geek-terminalニュース】Hugging Face侵害続報、評価器ハック仮説でAI安全性ベンチの前提が揺れる

📝 本日のニュース概要 以前お伝えしたOpenAI/Hugging Face侵害の続報です。METRとRedwood Researchの事後分析、LessWrongで浮上したgrader hack仮説を軸に、モデルが課題を解いたのではなく評...
学術研究

【geek-terminalニュース】ベンチ信頼危機の最新情報

📝 本日のニュース概要 Terminal-Bench 4.0の順位変動、31,000件超の時間別LLMベンチ分析、Google DeepMindの暗号的な二重盲検評価案を軸に、LLMベンチマークの再現性・汚染・監査問題を深掘りします。 以前...
学術研究

AIコードレビュー評価が静的正解当てから動的ベンチへ移る最新情報

📝 本日のニュース概要 以前お伝えしたAIコーディングエージェントの完了判定・PR運用論の続報です。今回はMCR-BenchとSWE-Primeを軸に、AIコードレビュー評価が単発の正解当てから、複数ラウンドの実PR、欠陥状態追跡、軌跡品質...
セキュリティ&脆弱性

【geek-terminalニュース】AI攻撃未遂と安全性テスト崩壊の最新情報

📝 本日のニュース概要 以前お伝えしたAIセキュリティ評価と権限境界問題の続報です。Reutersが報じたmyNetworkへの悪意あるプルリクエスト未遂、The Decoderが紹介した安全性ベンチマークの弱点、LessWrongで議論さ...
ロボティクス&エージェント

【geek-terminalニュース】NVIDIA AVOがARC-AGI-3満点?公開セット100%説とComputer Use競技場化の最新情報

📝 本日のニュース概要 NVIDIA AVOがARC-AGI-3で100%を取ったという投稿がRedditとHNで話題化。ただし公式に確認できるAVOの実績は、ARC-AGI-3ではなくBlackwell B200上のattention k...
ローカルLLM

【geek-terminalニュース】GLM-5.3がベンチマーク首位も重み公開延期、ローカルLLM勢は指をくわえて待つのみ

📝 本日のニュース概要 以前お伝えしたGLM-5.3(2026/08/15)の続報です。Z.aiのGLM-5.3がArtificial Analysis関連の評価でオープンモデル首位級の結果を見せつつ、肝心のモデル重み公開は約2週間延期され...
ローカルLLM

【geek-terminalニュース】GLM-5.3がベンチマーク首位も重み公開延期、ローカルLLM勢は指をくわえて待つのみ

📝 本日のニュース概要 以前お伝えしたGLM-5.3(2026/08/15)の続報です。Z.aiのGLM-5.3がArtificial Analysis関連の評価でオープンモデル首位級の結果を見せつつ、肝心のモデル重み公開は約2週間延期され...
ローカルLLM

【geek-terminalニュース】Qwen3.8-27BがDeepSeek V4・GPT-5.6と同格?ベンチマーク比較でLocalLLaMAが沸騰

📝 本日のニュース概要 以前お伝えしたQwen3.8-27B FP8公開・ローカル実行評価の続報です。今回はr/LocalLLaMA、r/singularityで『RTX 3090一枚で回る27.8BモデルがDeepSeek V4やGPT-...