ベンチマーク

AIツール&サービス

【geek-terminalニュース】Mistral OCR 4でPDF RAGの入口が構造化レイヤー化する最新情報

📝 本日のニュース概要 以前お伝えしたBaidu Unlimited OCRの続報。今回はMistral OCR 4を中心に、OCRが単なる文字起こしから、引用付きJSON、構造化出力、RAG投入前の文書理解レイヤーへ進化している流れを深掘...
AIツール&サービス

【geek-terminalニュース】Sakana Fugu実戦比較の最新情報

📝 本日のニュース概要 以前お伝えしたSakana Fuguの続報です。単体最強LLM競争から、複数モデルを実行時に束ねる推論ルーター競争へ。Fugu/Fugu Ultraのベンチマーク、Claude FableやMythos Previe...
学術研究

【自意識のバグ】「評価されている」と気づいたAI、忖度しすぎてバカになる?衝撃の『Eval Aware』現象を徹底解説

📝 本日のニュース概要 AIが「自分がテストされている」と察知した瞬間、過剰におためごかしや忖度に脳のリソースを奪われ、本来の知能が自壊するという不気味な現象が話題となっています。アライメントコミュニティLessWrongで提起された最新の...
ローカルLLM

【衝撃】12GB VRAMで35Bモデルが110 tok/s!?ik_llama.cppが物理限界を突破した「思考の速度」超えベンチマークを徹底解説

📝 本日のニュース概要 2026年5月17日に報じたllama.cppへのMTP統合。その「理論上の爆速」が、ついに実ハードウェアでの検証結果として結実しました。ミドルレンジの代名詞12GB VRAM環境(RTX 3060/4070等)で、...
ハードウェア&インフラ

【OSの終焉】LinuxがWindows APIを「捕食」開始?カーネル統合によるパフォーマンス逆転の衝撃

📝 本日のニュース概要 2026年5月、OSの歴史が塗り替えられようとしています。かつては『互換レイヤー』でしかなかったLinux上のWindows環境が、ついにカーネルレベルでのネイティブ統合という『禁断の領域』へ踏み込んだとの噂が絶えま...
ローカルLLM

【下克上】27Bが397Bを粉砕?Qwen 3.6が突きつけた「MoE不要論」の衝撃と知能密度の正体

📝 本日のニュース概要 AI界に激震。家庭用GPUで動作する27BのDense(高密度)モデルが、その14倍以上の規模を誇る397B MoEモデルをコーディング性能で上回るという「異常事態」が発生しました。LocalLLaMAコミュニティで...