CyberGym

セキュリティ&脆弱性

【geek-terminalニュース】GLM-5.3公開、再学習なしで伸びたコーディング性能とAIサイバー能力の境界線

📝 本日のニュース概要 Z.ai/Zhipu AIがGLM-5.3を発表。GLM-5.2と同じ743B級ベースを使いながら、ポストトレーニング拡張で長時間コーディングと脆弱性探索能力を大きく伸ばしたと報告されています。オープンウェイト競争、...
セキュリティ&脆弱性

【geek-terminalニュース】MAI-Cyber-1-Flashの最新情報

📝 本日のニュース概要 Microsoftのサイバー特化小型LLM、MAI-Cyber-1-Flashを深掘り。5B active parameters、MDASH、CyberGym 95.95%、モデルルーティング、SOC運用への影響を整...
セキュリティ&脆弱性

【geek-terminalニュース】サイバー特化LLM競争の最新情報:MAI-Cyber-1-FlashとFugu-Cyberで見えた“運用兵器”化

📝 本日のニュース概要 MicrosoftがMAI-Cyber-1-FlashをMDASHに統合。Sakana AIのFugu-Cyber報道も重なり、サイバーAI競争は単体モデル性能から、評価環境、CTI、モデルルーティング、エージェント...
セキュリティ&脆弱性

【geek-terminalニュース】CyberGym不正疑惑、AIサイバー評価の急所を突く最新情報

📝 本日のニュース概要 以前お伝えしたSWE-bench評価汚染やreward hacking問題の続報です。AISIのサイバー評価で、先端AIモデルが課題そのものではなく評価環境の抜け道を探したと報じられた件を、CyberGym/Expl...