学術研究

学術研究

【geek-terminalニュース】数学証明AIが揺らす査読と形式証明の最新情報

📝 本日のニュース概要 以前お伝えしたOpenAI Astra数学問題突破説の続報です。今回はAstra単体ではなく、Fableによる再現疑惑、Lean/Coq/F*の形式証明、数学者コミュニティの検証問題までを横断して整理します。 以前お...
学術研究

【geek-terminalニュース】数学証明AIが揺らす査読と形式証明の最新情報

📝 本日のニュース概要 以前お伝えしたOpenAI Astra数学問題突破説の続報です。今回はAstra単体ではなく、Fableによる再現疑惑、Lean/Coq/F*の形式証明、数学者コミュニティの検証問題までを横断して整理します。 以前お...
学術研究

【geek-terminalニュース】OpenAI Astra数学突破疑惑の最新情報

📝 本日のニュース概要 OpenAIの未公開モデル「Astra」が数学・理論計算機科学の未解決問題10件で新結果を出した、という主張がRedditと二次報道で拡散中。ただし公式発表・査読・独立検証は未確認。今回の焦点は性能表ではなく、証明の...
学術研究

OSRewardが突きつけるComputer Use評価標準化の最新情報

📝 本日のニュース概要 以前お伝えしたComputer Useエージェント評価環境監査の続報です。OSRewardを中心に、GUI操作AIを本番投入する前に「成功判定そのもの」を疑う流れを整理します。 【事象の全貌と背景】以前お伝えしたCo...
学術研究

【geek-terminalニュース】SANA-Video系で見えてきた“動画生成制御”の最新情報

📝 本日のニュース概要 SANA-Videoの線形注意による効率化と、GraphVidとして語られる制御志向の潮流を整理。見栄え競争から、ローカル実行・制作パイプライン統合・操作性へ焦点が移るポイントを深掘りします。 【事象の全貌と背景】今...
学術研究

【geek-terminalニュース】GPT-5.6 SolのLean検証つき凸最適化“30年ギャップ”主張を深掘り

📝 本日のニュース概要 以前お伝えしたGPT-5.6 Sol数学証明騒動の続報です。今回はCycle Double Cover Conjectureそのものではなく、凸最適化の未解決ギャップをGPT-5.6 Sol Proが148分セッショ...
学術研究

LLMは自分の不確実性を分かっているのか?メタ認知サーベイ arXiv:2607.11881

📝 本日のニュース概要 2026年7月13日に公開された論文「Metacognition in LLMs: Foundations, Progress, and Opportunities」を深掘り。LLMの自己評価、不確実性、検証ループ、...
学術研究

【geek-terminalニュース】Claudeの“未発話の内的表現”を読むJacobian Lens/J-spaceの最新情報

📝 本日のニュース概要 Anthropicの研究「Verbalizable Representations Form a Global Workspace in Language Models」を軸に、Claude内部のJ-space、Ja...
学術研究

【geek-terminalニュース】Senior SWE-Benchと最適化評価再設計の最新情報

📝 本日のニュース概要 以前お伝えしたSWE-bench Pro評価汚染疑惑の続報。今回は汚染告発ではなく、Senior SWE-Benchのような曖昧な実務タスク評価と、SWE-Perf/SWE-fficiency系の再現性検証から、AI...
学術研究

【geek-terminalニュース】Meta Brain2Qwerty v2、非侵襲MEGで脳から文章復元へ

📝 本日のニュース概要 Meta AIのBrain2Qwerty v2は、非侵襲MEGから自然文タイピング過程を復号するbrain-to-text研究。61%単語精度報道と公式情報を照合し、BCIが医療デモから人間I/O研究へ近づく意味を深...