商用巨大LLM

学術研究

【geek-terminalニュース】OpenAI数学証明騒動、争点は“証明”から“検証パイプラインの信頼性”へ

📝 本日のニュース概要 以前お伝えしたOpenAIのNavier-Stokes証明AI発表の続報です。今回は証明の中身そのものではなく、Lean形式化、査読、研究倫理、AIラボの発表統治、チャット履歴の扱いまで含む“AI時代の数学研究を誰が...
商用巨大LLM

GPT-6 Astra運用評価の最新情報

📝 本日のニュース概要 以前お伝えしたGPT-6 Astra初報の続報です。今回は1M級文脈やAGI級ベンチの話から一段降りて、ロールアウト後の利用枠、プロンプト作法、幻覚率、隠しプロンプトインジェクション耐性、そして現場ユーザーの反応を運...
商用巨大LLM

【geek-terminalニュース】Gemini 3.7 Flash、低価格コーディングエージェント時代の最新情報

📝 本日のニュース概要 GoogleがGemini 3.7 Flashを発表。3.6 Flashから3週間で投入された新Flashは、低価格・高速だけでなく、コーディング、Web開発、エージェント実行の実用モデル候補として注目されています。...
商用巨大LLM

【geek-terminalニュース】Grok 4.6検証、上位モデル級で安い説の最新情報

📝 本日のニュース概要 以前お伝えしたGrok 4.5価格性能トピックの続報です。Grok 4.6がOpenAI上位モデル級に迫り、価格では下回るという主張が出ています。ただし公式・大手メディアの裏付けではGrok 4.6固有のベンチ、価格...
商用巨大LLM

【geek-terminalニュース】Claude Opus 5運用論、ベンチ勝負からeffort・トークン効率・注入耐性へ

📝 本日のニュース概要 以前お伝えしたClaude Opus 5発表の続報です。今回は新モデルの能力自慢ではなく、effort設定、トークン効率、agentic coding、ブラウザ型prompt injection耐性、ベンチマーク汚染...
商用巨大LLM

【geek-terminalニュース】Claude Opus 5の最新情報

📝 本日のニュース概要 AnthropicがClaude Opus 5を発表。Fable 5級に近い能力を半分の価格で狙う新Opusを、ベンチ、価格、effort設定、音声モード、コミュニティの反応から深掘りします。 以前お伝えしたClau...
商用巨大LLM

【geek-terminalニュース】GPT-5.6 Sol検証フェーズの最新情報

📝 本日のニュース概要 以前お伝えしたGPT-5.6一般公開の続報です。今回はSol/Terra/Lunaの発表概要ではなく、Solの推論レベル運用、Responses API、自律ポストトレーニング、数学証明PDF、SimpleBench...
商用巨大LLM

GPT-5.6公開とChatGPT Workの最新情報

📝 本日のニュース概要 OpenAIがGPT-5.6を一般公開し、Sol/Terra/Lunaの3層モデルとChatGPT Workを同時に打ち出しました。低コスト高性能モデル競争と、チャットUIから完遂型ワークフローAIへの重心移動を深掘...
商用巨大LLM

【geek-terminalニュース】GPT-Liveの最新情報:音声AIが“ターン制チャット”から常時割り込み可能な会話プロセスへ

📝 本日のニュース概要 OpenAIのGPT-Liveにより、ChatGPT Voiceは聞くことと話すことを同時に扱うLive体験へ進化。API実装者にとってはRealtimeモデル、VAD、レイテンシ、推論委譲、UX設計の再設計ポイント...
学術研究

【geek-terminalニュース】Claudeの“未発話の内的表現”を読むJacobian Lens/J-spaceの最新情報

📝 本日のニュース概要 Anthropicの研究「Verbalizable Representations Form a Global Workspace in Language Models」を軸に、Claude内部のJ-space、Ja...