OCR

ローカルLLM

【geek-terminalニュース】DeepSeek V4 Flash Vision Expの噂で画像理解コスト再計算へ

📝 本日のニュース概要 以前お伝えしたDeepSeek V4 Flashの続報です。今回は、コミュニティで話題化しているVision対応Flashモデル疑惑を、公式確認済みのDeepSeek-VL情報と切り分けながら、低コストAPI、ローカ...
ローカルLLM

【geek-terminalニュース】3B級オンデバイス画面理解VLM「LFM2.5-VL-3B」の最新情報

📝 本日のニュース概要 Liquid AIが公開したLFM2.5-VL-3Bを深掘り。3.1B規模で画面理解、OCR、物体グラウンディング、複数画像推論、関数呼び出しまで統合し、GUI自動化をクラウドVLM依存から剥がす部品になり得るのかを...
AIツール&サービス

【geek-terminalニュース】Mistral OCR 4でPDF RAGの入口が構造化レイヤー化する最新情報

📝 本日のニュース概要 以前お伝えしたBaidu Unlimited OCRの続報。今回はMistral OCR 4を中心に、OCRが単なる文字起こしから、引用付きJSON、構造化出力、RAG投入前の文書理解レイヤーへ進化している流れを深掘...
AIツール&サービス

【geek-terminalニュース】Baidu Unlimited OCRの最新情報

📝 本日のニュース概要 Baiduが公開したUnlimited OCRを解説。PDFや帳票をLLMに食わせる前処理を、ページ単位の分割処理からワンショット長文書解析へ動かす可能性を掘り下げます。 【事象の全貌と背景】BaiduのUnlimi...