AI最新情報

Microsoft GraphRAG は何が違う? ベクトル検索RAGと同じ社内文書で比べてみた

Microsoft の GraphRAG は、文書からエンティティと関係を抽出して知識グラフを作り、Leiden でコミュニティに分けて要約を事前生成する RAG です。ふつうのベクトル検索 RAG と何が違うのかを仕組みから整理し、架空の社内文書34本・同じ10問を Mac のローカル LLM(Qwen3.8-27B)で両方に投げて比較しました。索引作成のコストと、GraphRAG が効く質問・効かない質問を実測で示します。
AIエージェント

AIエージェントの「完了しました」は本当? 最後のDBで採点する ThinkingBox を手元で動かす

Microsoft と Hugging Face が公開した ThinkingBox は、AIエージェントの返事ではなく作業後のデータベースの状態で採点し、同じ仕事を20回繰り返して「1回できる」と「毎回できる」を分けて測る評価環境です。従来の評価の課題と仕組み、公式の結果を整理し、MacBook Pro でローカルの Qwen3.8-27B を使って実際に動かした結果をまとめます。
AI最新情報

MAI-Transcribe-2-Streamingは日本語でも速いのか? Gemini 3.5 Transcribe Live・Gemini 3.8 TTSとの違い

Microsoft の MAI-Transcribe-2-Streaming を Mac から日本語で実測し、Gemini 3.5 Transcribe Live と速さ・正確さを比べました。読み上げの MAI-Voice-2.1 と Gemini 3.8 TTS の違い、料金、Gemini が文の途中で聞き取りをやめる問題の直し方まで、デモ動画と音声つきでまとめます。
AIエージェント

LlamaIndex Extract v2.5 は日本語 PDF の抽出をどこまで変えるか ― 長いリスト・ページまたぎ・手書き帳票で Before/After

LlamaIndex の文書抽出サービス Extract v2.5 を API で実際に試しました。長いリスト・ページをまたぐ記録・手書きの請求書という、従来の方法が苦手な日本語の架空文書4種で、ルール抽出・ローカル LLM・旧版 v2.1 と比べ、何が良くなり何が残ったかをスクリーンショットと動画で示します。
AIエージェント

コーディング AI は「写し書き」で何倍速くなる? AgSpec の仕組みを半分だけ実装して確かめる

コーディングエージェントの出力は、さっき読んだコードやログの書き写しが多い。AgSpec(arXiv 2610.01108)はそれを先回りして写し、モデルにまとめて確かめさせることで生成を最大4.76倍にしました。仕組みをかみくだいて説明し、方針の部分を Mac(MLX)で実装して、どの工夫がどれだけ効くか、Mac では何が違ったかを検証します。
AI最新情報

「資料にない答えは言わない」は本当か Kolibri-1 を Mac で動かして Qwen と比べた

ドイツの Aleph Alpha が公開したオープンモデル Kolibri-1 は「資料に答えが無ければ答えない」能力を訓練で教え込んだと公表しています。MacBook Pro(M5 Max・128GB)で動かし、Qwen3.6・Qwen3.5 と 650 問で比べると、指示なしでは Kolibri がいちばん答えてしまい、「答えないで」の 1 文を足すと逆にいちばんよく控えました。手順・数字・使い分けをまとめます。
AIエージェント

AIの採点をAIに任せていい? CompMat-Benchの「正解+固定ルール」とLLM-as-a-Judgeを比べた結果

AI エージェントの答えを別の LLM に採点させる LLM-as-a-Judge の弱点と、計算材料科学のベンチマーク CompMat-Bench が「研究を先に再現した正解データ+固定ルール」で採点する仕組みを解説。同じ方式を手元の Mac で再現し、Claude・GPT のジャッジと比べた検証結果(正確さ・誤答の見逃し・判定の揺れ・費用)をまとめました。
AIエージェント

AI エージェントを ESP32 や Raspberry Pi につなぐには? Meta「Muse Gadgets」の仕組みと Mac で試した結果

Meta が公開した Muse Gadgets(AI エージェント Muse を ESP32・Raspberry Pi につなぐオープンソースの SDK)を、公式サイト・GitHub のソース・利用規約から詳しく調べました。デバイスとクラウドがつながる仕組み、家庭内トンネル、日本から使えるかを解説し、ボードなしの Mac で UI シミュレーター、通信の模擬実験、ファームウェアのビルドまで試した結果を紹介します。
AIエージェント

DeepSeek Harness は Codex のハーネスと何が違う? 中身を読んで、Claude Code・Codex に流用できる書き方を探す

DeepSeek が MIT ライセンスで公開したエージェント実行基盤 DeepSeek Harness を、リポジトリの調査とローカルモデルでの実行で確かめ、OpenAI Codex のハーネスとの違いと、Claude Code・Codex にそのまま持ち帰れる書き方(指示書の共有、フックの流用、空回り防止の注意文など)を実例付きで紹介します。
AIエージェント

Qodo 3.0 は Claude Code・Codex のレビューと何が違う? 壊れる3本の PR で確かめた

AI コードレビューの Qodo が発表した Qodo 3.0 について、会社の信用度や大手との関係を公式資料で確かめ、OSS の PR-Agent・Claude Code・Codex に「組み合わせると壊れる」3本の PR をレビューさせて違いを整理しました。