AIエージェント

Cloudflare Clef-omni は音声と動画をどこまで判定できるか ── 通話の用件は得意、異常音と感情は苦手

2026年10月9日に公開された Cloudflare の判定モデル Clef-omni は、音声と動画をそのまま入力できます。音声508件・動画206本のテストデータを自作し、通話の用件・環境音・声の感情・機械の異常音・動画の動き・画面録画・映像と音の照合を実測しました。文字起こし経由との比較、Liquid AI の d1-omni-600M との比較、速度と費用、使い分けのコツをまとめます。
AI最新情報

LightOnOCR-3 で RAG の前処理は1つのモデルにまとまるか? 日本語の帳票で PaddleOCR-VL・olmOCR と比べた

2026年10月に公開された文書解析モデル LightOnOCR-3(0.8B・1B・4B、Apache 2.0)を Mac で動かし、正解が分かる日本語の帳票・グラフ・olmOCR-Bench・情報通信白書で PaddleOCR-VL-1.6・olmOCR-2 と比べました。文字・表・グラフの数値・枠・写真の説明・速度の実測と、grounding の出力を RAG のチャンクにするコードを紹介します。
AI入門

DMM 生成AI CAMP 学び放題とは? 学べる内容・料金・SHIFT AIなど他サービスとの違いを整理【2026年10月版】

DMM 生成AI CAMP 学び放題で学べる内容、料金と解約の条件、SHIFT AIなど他サービスとの違い、向いている人・向いていない人を、公式情報をもとに整理しました(2026年10月8日時点)。
AIトレンド

AXとDXは何が違う? 「AIを前提に業務を見直す」の中身

「これからはDXではなくAX」と言われますが、政府は2026年7月の閣議決定文書でDXとAXをそれぞれ定義し、AXを「あらゆる組織で、AIを前提として意思決定や業務の進め方を根底から見直すこと」としています。経済産業省・デジタル庁・内閣府・総務省・IPAの公式資料を読み比べ、定義の違い、DXとの関係、企業がAXを進めるときに使える国の指針をまとめます。
AIエージェント

OpenAI の Decisions API は何に使える? 速い「選ぶだけ」API の向き・不向き

OpenAI が2026年10月6日(米国時間)にパブリックベータで公開した Decisions API を、日本語のデータで約320回呼んで検証しました。応答は中央値0.20秒で、既定設定の Responses API の約11倍速い一方、料金はほぼ同じ。choice 形式は先に書いた選択肢に寄る偏りがあり、確率がほしいなら predicate が正確でした。振り分け・エージェントの操作選択・安全チェック・画像確認など、向いている用途と落とし穴をまとめます。
AI入門

Sonnet 5.5 があるのに、なぜ Claude Haiku 5.5 を使うのか

2026年10月7日に公開された Claude Haiku 5.5 は、Sonnet 5.5 で十分な人にも必要なのか。Claude Code で Haiku 5.5・Sonnet 5.5・Haiku 4.5 に同じ課題を解かせ、正解率・費用・時間を比べました。コード調査は同じ正解率で費用約1/8、Sonnet を指揮役に残して調査係だけ Haiku にすると費用58%減。一方、77種類の分類では Haiku 5.5 は60%で Sonnet 5.5 の81%に届きませんでした。
AI最新情報

EmbeddingGemma 2 は何が変わった? 画像・音声・コードを1つのベクトルで検索できるか Mac で試した

Google DeepMind が公開した EmbeddingGemma 2(740M、Apache 2.0)は、テキスト・コード・画像・動画・音声を1つの768次元のベクトル空間に置く埋め込みモデルです。旧版との違いと公式ベンチマークの変化を整理し、Mac(M5 Max)で日本語テキスト・コード検索・写真・文書ページ・音声・動画・混在索引の6つの実験を行いました。写真検索は画像専用モデルの約2倍、日本語テキストは旧版とほぼ同じ、そして1つの索引に混ぜるとテキストが上位を独占する落とし穴も見つかりました。
AI最新情報

Microsoft GraphRAG は何が違う? ベクトル検索RAGと同じ社内文書で比べてみた

Microsoft の GraphRAG は、文書からエンティティと関係を抽出して知識グラフを作り、Leiden でコミュニティに分けて要約を事前生成する RAG です。ふつうのベクトル検索 RAG と何が違うのかを仕組みから整理し、架空の社内文書34本・同じ10問を Mac のローカル LLM(Qwen3.8-27B)で両方に投げて比較しました。索引作成のコストと、GraphRAG が効く質問・効かない質問を実測で示します。
AIエージェント

AIエージェントの「完了しました」は本当? 最後のDBで採点する ThinkingBox を手元で動かす

Microsoft と Hugging Face が公開した ThinkingBox は、AIエージェントの返事ではなく作業後のデータベースの状態で採点し、同じ仕事を20回繰り返して「1回できる」と「毎回できる」を分けて測る評価環境です。従来の評価の課題と仕組み、公式の結果を整理し、MacBook Pro でローカルの Qwen3.8-27B を使って実際に動かした結果をまとめます。
AI最新情報

MAI-Transcribe-2-Streamingは日本語でも速いのか? Gemini 3.5 Transcribe Live・Gemini 3.8 TTSとの違い

Microsoft の MAI-Transcribe-2-Streaming を Mac から日本語で実測し、Gemini 3.5 Transcribe Live と速さ・正確さを比べました。読み上げの MAI-Voice-2.1 と Gemini 3.8 TTS の違い、料金、Gemini が文の途中で聞き取りをやめる問題の直し方まで、デモ動画と音声つきでまとめます。