2025年6月第4週のAIニュース:Claude Desktop Extensions、Gemini CLI、Gemma 3nほか

AI入門

2026年10月8日改訂:この記事は2025年6月30日に公開した、2025年6月第4週(6月22〜28日ごろ)のAIニュースの記録です。各ニュースの日付・製品名・数値を公式発表などの一次資料で確かめ、誤り(「Gemma 2」は正しくは「Gemma 3n」、Desktop ExtensionsのWindows対応、PwC調査の数値など)を訂正しました。根拠を確認できなかった記述は削除しています。本文は当時の発表に基づく内容で、その後の変更は末尾の「その後の動き」にまとめました。

2025年6月第4週は、AIを外部のツールやデータにつなぐ仕組みと、開発者向けツールの発表が重なった週でした。主な発表は、MCPサーバーを導入しやすくするAnthropicの「Desktop Extensions」、ClaudeのアーティファクトからClaudeを呼び出せる機能、ChatGPTのコネクタ拡大、Googleの「Gemini CLI」と「Gemma 3n」、ElevenLabsの「Voice Design v3」などです。後半では、同じ時期に公表された日本企業の生成AI活用調査と、AI時代の組織やキャリアについての論考も取り上げます。

この週の主な発表と日付

日付は各社の発表に基づき、米国時間のものも含みます。対象週の少し前に公開されたものも、同じ流れのニュースとして載せています。

日付発表元内容一次資料
2025年6月20日BloombergLinkedIn CEO、Ryan Roslansky氏のインタビューBloomberg
2025年6月22日VentureBeat(PagerDuty幹部の寄稿)AI導入の「4つのE」VentureBeat
2025年6月23日PwC Japan生成AIに関する実態調査 2025春 5カ国比較PwC
2025年6月25日GoogleGemini CLI(オープンソースのAIエージェント)Google
2025年6月25日AnthropicClaudeで作るAI搭載アーティファクト(ベータ)Anthropic
2025年6月25日ElevenLabsVoice Design v3ElevenLabs
2025年6月25日Google DeepMindAlphaGenome(ゲノム解析モデル)Google DeepMind
2025年6月26日AnthropicDesktop Extensions(.dxt)Anthropic
2025年6月26日GoogleGemma 3nの正式公開Google
2025年6月下旬OpenAIProプランの通常のチャットでもコネクタが使えるようにChatGPT リリースノート
2025年6月HeyGenProduct Placement(商品紹介動画)HeyGen

表のうちAlphaGenomeは、元の記事では扱っていませんでしたが、同じ週の主要な発表なので日付を記録しておきます。DNA配列を最大100万塩基対まで入力し、遺伝子の働きの調節に関わる多数の性質を1塩基単位で予測する研究用のモデルです。発表時点では、非商用の研究向けにプレビュー版のAPIとして提供されました。病気の理解や創薬への応用は当時の期待であり、発表時点で実現していた成果ではありません。

Claude Desktop Extensions:MCPサーバーの導入をワンクリック化(2025年6月26日)

MCP(Model Context Protocol)は、AIアプリを外部のツールやデータにつなぐための公開仕様です。それまで、Claude Desktopで手元のPCのMCPサーバーを使うには、設定ファイル(JSON)を手で書き換え、Node.jsやPythonなどの実行環境と依存するパッケージを自分で用意する必要がありました。Anthropicも発表の中で、こうした導入の手間を課題に挙げています。

Anthropicが2025年6月26日に発表したDesktop Extensionsは、MCPサーバー本体、依存関係、設定項目の定義(manifest.json)を1つのファイル(拡張子 .dxt)にまとめる形式です。利用者はファイルをClaude Desktopにドラッグ&ドロップするか開くだけで、インストール画面から導入できます。Node.jsの実行環境はClaude Desktopに同梱されており、APIキーなどの秘密情報はOSのキーチェーンに保存されると説明されています(Anthropic公式説明)。

対応OSはmacOSとWindowsです。旧版の「Windowsでは利用できない」という記述は誤りでした。ただし、Appleのメモ(ノート)やiMessageとの連携のように、Macのアプリを操作する拡張機能は、性質上macOS向けです。Claude Desktopの設定画面には拡張機能の項目が加わり、Anthropicが選んだ拡張機能をアプリ内の一覧から探して導入できる仕組みも案内されました。ファイルシステム用の拡張機能では、アクセスを許可するフォルダを指定してから使います。

開発者向けには、仕様、CLI(@anthropic-ai/dxt)、参照実装がMITライセンスのオープンソースとして公開されました。当時の手順では、次のように manifest.json のひな形を作ってからパッケージにまとめます(形式の名前はその後変わりました。末尾の「その後の動き」を参照)。

# 2025年6月当時のDXT CLIでパッケージを作る手順
npm install -g @anthropic-ai/dxt

# MCPサーバーのフォルダで、manifest.json を対話形式で作成する
dxt init

# .dxt ファイルを生成する
dxt pack

GPTsにもActionsで外部APIを呼ぶ機能はありました。Desktop Extensionsとの違いは、手元のPCで動くMCPサーバーを、設定作業なしで導入できる点です。Anthropicは、ほかのAIデスクトップアプリでも同じ形式を使えるよう仕様を公開したと説明しており、MCPの普及を後押しするという見方が当時ありました。ただし、これは発表時点の見通しで、実際の普及の程度を示すものではありません。

ClaudeのアーティファクトからClaudeを呼び出せるように(2025年6月25日)

アーティファクトは、Claudeとの会話画面の横で、生成したHTMLやReactのアプリをその場で表示・実行する機能です。2024年から提供されていました。2025年6月25日、Anthropicは、アーティファクトの中からClaudeを呼び出せる機能をベータ版として発表しました(Anthropicの発表)。たとえば「ボタンを押すとClaudeが文章を作って画面に表示する」ようなアプリを、会話だけで作れるようになりました。

特徴は費用の負担の仕方です。作ったアプリをほかの人が使うときは、その人が自分のClaudeアカウントでサインインし、利用分は作成者ではなく利用者のプランに計上されます。作成者がAPIキーを管理する必要もありません。発表時の対象はFree・Pro・Maxプランでした。

発表時点では制約もありました。外部APIの呼び出しやデータの永続保存はできず、Claudeとのやりとりはテキストの入出力に限られていました。会話の履歴を持たせたい場合は、過去のやりとりを自分でまとめてプロンプトに含める必要があります(Simon Willison氏の解説)。

Anthropicは初期の作例として、プレイヤーに合わせて反応が変わるNPC(ゲーム内の登場人物)のいるゲーム、学習ツール、CSVファイルを読み込むデータ分析アプリ、文章作成の支援などを挙げています。旧版ではフラッシュカードや3D空間のゲームなどを例に「短時間で作れる」と書きましたが、作れるものや作成にかかる時間はプロンプトや題材によって変わるため、一概には言えません。

それまでの業務特化型AIの多くは、決まったチャット画面の裏でプロンプトを変える形でした。この機能を使うと、画面の構成や操作の流れまで含めた専用のアプリを作り、リンクで共有できます。ただしベータ版の機能なので、業務システムの代わりに使えるかは、上の制約を踏まえて判断する必要があります。

ChatGPTのコネクタが通常のチャットにも拡大

OpenAIの公式リリースノートには、2025年6月24日付で、Proプラン向けに通常のチャットで使える検索コネクタを追加したと記載されています。対象はDropbox、Box、Google ドライブ(同期型・非同期型)、Microsoft OneDrive(Business)、Microsoft SharePointでした。当時はEEA・スイス・英国以外での提供と案内されています。

この更新によってProプランでも、Google ドライブ・Dropbox・SharePoint・Boxのコネクタがディープリサーチの外、つまり通常のチャットで使えるようになりました(ChatGPTのリリースノート)。「ディープリサーチ限定だった機能が通常のチャットで使えるようになった」と一度に変わったのではなく、プランごとに段階的に提供が広がったというのが正確です。

この機能の意味は、Web上の公開情報ではなく、会社や個人が持つファイルを検索して回答に使えることです。たとえば「直近3か月の登壇資料を探して、テーマと内容を表にまとめて」といった依頼が考えられます。何回検索するか、どのように推論を進めるかは、選んだモデルや質問の内容によって変わります。

社内の情報を扱う場合は、データの扱いを確認しておくことが大切です。OpenAIは、Team・Enterprise・Eduの顧客がコネクタ経由で参照した情報をモデルの学習に使わないと説明しています。過去の登壇資料などを探し出して再利用しやすくなる一方で、どのフォルダを接続するかは、社内の規程に沿って決める必要があります。

ElevenLabs Voice Design v3:文章の説明から声を作る(2025年6月25日)

ElevenLabsは2025年6月25日、文章で説明した特徴から新しい声を作る「Voice Design」の新版、v3を発表しました(ElevenLabsの公式ブログ)。年齢、なまり、声のトーン、話す速さなどをプロンプトで指定すると候補が3つ生成され、気に入ったものを選んで保存できます。実在の人に近いリアルな声と、キャラクター向けの声のどちらも作れるとしています。

保存した声は、別の文章を読み上げるときにも同じ声で使えます。Web画面とAPIのどちらからでも利用できます。発表によると、プレビューの料金はプレビュー用テキストの文字数分だけで、裏で3つの候補を生成しても3倍にはなりません。ゲーム、アニメーション、プレゼン資料などで、同じキャラクターの声をそろえたい場面に向いています。

使い方の一例として、旧版では、Midjourneyなどで作ったキャラクター画像をClaudeに見せ、見た目に合う声の説明文を書かせてからVoice Designに入力する方法を紹介しました。これはElevenLabsの機能ではなく、複数のツールを組み合わせた使い方です。たとえば力強い戦士なら「低く太い声」、優雅なエルフなら「澄んだ柔らかい声」のように説明を書きますが、出来上がる声がどこまで意図に近づくかは説明文の書き方しだいです。

作った音声を、画像からリップシンク(口の動きを音声に合わせる)動画を作るツールと組み合わせれば、キャラクターが話す動画も作れます。商用で使えるかどうかや、実在の人物に似せた声の扱いは、各サービスの規約を確認してください。

HeyGen Product Placement:商品写真から紹介動画を作る

動画生成サービスのHeyGenは、2025年6月の製品アップデートで「Product Placement」を追加しました。商品の写真と、話し手になる人物の顔写真(自分の写真またはサンプル)を用意して台本を入力すると、人物が商品を紹介する動画を生成する機能です。人物の身ぶりや口の動きには、同社のアバター技術「Avatar IV」が使われると紹介されていました。

ナレーションは台本から自動で作れます。HeyGenの機能紹介ページでは、175以上の言語・方言に対応するとしています(HeyGenの機能紹介、2026年10月時点の記載)。ElevenLabsなど別のサービスで作った音声と組み合わせる使い方も考えられますが、音声ファイルを持ち込めるかどうかや、その手順はプランや画面の仕様によって異なるため、使う前に確認してください。

旧版の「商品の位置や大きさが動画全体で一定に保たれる」という記述は、公式に保証された仕様として確認できなかったため撤回します。生成された動画で商品の形やロゴ・文字が正しく描かれているとは限らないので、公開前に確認が必要です。

撮影や機材を用意しなくても商品紹介動画を試作できる点は、中小企業や個人事業主にとって利点です。一方、広告に使う場合は、AIで生成した人物であることの表示を求められることがあります。各広告媒体の規約も確認しておきましょう。

Gemini CLIとClaude Code:ターミナルで動くAIエージェント

Googleは2025年6月25日、ターミナル(コマンドを入力して操作する画面)でGeminiを使えるオープンソースのAIエージェント「Gemini CLI」を公開しました(Googleの発表)。ライセンスはApache 2.0です。個人のGoogleアカウントでログインすると、Gemini 2.5 Pro(100万トークンを扱えるモデル)を1分あたり60リクエスト、1日1,000リクエストまで無料で使えると発表されました。

Gemini CLIはただのチャットではなく、ファイルを読み、書き換え、コマンドを実行するところまでを一続きで進められます。たとえば「このファイルの問題点を挙げて」と頼んで指摘を受け、続けて「修正して」と頼めば、変更案を示したうえでファイルを書き換えます。

旧版には「2クリック程度でインストールできる」と書きましたが、実際にはNode.jsを用意したうえでコマンドを実行する必要があります。macOS・Linux・Windowsで共通の基本的な手順は次のとおりです(GitHubのリポジトリ)。

# Node.js がインストール済みであることを前提に、Gemini CLI をグローバルに入れる
npm install -g @google/gemini-cli

# 作業したいフォルダで起動する(初回はGoogleアカウントでログイン)
gemini

Anthropicの「Claude Code」も、ターミナルで動くコーディングエージェントです。2025年6月当時、WindowsではWSL(Windows上でLinuxを動かす仕組み)を入れる必要がありましたが、2025年7月のアップデート(v1.0.51)でWindowsにネイティブ対応しました(公式変更履歴)。

Claude Codeは、作業をToDoリストに分け、進み具合を表示しながら進める作りになっています。旧版では「Claude Codeのほうが高度」と評価しましたが、同じ条件で比べた記録を確認できないため、この性能評価は撤回します。料金面では、Gemini CLIは無料枠が大きく、Claude Codeは有料プランかAPIの利用が前提という違いがありました。

Cursorのような開発環境に組み込まれたチャット機能との違いは、ターミナルからファイル操作やコマンドの実行まで任せられる点です。どちらが向いているかは、扱うコードや作業の進め方によって変わります。

Gemma 3n:端末で動かすことを目指した軽量マルチモーダルモデル(2025年6月26日)

Googleは2025年6月26日、オープンモデル「Gemma 3n」を正式に公開しました(Google Developers Blog)。旧版では「Gemma 2」「約100億パラメータ」と書いていましたが、この週に発表されたのはGemma 3nで、数値も誤っていました。

Gemma 3nにはE2BとE4Bの2種類があります。元のパラメータ数はそれぞれ約50億と約80億ですが、構造を工夫したことで、必要なメモリは従来の20億・40億パラメータ級のモデルと同程度(約2GB・約3GB)に抑えられるとしています。入力は画像・音声・動画・テキストに対応し、出力はテキストです。Googleによると、E4BはLMArenaのスコアが1300を超え、100億パラメータ未満のモデルとしては初めてこの水準に達しました。

旧版の「画像処理機能を含むバージョンは公開されていない」という記述も正確ではありません。モデルそのものはマルチモーダルに対応して公開されています。ただし、画像などをどこまで扱えるかは実行ツールやモデルファイルの形式によって異なるため、使う前に各ツールの対応状況を確認してください。Googleは、Hugging Face Transformers、llama.cpp、Ollama、MLX、LM Studioなどでの利用を案内しています。

手元の端末で動かせば、入力したデータを外部のクラウドに送らずに処理できます。そのため、機密情報を扱う場面での選択肢になります。手元で画像や文書を整理された形に変換してから、クラウドのAIで活用するといった組み合わせも、当時想定されていた使い方の一つです。

旧版の「50万円程度の高性能パソコンが必要で、スマートフォンでの動作は困難」という記述は、スマートフォンなどの端末で動かすことを主な目的に設計したというGoogleの説明と食い違うため、撤回します。実際の速度は、端末の性能や量子化(モデルを軽くする処理)の設定で変わります。旧版で触れたテキスト応答の所感も、実行条件を記録していないため、性能の評価としては扱いません。

日本企業の生成AI活用:PwC調査が示した効果の差(2025年6月23日)

PwC Japanグループは2025年6月23日、「生成AIに関する実態調査 2025春 5カ国比較」を公開しました。日本・米国・英国・ドイツ・中国の、売上高500億円以上の企業に勤める課長職以上の人を対象にした調査です。回答数は日本945名、米国670名、中国512名、英国412名、ドイツ103名でした。

日本で「社内で活用中」または「社外に生成AIサービスを提供中」と答えた割合は56%で、前回より13ポイント増えました。一方、「期待を大きく上回る効果」を得ている企業の割合は、日本は米国・英国の約4分の1、ドイツ・中国の約半分にとどまりました。旧版の「日本は6割程度、他国は9割近く」という数字は調査結果と一致しないため、訂正します。

前回(2024春)との比較では、日本で「まだ効果を評価できていない」が11ポイント減り、「やや期待を下回る」と「期待とはかけ離れた結果になった」が合わせて7ポイント増えました。効果を評価できる段階まで進んだ企業が増えた一方で、期待どおりの成果を得られていない企業も増えたことになります。

期待を上回る効果を得た企業の特徴として、PwCは次の点を挙げています。

  • 目的意識:生成AIを、業界の構造を根本から変える機会と捉えている
  • 推進体制:約6割が社長直轄で進めている(期待を下回った企業では1割未満)
  • 責任者:約6割がCAIO(最高AI責任者)を置いている(期待を下回った企業では約1割)。旧版の「CIAO」は誤記でした
  • 業務の置き換え:約7割が、生成AIで業務を「完全に置き換える」か「大部分を置き換える」と見込んでいる
  • 正式な業務への組み込み:生成AIを正式な業務として使っているかどうかでも、期待を下回った企業と大きな差がある

これらは調査で見られた相関で、同じ取り組みをすれば必ず効果が出るという因果関係を示すものではありません。それでも、現場の判断に任せて補助的に使うだけでなく、経営層が目的と体制をはっきりさせて業務そのものを見直している企業ほど効果を実感している、という傾向は読み取れます。

AI導入を組織に根づかせる「4つのE」

AI導入を組織に定着させるための枠組みとして、PagerDutyでエンジニアリング担当のSVPを務めるRukmini Reddy氏が、2025年6月22日のVentureBeatへの寄稿で「4つのE」を示しました(VentureBeatの記事)。技術の導入だけでなく、不安を抱える社員への共感を重んじている点が特徴です。

第一のEは「エヴァンジェリズム」です。これは単にAIの素晴らしさを宣伝することではなく、なぜその人にとって重要なのかを具体的に説明し、個人のメリットを明確にすることです。技術の押し付けではなく、個人の課題解決につながることを示すことが重要です。

第二のEは「イネイブルメント」、つまり支援です。技術的な教育だけでなく、感情的なサポートも含めた包括的な支援が必要です。研修時間の確保、失敗を許容する環境の整備、継続的なサポート体制の構築などが含まれます。

第三のEは「エンフォースメント(Enforcement)」です。言葉の響きとは違い、上からの命令で使わせることではありません。何を期待しているのかとその理由を共有することを指します。現実的な期待値と測定できる目標を決め、進み具合を組織全体から見える形で共有することが勧められています。

第四のEは「エクスペリメンテーション」、つまり実験的取り組みです。すべてが最初から成功するわけではないため、失敗を学習機会として捉える文化を構築することが重要です。安全に失敗できる環境を用意し、継続的な改善を通じて最適解を見つけていくアプローチが求められます。

これらの4つのEを意識することで、単なる技術導入を超えた、組織全体の変革を伴うAI活用が可能になります。

LinkedIn CEOが語ったAIとキャリア

LinkedInのCEO、Ryan Roslansky氏は、2025年6月20日に配信されたBloombergのインタビューで、AIによって多くの混乱と不確実性が生じるという見方を示しました(Bloomberg)。あわせて、AIが代わりを務めにくい能力として、コミュニケーションとコラボレーションを磨くよう勧めています(WebProNewsの報道)。

職種の名前が同じでも、仕事の中身は変わっていきます。AIの専任ではない職種でも日常の業務でAIを使うことが前提になりつつあり、使いこなせるかどうかで成果に差が出る、というのが当時よく語られていた見方です。

以下は、Roslansky氏が挙げた2つの能力について、本稿で補足的に整理したものです。

コミュニケーション能力においては、相手の感情や文脈を読み取る力、言葉になっていない部分を察知する能力が重要です。また、長期的な人間関係に基づく信頼関係、個人的な体験や失敗、価値観に基づいたメッセージの重みなど、AIには代替できない要素があります。

コラボレーション能力では、メンバー間の見えない関係性や相性を察知し、チーム全体として機能させる力が求められます。論理では説明できない取り組みを推進する力、個性を生かしてチーム力を最大化する能力など、人間関係に基づく能力が重要になります。

これらは極めてアナログで、AIとは直接関係のない分野ですが、むしろそれゆえにAI時代において価値が高まっていく人間独自の能力といえます。

AIエージェントを管理する役割という考え方

AIエージェントが広がるにつれて、自分でコードを書くことよりも、AIが作業しやすい環境を整え、目的を伝え、結果を確認する役割が大切になる、という議論が見られるようになりました。旧版ではこれを「AIエージェントマネージャー」と呼び、8つのステップや独自の評価指標を紹介しましたが、提唱元の一次資料を確認できなかったため、具体的な手順と指標名は削除しました。

この考え方の中心は、AIに必要な情報をどう渡すかです。たとえば、作業の前提や決まりごとをリポジトリ内の文書にまとめておく、MCPサーバーを通じて社内の情報を参照できるようにする、といった準備がこれに当たります。こうした整理にはプログラミングの専門家でなくても担える部分がありますが、独立した職種として定着するかどうかは、当時はまだ将来の見通しでした。

まとめ:2025年6月第4週に見えた流れ

この週の発表からは、AIを外部のツールやデータにつなぐ仕組みを、専門家以外にも使いやすくしようとする動きが見えました。Desktop ExtensionsはMCPサーバーの導入を簡単にしました。ChatGPTのコネクタは社内のファイルを、Gemini CLIやClaude Codeは手元のファイルやコマンドを、AIが扱える範囲に加えるものです。

一方でPwCの調査は、ツールを入れるだけでは効果につながりにくく、経営層が関わり、業務の見直しまで進めている企業ほど効果を実感している傾向を示しました。4つのEやLinkedIn CEOの発言も、技術そのものより、人と組織がどう変わるかに焦点を当てています。

個人としては、新しいツールを試しながら、コミュニケーションやコラボレーションといった人と人との力も磨くことが、当時の論考に共通する提案でした。なお、どの技術がどこまで普及するかは、発表の時点ではまだ見通しの段階でした。

その後の動き(2026年10月時点の追記)

本文は2025年6月当時の発表に基づいています。その後の主な変更は次のとおりです。

  • Desktop Extensionsの拡張子は .dxt から .mcpb(MCP Bundle)に変わりました。既存の .dxt も引き続き動作すると案内されています(Anthropic Engineering)。
  • Claude Codeは2025年7月のv1.0.51でWindowsにネイティブ対応し、WSLは必須ではなくなりました(公式変更履歴)。
  • AlphaGenomeの論文は2026年1月にNatureに掲載されました(Google DeepMind)。

参考資料

PR

生成AIを体系的に学びたい方へ

「DMM 生成AI CAMP 学び放題」は、ChatGPTなどの生成AIを学べる月額制のオンライン学習サービスです。仕事への活用に向けて継続的に学びたい方は、公式サイトでコース内容や入会条件をご確認ください。

DMM 生成AI CAMP 学び放題

リンク先は公式サイトです。

AI入門
Takuyaをフォローする