KDDIアイレット株式会社 クラウド・イノベーション本部 DX開発事業部です!
DX開発事業部ではお客様のDX実現のために、生成AIのキャッチアップに日々取り組んでおります🔥
本記事では日々アップデートされる生成AI周りのニュースを週刊でお届けします🚀
今週はAmazon RedshiftがAgent Toolkit for AWSと統合され、AIエージェントから直接データウェアハウスを管理できるようになりました🔥 Google関連では、動画生成モデル「Gemini Omni 1.1 Flash」や高精度な音声認識モデル「Gemini 3.5 Transcribe」の発表に加え、Google Searchへの旅行予約機能追加やGeminiアプリでの対話型シミュレーション生成など、幅広い分野でのアップデートがありました🚀 Anthropicからは「Claude in Chrome」の一般提供開始、「Claude Cowork」への組み込みブラウザ追加、chatとCoworkでのメモリ統合など、Claudeのエージェント機能とユーザー体験を強化する発表が相次ぎました✨
AWS
Amazon Redshift、Agent Toolkit for AWSと統合しAIエージェントによるデータウェアハウス管理に対応
Amazon Redshiftが「Agent Toolkit for AWS」と統合され、Claude Code、Kiro、CursorなどのAIエージェントから直接データウェアハウスやデータレイクを管理できるようになりました。
AWS MCP(Model Context Protocol)サーバーが認証付きAPI実行を担うほか、「Redshift skills」と呼ばれる検証済み手順とリファレンス資料のパッケージが提供されます。SQL構文リファレンスによるクエリ生成エラーの削減、スキーマ・メタデータの探索、データロードパターンやマテリアライズドビューのベストプラクティス提供に加え、発見からスキーマ変換、データ移行、検証まで一貫したデータウェアハウス移行支援も可能です。
- Provisioned clusters・Serverless workgroupsの両方に対応し、既存インフラの変更は不要
- 追加料金なしで利用可能
- Amazon RedshiftとAWS MCP Serverが提供されるすべてのAWSリージョンで利用可能
Google Search、AI Modeに旅行予約の新機能を追加
Google SearchのAI Modeに、フライト価格追跡・ポイントやマイルの表示・ホテル直接予約という3つの旅行関連機能が追加されました。
「track these flight prices for me」と依頼すると運賃変動時にメールで通知してくれるフライト価格追跡は180以上の国・地域で利用可能です。また、アメリカン航空やヒルトンなど主要パートナーの利用可能マイル数をグローバルで表示できるほか、米国ではAI Modeとの会話内でBooking.comなど大手サイトと連携したホテル検索・予約がGoogle Payでの決済とあわせて可能になりました。検索から予約までを1つの会話で完結できるため、旅行計画の流れを中断せずに進められます。
- フライト価格追跡は180以上の国・地域で利用可能
- 航空会社・ホテルのマイル表示はグローバルで利用可能
- ホテル直接予約は米国でロールアウト開始
Google DeepMind、生成動画モデル「Gemini Omni 1.1 Flash」を発表
Google DeepMindが、開発者向けの生成動画モデル「Gemini Omni 1.1 Flash」を発表しました。より細かい制御が可能な動画編集機能が特徴です。
最大40秒まで10秒単位でシーンを延長できるほか、開始フレームと終了フレームを指定して滑らかなトランジションを作成できます。最大10秒の先行コンテクストを分析することで視覚的一貫性を高めており、最大3秒のビデオ参照を入力することでキャラクターの一貫性を維持することも可能です。360p解像度でのドラフト生成は720p比で最大60%高速かつコストは3分の1に抑えられており、4K解像度での最終出力にも対応します。
- シーン延長(最大40秒、10秒単位)・フレーム指定によるトランジション生成に対応
- 360p解像度のドラフト生成は720p比で最大60%高速・コスト3分の1
- Google AI Studio、Gemini Enterprise Agent Platform、Google Flow/Geminiアプリで利用開始可能
Google DeepMind、世界初の「ダブルブラインドAI評価」を試験導入
Google DeepMindが、専有モデルの評価における業界初の「ダブルブラインド評価」システムを試験導入しました。シンガポールAI安全研究所、OpenMined、AVERIなどのパートナーと協力し、Gemini Flash Liteモデルを機密ベンチマークに対して検証しています。
Google CloudのConfidential Computingを活用することで、評価データとモデルの重みの両方を秘匿したまま検証を行える点が特徴です。評価機関はモデルの詳細を見ることができず、Google側も評価用プロンプトにアクセスできない仕組みになっています。従来は外部評価者がテスト質問を共有するか、開発企業がモデルの知的財産を共有するかというジレンマがありましたが、この仕組みにより「ベンチマーク汚染」を防ぎ、AIモデルの真の能力と安全性をより信頼性高く測定できるようになります。
- Confidential Computingにより評価データとモデルの重みを双方から秘匿
- シンガポールAI安全研究所、OpenMined、AVERIなどと協力してGemini Flash Liteを検証
- ベンチマーク汚染の防止とモデル評価の信頼性向上が狙い
Google、高精度音声認識モデル「Gemini 3.5 Transcribe」を発表
Googleが、リアルタイムストリーミングと事前録音音声の両方に対応した新しい音声認識モデル「Gemini 3.5 Transcribe」を発表しました。
ストリーミング時の単語誤り率4.0%、非ストリーミング時2.6%という高精度を実現し、85以上の言語に加えて方言や地域差にも対応しています。「火曜日…いや水曜日」といった自己修正の自動処理や言い淀みの削除、テキストの自動整形に対応するほか、カスタム語彙による専門用語・固有表現の認識、最大3人の話者の自動識別も可能です。他のGeminiモデルと連携し、画像生成やファイル分析などのタスクを実行できる点も特徴です。
- ストリーミング時4.0%・非ストリーミング時2.6%の単語誤り率を実現、85以上の言語に対応
- 自己修正の自動処理、言い淀み削除、カスタム語彙、最大3人の話者識別に対応
- Gemini API(Google AI Studio)、Gboard Rambler機能、Gemini アプリ(macOS)、Google Antigravityなどで利用可能
Geminiアプリ、対話的なシミュレーションやモデルの生成に対応
Geminiアプリが、質問に対してテキストだけでなく操作可能な3Dモデルやシミュレーションをチャット内で直接生成できるようになりました。
DNA構造を回転・ズームできる3D可視化や、振り子のエネルギー交換・キャッシュバーンレートなどを対話的に表示する動的シミュレーション、質問内容に応じたテーブルやグリッドといったビジュアル要素の生成に対応しています。
- 3D可視化・動的シミュレーションなど操作可能なビジュアルコンテンツを生成
- 全Google Workspaceカスタマー・Workspace Individual加入者が対象(年齢要件あり)
- 2026年8月24日よりRapid Release・Scheduled Releaseの両方式で提供開始、デフォルトでON
Google Cloud TPU、長文脈マルチモーダル埋め込み推論でエンタープライズ級の精度を実現
Googleが、Cloud TPU上でエンタープライズグレードの精度を実現する埋め込みモデル推論システムを発表しました。vLLM-TPUのネイティブ統合により、業界標準のLLM提供エンジンにTPUサポートを組み込んでいます。
Qwen3シリーズに対応し、テキストで7,000トークン以上、マルチモーダルで15,000トークン以上の長文脈処理が可能です。TPUとGPU間でcosine similarityが0.999以上(テキスト)という高い数値的一致を達成しつつ、GKEの「Custom Compute Classes」による動的リソース管理で、トラフィック変動に応じたTPUノードのシームレスなスケーリングを実現しています。Qwen3-Embedding-8Bでは秒間83,996トークンのスループットを達成しており、公式GitHubリポジトリで実装レシピが公開されています。
- vLLM-TPUネイティブ統合とQwen3シリーズによる長文脈マルチモーダル埋め込みに対応
- TPU・GPU間でcosine similarity 0.999以上の高精度な数値的一致を達成
- GKE Custom Compute Classesによる自動スケーリングで秒間83,996トークンのスループットを実現
Anthropic
Claude in Chromeが一般提供開始
ブラウザ内でClaudeにタスクを任せられる「Claude in Chrome」が一般提供を開始しました。ページの読み取り、テキスト入力、リンククリック、フォーム入力などのアクションを複数タブにまたがって実行できます。
Claudeが安全と判断したアクションはユーザー承認なしに自動実行される一方、プロンプトインジェクション対策としてモデルのトレーニング強化、コンテンツスキャン用プローブの導入、アクション実行前の検証分類器など多層的な防御が実装されています。最新モデルのSonnet 5・Opus 5では攻撃成功率0%を達成しているとのことです。デスクトップ・モバイル・ウェブアプリ間で会話を継続できるほか、内部ダッシュボードやレガシーシステムなど公式コネクタがない多くのツールへのアクセスも実現します。
- ページ読み取り・テキスト入力・リンククリック・フォーム入力などを複数タブで実行可能
- 多層的なプロンプトインジェクション対策を実装、Sonnet 5・Opus 5では攻撃成功率0%
- すべての有料プランで利用可能、Enterpriseは管理者が承認ドメインを制限可能
Claude Coworkにブラウザが組み込みで搭載
デスクトップアプリの「Claude Cowork」に、独立したブラウザが組み込まれました。Claudeがブラウザを使ってウェブサイトを閲覧し、フォーム入力やデータ収集などのタスクを自動実行できます。
このブラウザはユーザー自身のブラウザ履歴やパスワードにはアクセスしない独立した環境で動作し、プロンプトインジェクション対策を含むセーフガードも実装されています。銀行やメールなど機密性の高いサイトは除外設定が可能なほか、ウェブサイトが関わるタスクを指示するとブラウザが自動的に起動する仕組みです。
- ユーザーのブラウザ履歴・パスワードにアクセスしない独立した環境で動作
- 銀行・メールなど機密サイトの除外設定が可能
- Pro・Max・Teamプラン(デスクトップアプリ)、Enterprise(管理者による設定管理可)で2026年8月26日から段階的ロールアウト
Claudeのメモリがchat・Cowork間で統一
Claudeのメモリ機能が、chatとClaude Coworkの間で統一されました。一度説明した情報を複数のサービス間で記憶し、再説明の手間を削減します。
会話中に自動的にトピックがメモリへ追加されるほか、メモリ設定画面でトピック一覧の確認・編集・削除が可能で透明性が確保されています。健康や信念といった機微なトピックはデフォルトでは保存されず、設定で有効化する形です。プロジェクトの締め切りや顧客情報など、一度説明した文脈が自動的に次の会話へ反映されるため、業務効率の向上が期待できます。
- chatとCoworkでメモリを統一し、トピックを自動的に記憶
- メモリ設定でトピックの確認・編集・削除が可能、機微なトピックはデフォルト非保存
- Free・Pro・Maxはデフォルト有効、Team・Enterpriseは管理者が可用性を制御
次週はどんなニュースがあるでしょうか。お楽しみに✋
🚀 Powered by Claude Code
この記事はAIによって生成されていますが、DX開発事業部の新卒メンバーによってネタ集め、レビュー、修正が行われています。
クラウドと生成AIでの業務改善のご相談はコチラ👇
一緒に働くメンバーを募集しています!