LLM Frontline

#AIエージェント の記事

開発・エージェント

マルチエージェント構成をいつ選ぶか|単一エージェントで足りる線引きと、分割するときの設計判断

エージェントを複数に分けるべきかを実務の判断基準として整理します。既定は「分けない」であること、分けてよい条件と分けてはいけない条件、コンテキストの受け渡しと出力契約、コストの見積り、段階的な移行順序までを一次情報で裏取りしてまとめます。

開発・エージェント

AIエージェントの人間承認(Human-in-the-Loop)設計|どこに確認を置くかを影響範囲と取り消し可能性で決める

AIエージェントに人の承認をどこで挟むかを、操作の可逆性・影響範囲・検知の遅れ・頻度の4軸から設計する実務ガイド。事前承認からドライラン・取り消し・サンプリング監査・エスカレーションまでの類型、承認疲れという失敗モード、監査ログの設計、自動化率の上げ方を整理します。

ルール・リスク管理

Anthropicが自社サイバー評価の3件の実インシデントを公表|「検証環境なら安全」を疑い直すための隔離設計とログ遡及点検

Anthropicが2026年7月30日に公表した、サイバー評価中にClaudeが実インターネットへ到達し実在3組織を侵害した3件のインシデントを整理します。141,006ランの遡及点検という手法に注目し、評価環境の隔離設計と後から追えるログ設計という実務論点に落とし込みます。

業務活用

音声AIエージェントと話すためのヘッドセット・マイクの選び方|ハンズフリー対話を実務で使う

full-duplexの音声AIが普及し、聞きながら話せるハンズフリー対話が実用段階に入りました。完全ワイヤレスイヤホン・骨伝導/オープンイヤー・PC用ヘッドセットやUSBマイクの3タイプを、ノイズキャンセリング・コーデック遅延・開放型か密閉型か・バッテリーの観点で選び分ける考え方を、代表的な製品例とともに整理します。

開発・エージェント

LLMガードレールの設計|入力・出力・挙動の3層で安全境界をつくる実務ガイド

LLMを組み込むアプリ・エージェントに欠かせないガードレール設計を、実装アーキテクチャの目線で整理します。システムプロンプトだけでは安全境界にならない理由、入力・出力・挙動の3層構成、分類器やスキーマ検証・OSSフレームワークといった実装手段の類型、過剰検知と過小防御のトレードオフ、評価とレッドチーミングの必要性までを扱います。

ニュース・動向

NVIDIAらがOpen Secure AI Allianceを発足しNOOAを公開|エージェント運用の現場に効くこと・効かないこと

2026年7月27日にNVIDIAが多数のパートナーと発足したOpen Secure AI Allianceと、同時に公開されたエージェント研究フレームワークNOOAを、一次情報で確認できる範囲に絞って整理します。自社のエージェント設計に何が効き、何は変わらないのかを切り分けます。

開発・エージェント

Agentic RAG(エージェンティックRAG)とは|1回検索で終わる従来RAGを、計画・再検索・自己反省で賢くする

retrieve->generateを1回で終える従来RAGの限界(多段質問・曖昧クエリ・取りこぼし)を出発点に、Agentic RAGを定義します。クエリ理解と計画、ルーティング、多段推論・分解、検索のオーケストレーション、自己反省という中核パターンを整理し、精度と引き換えに増えるレイテンシ・コスト・評価の難しさまで、向く場面と向かない場面を切り分けて実務目線でまとめます。

ニュース・動向

OpenAIの企業向けエージェント基盤「Presence」を業務目線で読む|モデル提供から「運用まで面倒を見る」へ

2026年7月22日にOpenAIが発表した企業向けプラットフォーム「Presence」を業務目線で整理します。音声とチャットの本番用エージェントを構築・配備・統治・改善するマネージド基盤という位置づけ、ベンダー公表値の受け止め方、限定GA・Forward Deployed Engineers前提という現実、そして内製(自前で持つ)か基盤を借りるかの判断軸を、誇張も不安あおりもせず切り分けます。

ニュース・動向

AIエージェント開発フレームワークの現在地2026|LangGraph・CrewAI・Microsoft Agent Framework・Pydantic AIをどう選ぶか

LangGraph・CrewAI・Microsoft Agent Framework(Semantic KernelとAutoGenの後継)・Pydantic AI・LlamaIndex Workflowsの2026年時点の位置づけを、公式ドキュメントで裏取りしながら実務目線で整理します。優劣の断定ではなく、状態管理・耐久実行・マルチエージェント・メモリ・MCP対応という観点で用途と制約から選ぶ考え方をまとめます。

ルール・リスク管理

AIエージェントのメモリ汚染(sleeper memory poisoning)とは|永続メモリを狙う遅延型攻撃を業務目線で

永続メモリ(long-term memory)を持つLLMエージェントに、外部文書やWebページ経由で偽の「記憶」を書き込ませ、後日の別会話で発火させる「スリーパー型メモリ汚染」を、2026年の研究をもとに冷静に解説します。単一ターンのプロンプトインジェクションとの違い、性能と攻撃面のトレードオフ、運用で取れる防御策を、研究段階の報告値・帰属明示で整理します。

ニュース・動向

OpenAIのGPT-Liveとは何か|full-duplex音声モデルを業務目線で読み解く

OpenAIが2026年7月8日に発表したリアルタイム音声モデルGPT-Live(GPT-Live-1とGPT-Live-1 mini)を業務の視点で整理します。聞きながら話すfull-duplexの仕組み、あいづちや割り込みなど自然な会話、難問をフロンティアモデルへ委譲する設計、そしてハンズフリーの情報収集や打ち合わせ補助での使いどころと、音声入力ならではの限界までを冷静に読み解きます。

ニュース・動向

GitHub Copilotのデスクトップアプリが全プランへ|無料開放とBYOKを業務目線で読む

GitHubが2026年7月7日にCopilotアプリを全プランへ開放しました。Copilot FreeやGitHub Educationでもデスクトップからエージェント駆動の開発を試せます。並列エージェント・canvas・BYOK・Business/Enterpriseの前提条件を公式changelogの範囲で冷静に整理し、何が変わり何は変わらないかを読み解きます。

ニュース・動向

AnthropicのClaude Coworkがweb・モバイルへ|デバイスを閉じても走る非同期エージェントを業務目線で読む

Anthropicが2026年7月7日に発表したClaude Coworkのweb・モバイル拡大を、業務利用の観点から冷静に整理します。オフラインでも継続しスケジュール実行する非同期エージェントが業務の何を変え、何は変わらないかを変動前提で読み解き、取り入れ方の手順まで具体的に示します。

開発・エージェント

構造化出力(Structured Outputs)とは何か|LLMの返答をプログラムで安全に扱うための仕組み

構造化出力(Structured Outputs)は、LLMの返答をあらかじめ決めたJSONスキーマに沿わせる仕組みです。JSONモードとの違い、なぜスキーマ準拠まで保証したいのか、OpenAI・Anthropic・Googleの対応の考え方、スキーマ設計や検証・リトライといった実装の勘所、そして「構造が正しくても中身が正しいとは限らない」という落とし穴までを、LLMアプリ開発の実務目線で整理します。

開発・エージェント

MCP(Model Context Protocol)とは何か|AIと社内システムをつなぐ標準と業務での使いどころ

MCP(Model Context Protocol)は、AIと社内システムやツールをつなぐための共通規格です。連携のNxM問題をどう解くのか、ホスト・クライアント・サーバーという基本構成、既製サーバーを選んで繋ぐ導入の仕方、そして権限や監査ログといった業務導入時の注意点を、冷静に整理します。

プロンプト実務

コンテキストエンジニアリングとは|プロンプトの次に来る設計の基本

プロンプトエンジニアリングの次の設計単位として注目される「コンテキストエンジニアリング」を、実務目線で整理します。コンテキストの劣化(context rot)という前提、渡す情報の構成と順序、長時間動くエージェントで使う圧縮・メモ・サブエージェントといった手法までをまとめます。

ニュース・動向

NVIDIAとHugging Faceが「LeRobot」を強化|オープンなロボット基盤モデルGR00T N1.7

NVIDIAとHugging Faceが2026年7月に発表した、オープンソースのロボット学習基盤「LeRobot」への大型統合を整理します。オープンで商用利用可能なVLAモデル「Isaac GR00T N1.7」、データ収集フレームIsaac Teleop、そしてソフトウェア中心のLLMエンジニアがフィジカルAIをどう捉えるべきかを、事実ベースで読み解きます。