OpenAIがCodex Security CLIをオープンソース公開|AIで脆弱性を見つけて直す
OpenAIがApache-2.0で公開したセキュリティ向けCLIとTypeScript SDK「Codex Security」を、業務目線で整理します。リポジトリのスキャン、差分レビュー、検出結果の追跡と修正検証、CIへの組み込みまで、できること・前提条件・注意点を冷静にまとめます。
OpenAIがApache-2.0で公開したセキュリティ向けCLIとTypeScript SDK「Codex Security」を、業務目線で整理します。リポジトリのスキャン、差分レビュー、検出結果の追跡と修正検証、CIへの組み込みまで、できること・前提条件・注意点を冷静にまとめます。
retrieve->generateを1回で終える従来RAGの限界(多段質問・曖昧クエリ・取りこぼし)を出発点に、Agentic RAGを定義します。クエリ理解と計画、ルーティング、多段推論・分解、検索のオーケストレーション、自己反省という中核パターンを整理し、精度と引き換えに増えるレイテンシ・コスト・評価の難しさまで、向く場面と向かない場面を切り分けて実務目線でまとめます。
生成AI・LLMの土台である自然言語処理(NLP)を、実務でタスクを解く目線で段階順に学べる実在書籍を4冊紹介します。入門・実装・BERT応用・理論教科書と役割を分け、いま詰まっている段階の1冊から選べるように整理しました。
知識蒸留は大きな教師モデルの振る舞いを小さな生徒モデルに真似させて学習させる技術です。原典のsoft targetとtemperature、量子化やMoEとの違い、現代LLMでのデータ蒸留、教師の質が上限になる勘所、商用APIの出力を学習に使う際の規約上の注意まで、優劣を断定せず整理します。
PoCから本番運用へ進む段でつまずきがちな運用・監視・評価・ガバナンスを、機械学習全般のMLOpsからLLM固有のLLMOpsまで段階順に学べる実在書籍を4冊紹介します。いま詰まっている段階の1冊から選べるように整理しました。
RLHFや推論モデルの学習で存在感を増す強化学習(RL)を体系立てて学ぶための実在書籍を4冊紹介します。自作で理解する入門、Python実装、理論とアルゴリズム、定番教科書という段階で、いま詰まっている段階の1冊から選べるよう整理しました。
ベクトル検索は言い換えや意味に強い一方で型番・固有名詞・略語の完全一致に弱く、BM25などのキーワード検索はその逆です。両方で候補を集めてRRF(Reciprocal Rank Fusion)などで統合するハイブリッド検索の仕組み、スコア統合の難しさとRRFがスケール非依存な理由、retrieve->fuse->rerankの三段構成、向く場面と運用コストを実務目線で整理します。
近年の大規模モデルが広く採用するスパースMoE(混合エキスパート)を、dense(密)モデルとの違いから解説します。FFNをexpertに分割しrouterがtop-k routingで一部だけ動かす仕組み、総パラメータと活性パラメータの区別、VRAMは総規模・計算は活性規模というねじれ、学習と推論の注意点、モデル選定での読み方までまとめます。
永続メモリ(long-term memory)を持つLLMエージェントに、外部文書やWebページ経由で偽の「記憶」を書き込ませ、後日の別会話で発火させる「スリーパー型メモリ汚染」を、2026年の研究をもとに冷静に解説します。単一ターンのプロンプトインジェクションとの違い、性能と攻撃面のトレードオフ、運用で取れる防御策を、研究段階の報告値・帰属明示で整理します。
量子化はモデルの重みや活性の数値精度を下げてメモリと計算を節約する技術です。FP16からINT8/INT4への圧縮の狙い、GGUF・GPTQ・AWQ・NF4といった方式、PTQとQATの違い、VRAM見積りと実務での選び方を、優劣を断定せず実証的に整理します。
LLMを自社用途に寄せる方法には、プロンプト、RAG、ファインチューニングの階層があります。RAGとファインチューニングはそれぞれ何を得意とし、どこで選ぶべきか。知識の更新性、出力の安定性、コストとトラフィックの観点から使い分けの原則を整理し、実務で有効なハイブリッド構成と落とし穴まで、公式ドキュメントを確認しながら冷静にまとめます。
LLMアプリで最重要とされる脆弱性プロンプトインジェクション。直接・間接の違い、RAGやエージェントで顕在化する攻撃シナリオ、OWASPが挙げる緩和策を業務目線で整理し、完全には防げない前提での多層防御の組み方を解説します。
LLMアプリの品質を測る評価(eval)の作り方を、実務目線で整理します。実運用に似せた評価データの用意、タスク型に応じた指標設計、自動評価と人手レビューの併用、LLM-as-a-judgeの使いどころと落とし穴、失敗トレースをテストへ戻す継続的な評価まで、小さく始める手順にまとめました。
プロンプトエンジニアリングの次の設計単位として注目される「コンテキストエンジニアリング」を、実務目線で整理します。コンテキストの劣化(context rot)という前提、渡す情報の構成と順序、長時間動くエージェントで使う圧縮・メモ・サブエージェントといった手法までをまとめます。
NVIDIAとHugging Faceが2026年7月に発表した、オープンソースのロボット学習基盤「LeRobot」への大型統合を整理します。オープンで商用利用可能なVLAモデル「Isaac GR00T N1.7」、データ収集フレームIsaac Teleop、そしてソフトウェア中心のLLMエンジニアがフィジカルAIをどう捉えるべきかを、事実ベースで読み解きます。
Claude APIのadvisorツール(ベータ)を実務目線で整理します。安価で速いexecutorモデルが、生成の途中で高性能なadvisorモデルに設計方針を相談する仕組み、向く用途・向かない用途、コストの見え方、出力量の制御やキャッシュといった運用上の勘所をまとめます。
生成AIの活用で注目されるAIエージェントを冷静に解説します。チャットボットやRPAとの違い、自律性がもたらす利点とリスク、実務でエージェントに任せてよい仕事と任せるべきでない仕事の線引きをまとめます。
社内文書をAIに答えさせる代表的な手法であるRAG(検索拡張生成)を解説します。検索と生成を組み合わせる仕組み、向いている用途と向かない用途、導入前に確認したい判断ポイントをまとめます。