AIにコードを書かせる時代のGit/GitHub書籍ガイド|差分を読む・分ける・戻す・自動で検査する4冊
コーディングエージェントに書かせる量が増えるほど、人間側のボトルネックはバージョン管理と自動チェックの運用に移ります。差分を読む・ブランチを分ける・壊れたら戻す・自動で検査するという4段階に対応する実在の日本語書籍4冊を、扱う範囲と扱っていない範囲つきで整理します。
API連携・RAG・AIエージェント・コード生成など、LLMを組み込む開発の設計判断と落とし穴を扱います。
コーディングエージェントに書かせる量が増えるほど、人間側のボトルネックはバージョン管理と自動チェックの運用に移ります。差分を読む・ブランチを分ける・壊れたら戻す・自動で検査するという4段階に対応する実在の日本語書籍4冊を、扱う範囲と扱っていない範囲つきで整理します。
エージェントを複数に分けるべきかを実務の判断基準として整理します。既定は「分けない」であること、分けてよい条件と分けてはいけない条件、コンテキストの受け渡しと出力契約、コストの見積り、段階的な移行順序までを一次情報で裏取りしてまとめます。
AIエージェントに人の承認をどこで挟むかを、操作の可逆性・影響範囲・検知の遅れ・頻度の4軸から設計する実務ガイド。事前承認からドライラン・取り消し・サンプリング監査・エスカレーションまでの類型、承認疲れという失敗モード、監査ログの設計、自動化率の上げ方を整理します。
LLMアプリやRAG基盤、ローカルLLM、MCPサーバーを自分で動かす段でつまずくのは、モデルではなく環境再現・依存関係・GPU・デプロイです。コンテナの土台を段階順に固めるための実在の日本語書籍4冊を、扱う範囲と扱っていない範囲つきで整理します。
AWSでの生成AI開発で詰まるのは、モデルの使い方よりIAM・VPC・リージョンごとのモデル提供差・料金・本番運用の設計です。クラウドの土台からBedrockアプリ開発、AgentCore運用まで4冊を段階順に整理します。
社内文書RAGで「権限のない人が要約経由で機密を読めてしまう」事故を防ぐ設計。チャンクが元ファイルのACLを失う理由、事前フィルタ・事後フィルタ・インデックス分割・ACL同期の4パターン比較、権限フィルタとANNインデックスの再現率トレードオフを実装例とともに整理します。
帳票のOCR、図面の判定、UIスクリーンショットの操作にVLMを使う場面が増えました。VLM任せで精度が出ない・評価できないときに効くのが画像認識の基礎です。前処理・タスクの種類・評価指標・CNNとViTの違いを、実在の日本語書籍4冊で段階順に学ぶためのガイドです。
RAGのソースが正規化されていない、列名が意味不明でText-to-SQLが当たらない、集計定義が人によって違う。LLM実務でよく起きるこの3つの詰まりは、モデル側ではなくデータ側の問題です。DB設計・SQL・データ基盤の実在書籍4冊を、扱う範囲と扱わない範囲まで含めて整理します。
本番でLLM APIを叩き続けるための流量制御を整理します。RPM/TPMなど制限がかかる軸と単位、429・5xx・タイムアウトの切り分け、指数バックオフとジッタ、retry-afterの尊重とデッドライン設計、ストリーミングの3層タイムアウト、冪等性による二重実行対策、バッチAPIとキューでの平準化、監視指標と縮退運転までをまとめます。
自然言語で社内DBに問い合わせるText-to-SQLを、デモ止まりにせず業務で使うための設計手順を整理します。ベンチマークの現在地、セマンティックレイヤの用意、DB側での権限強制、実行結果一致による評価セットの作り方、向かない場面までを扱います。
議事録・報告書・仕様書・長い会話ログをLLMで要約するときの設計パターンを整理します。一括投入(stuff)/map-reduce/refine(逐次改良)/抽出+生成ハイブリッドの仕組みと向き不向き、精度が落ちる境目、数値や否定表現が化ける典型パターンと対策、忠実性と網羅性の評価のしかたまでを実務目線でまとめます。
生成AIがコードを量産できるようになったぶん、詰まる場所は「読む・直す・レビューする」側に移りました。可読性、整頓、設計、レビューとチーム運用という4段階で、AI生成コードの実務に効く実在の日本語書籍を4冊、扱っていない範囲つきで紹介します。
RAGの前段にあるドキュメントパース(文書からのテキスト抽出・構造化)の実務を整理します。多段組み・表・スキャンPDFという難所、テキストレイヤ抽出/レイアウト解析/VLM/クラウドサービスという4類型の選び方、Markdownへの正規化、メタデータ設計、評価の回し方までを扱います。
テキストだけでなく画像や音声も扱えるマルチモーダルLLMの仕組みを概念から整理し、OCR代替・図表読み取り・音声メモ要約など業務での使いどころと、コスト・精度の限界を実務目線で解説します。
LLMを組み込むアプリ・エージェントに欠かせないガードレール設計を、実装アーキテクチャの目線で整理します。システムプロンプトだけでは安全境界にならない理由、入力・出力・挙動の3層構成、分類器やスキーマ検証・OSSフレームワークといった実装手段の類型、過剰検知と過小防御のトレードオフ、評価とレッドチーミングの必要性までを扱います。
RAGの精度が上がらない原因の多くは、生成ではなく検索側にあります。キーワード検索・トークナイズ・ランキング・評価指標・クエリ解析といった情報検索の基礎を、実在の日本語書籍4冊で段階順に学ぶためのガイドです。各書が扱う範囲と、扱っていない範囲も併せて整理します。
LLMアプリ・AIエージェントの観測をどう設計するかを実務目線で整理します。通常のWebアプリのログとの違い、最低限とるべきシグナル、OpenTelemetryのGenAI semantic conventions(現在Development段階)の使い方、入出力本文を残すかどうかの判断、コスト可視化とアラート設計、評価(eval)との接続、既存APMとLLM専用ツールの選び分けをまとめます。
OpenAIがApache-2.0で公開したセキュリティ向けCLIとTypeScript SDK「Codex Security」を、業務目線で整理します。リポジトリのスキャン、差分レビュー、検出結果の追跡と修正検証、CIへの組み込みまで、できること・前提条件・注意点を冷静にまとめます。
RAGを作るときのベクトルDB選定を、製品比較ではなく判断軸から整理します。そもそもベクトルDBが要るのかの見極め、データ規模・更新頻度・メタデータフィルタ・ハイブリッド検索・運用体制・移行のしやすさという6つの軸、HNSW/IVF/全件走査の性格の違い、pgvectorが第一候補になりやすい理由と限界、そして小さく始めて必要になったら移行する現実的な進め方までをまとめます。
LLM-as-a-Judgeは、LLMの出力の良し悪しを別のLLMに採点・比較させる評価手法です。単一採点と対比較の方式、人手評価をスケールさせる使いどころ、位置・冗長性・自己選好といったバイアスと、順序入れ替えやルーブリックなどの実務的な対策を冷静に整理します。
retrieve->generateを1回で終える従来RAGの限界(多段質問・曖昧クエリ・取りこぼし)を出発点に、Agentic RAGを定義します。クエリ理解と計画、ルーティング、多段推論・分解、検索のオーケストレーション、自己反省という中核パターンを整理し、精度と引き換えに増えるレイテンシ・コスト・評価の難しさまで、向く場面と向かない場面を切り分けて実務目線でまとめます。
生成AI・LLMの土台である自然言語処理(NLP)を、実務でタスクを解く目線で段階順に学べる実在書籍を4冊紹介します。入門・実装・BERT応用・理論教科書と役割を分け、いま詰まっている段階の1冊から選べるように整理しました。
知識蒸留は大きな教師モデルの振る舞いを小さな生徒モデルに真似させて学習させる技術です。原典のsoft targetとtemperature、量子化やMoEとの違い、現代LLMでのデータ蒸留、教師の質が上限になる勘所、商用APIの出力を学習に使う際の規約上の注意まで、優劣を断定せず整理します。
PoCから本番運用へ進む段でつまずきがちな運用・監視・評価・ガバナンスを、機械学習全般のMLOpsからLLM固有のLLMOpsまで段階順に学べる実在書籍を4冊紹介します。いま詰まっている段階の1冊から選べるように整理しました。
RLHFや推論モデルの学習で存在感を増す強化学習(RL)を体系立てて学ぶための実在書籍を4冊紹介します。自作で理解する入門、Python実装、理論とアルゴリズム、定番教科書という段階で、いま詰まっている段階の1冊から選べるよう整理しました。
ベクトル検索は言い換えや意味に強い一方で型番・固有名詞・略語の完全一致に弱く、BM25などのキーワード検索はその逆です。両方で候補を集めてRRF(Reciprocal Rank Fusion)などで統合するハイブリッド検索の仕組み、スコア統合の難しさとRRFがスケール非依存な理由、retrieve->fuse->rerankの三段構成、向く場面と運用コストを実務目線で整理します。
機械学習やディープラーニングの土台になる数学を、全体像をやさしく掴む入門、線形代数、微分積分と最適化、確率統計という4段階で学べる実在書籍を紹介します。自分がつまずいている段階に合う1冊から読み進められるよう整理しました。
近年の大規模モデルが広く採用するスパースMoE(混合エキスパート)を、dense(密)モデルとの違いから解説します。FFNをexpertに分割しrouterがtop-k routingで一部だけ動かす仕組み、総パラメータと活性パラメータの区別、VRAMは総規模・計算は活性規模というねじれ、学習と推論の注意点、モデル選定での読み方までまとめます。
ベクトル検索で粗く多めに拾い、Cross-Encoder型リランカーで関連度を再スコアリングして上位を絞る二段構成(retrieve->rerank)を実務目線で整理します。bi-encoderとの違い、使いどころ、コストとレイテンシのトレードオフ、Hit Rate/MRR/nDCGでの評価、向かない場面までまとめます。
RAGで文書をどう分割してベクトル化・検索するかは、回答品質を大きく左右します。固定長・再帰的・構造認識・意味的といった分割戦略、オーバーラップの役割、チャンクサイズのトレードオフ、そして発展的な文脈付与までを実務目線で整理します。
量子化はモデルの重みや活性の数値精度を下げてメモリと計算を節約する技術です。FP16からINT8/INT4への圧縮の狙い、GGUF・GPTQ・AWQ・NF4といった方式、PTQとQATの違い、VRAM見積りと実務での選び方を、優劣を断定せず実証的に整理します。
LLMやTransformerの仕組みを、理論とコードの両面から段階的に理解するための書籍を4冊紹介します。定番入門で全体像を掴み、ゼロから自作し、自然言語処理へ応用し、NLPの学術的土台を固めるまで、学ぶ順序に沿って整理しました。
temperatureとtop-pは、LLMが次のトークンを選ぶときのばらつきを調整する生成パラメータです。確率分布からのサンプリングという前提、各社で異なる範囲・既定値、用途別の目安、そして「temperature 0でも完全再現ではない」「賢さは上がらない」という誤解までを実務目線で整理します。
生成AI・LLMの土台となるディープラーニングと機械学習の基礎を、理論から学ぶための書籍を目的別に4冊紹介します。仕組みをやさしく掴む段階から、手を動かして実装する段階、機械学習の定番、さらに理論へ踏み込む段階まで、学ぶ順序に沿って整理しました。
LLMが文章を扱う単位である「トークン」と、入力と出力の合計を縛る「コンテキストウィンドウ」の仕組みを、実務目線で解説します。サブワードによるトークナイズ、日本語と英語でのトークン数の違い、上限超過時の挙動、トークン単位の課金、そして「上限が大きいほど良いとは限らない」理由と、長文の前処理・見積り・コスト試算といった勘所までを整理します。
AIエージェント開発を学ぶための書籍を、目的別に4冊紹介します。概念を掴む段階からLangChain・LangGraphでの実装、開発と運用の設計、アプリに仕立てる段階まで、いまの自分に合う一冊を選べるよう学ぶ順序に沿って整理しました。
テキストを数値ベクトルへ変換するエンベディング(埋め込み)と、それを使った意味検索(ベクトル検索)の仕組みを実務目線で解説します。RAGの内部でどう働くか、キーワード検索との違い、モデル選びやチャンク設計の勘所、そして向かない場面までを整理します。
プロンプトキャッシュは、共通するプレフィックスのKV計算をサーバ側で使い回し、初回応答時間とコストを下げる仕組みです。仕組みの基本、Anthropic・OpenAI・Googleの差分、落とし穴、実務での取り入れ方までを変動前提で整理します。
LLMを自社用途に寄せる方法には、プロンプト、RAG、ファインチューニングの階層があります。RAGとファインチューニングはそれぞれ何を得意とし、どこで選ぶべきか。知識の更新性、出力の安定性、コストとトラフィックの観点から使い分けの原則を整理し、実務で有効なハイブリッド構成と落とし穴まで、公式ドキュメントを確認しながら冷静にまとめます。
構造化出力(Structured Outputs)は、LLMの返答をあらかじめ決めたJSONスキーマに沿わせる仕組みです。JSONモードとの違い、なぜスキーマ準拠まで保証したいのか、OpenAI・Anthropic・Googleの対応の考え方、スキーマ設計や検証・リトライといった実装の勘所、そして「構造が正しくても中身が正しいとは限らない」という落とし穴までを、LLMアプリ開発の実務目線で整理します。
Jupyter Notebookの基本を、生成AI・LLMを扱う人の目線で解説します。コードと実行結果・説明・図表を1つにまとめられる仕組み、JupyterLabやGoogle Colabとの違い、そしてLLMのAPI検証やプロンプト試行・データ分析でどう役立つかを、始め方とあわせて整理します。
MCP(Model Context Protocol)は、AIと社内システムやツールをつなぐための共通規格です。連携のNxM問題をどう解くのか、ホスト・クライアント・サーバーという基本構成、既製サーバーを選んで繋ぐ導入の仕方、そして権限や監査ログといった業務導入時の注意点を、冷静に整理します。
LLMアプリの品質を測る評価(eval)の作り方を、実務目線で整理します。実運用に似せた評価データの用意、タスク型に応じた指標設計、自動評価と人手レビューの併用、LLM-as-a-judgeの使いどころと落とし穴、失敗トレースをテストへ戻す継続的な評価まで、小さく始める手順にまとめました。
生成AI・LLMを開発者として学ぶための書籍を、学ぶ順序に沿って4冊紹介します。プロンプト設計の原則、LLMの仕組みと開発入門、RAG・AIエージェントの実装、コーディングエージェントの自作まで、目的別に選べるよう整理しました。
LLMが外部のツールやAPIを呼び出す「Tool Use(関数呼び出し/function calling)」の仕組みを、実務目線で解説します。tool_useとtool_resultの往復、クライアントツールとサーバーツールの違い、いつ呼ぶかの制御、そして呼び出し精度を上げるためのツール定義のコツまでを整理します。
Claude APIのadvisorツール(ベータ)を実務目線で整理します。安価で速いexecutorモデルが、生成の途中で高性能なadvisorモデルに設計方針を相談する仕組み、向く用途・向かない用途、コストの見え方、出力量の制御やキャッシュといった運用上の勘所をまとめます。
コード生成AIを業務開発で使うための実務的な指針を解説します。生成コードをレビュー前提で扱う理由、任せてよいタスクの選び方、依頼の粒度とテストの組み合わせ、チームでの運用ルールをまとめます。
社内文書をAIに答えさせる代表的な手法であるRAG(検索拡張生成)を解説します。検索と生成を組み合わせる仕組み、向いている用途と向かない用途、導入前に確認したい判断ポイントをまとめます。