検索技術(情報検索)を学ぶ書籍ガイド|RAGの土台を作り直すための4冊を段階順に選ぶ
RAGの精度が上がらない原因の多くは、生成ではなく検索側にあります。キーワード検索・トークナイズ・ランキング・評価指標・クエリ解析といった情報検索の基礎を、実在の日本語書籍4冊で段階順に学ぶためのガイドです。各書が扱う範囲と、扱っていない範囲も併せて整理します。
RAGの精度が上がらない原因の多くは、生成ではなく検索側にあります。キーワード検索・トークナイズ・ランキング・評価指標・クエリ解析といった情報検索の基礎を、実在の日本語書籍4冊で段階順に学ぶためのガイドです。各書が扱う範囲と、扱っていない範囲も併せて整理します。
LLMアプリ・AIエージェントの観測をどう設計するかを実務目線で整理します。通常のWebアプリのログとの違い、最低限とるべきシグナル、OpenTelemetryのGenAI semantic conventions(現在Development段階)の使い方、入出力本文を残すかどうかの判断、コスト可視化とアラート設計、評価(eval)との接続、既存APMとLLM専用ツールの選び分けをまとめます。
LLM-as-a-Judgeは、LLMの出力の良し悪しを別のLLMに採点・比較させる評価手法です。単一採点と対比較の方式、人手評価をスケールさせる使いどころ、位置・冗長性・自己選好といったバイアスと、順序入れ替えやルーブリックなどの実務的な対策を冷静に整理します。
最終回答だけでなく途中の推論ステップを言語化させるChain-of-Thought(CoT)プロンプトを、原典の主張・実務での効果と限界・推論モデル時代の使い分けまで整理します。few-shot/zero-shot CoTやself-consistencyの違い、向かない場面も冷静に切り分けます。
ベクトル検索で粗く多めに拾い、Cross-Encoder型リランカーで関連度を再スコアリングして上位を絞る二段構成(retrieve->rerank)を実務目線で整理します。bi-encoderとの違い、使いどころ、コストとレイテンシのトレードオフ、Hit Rate/MRR/nDCGでの評価、向かない場面までまとめます。
生成AI・AIの資格対策本を、目的別に選べるよう整理します。入門者向けの生成AIパスポート(GUGA)と、ディープラーニングの基礎を問うG検定(JDLA)の違いをまず押さえ、公式テキストや問題集を4冊紹介します。合格率や費用は変動するため、最新は必ず公式で確認する前提でまとめました。
LLMアプリの品質を測る評価(eval)の作り方を、実務目線で整理します。実運用に似せた評価データの用意、タスク型に応じた指標設計、自動評価と人手レビューの併用、LLM-as-a-judgeの使いどころと落とし穴、失敗トレースをテストへ戻す継続的な評価まで、小さく始める手順にまとめました。
LLMがもっともらしい誤情報を生成するハルシネーションへの実務的な対策を解説します。発生をゼロにできない前提での検証フローの設計、用途別のチェックの深さ、プロンプトと仕組みでの抑制策をまとめます。