LLM Frontline

#評価・検証 の記事

開発・エージェント

検索技術(情報検索)を学ぶ書籍ガイド|RAGの土台を作り直すための4冊を段階順に選ぶ

RAGの精度が上がらない原因の多くは、生成ではなく検索側にあります。キーワード検索・トークナイズ・ランキング・評価指標・クエリ解析といった情報検索の基礎を、実在の日本語書籍4冊で段階順に学ぶためのガイドです。各書が扱う範囲と、扱っていない範囲も併せて整理します。

開発・エージェント

LLMアプリのオブザーバビリティ|トレーシングとログ設計で「なぜこの出力になったか」を後から追えるようにする

LLMアプリ・AIエージェントの観測をどう設計するかを実務目線で整理します。通常のWebアプリのログとの違い、最低限とるべきシグナル、OpenTelemetryのGenAI semantic conventions(現在Development段階)の使い方、入出力本文を残すかどうかの判断、コスト可視化とアラート設計、評価(eval)との接続、既存APMとLLM専用ツールの選び分けをまとめます。

開発・エージェント

LLM-as-a-Judge(LLMによる評価)とは|出力の良し悪しをLLMに採点させる仕組みとバイアスへの備え

LLM-as-a-Judgeは、LLMの出力の良し悪しを別のLLMに採点・比較させる評価手法です。単一採点と対比較の方式、人手評価をスケールさせる使いどころ、位置・冗長性・自己選好といったバイアスと、順序入れ替えやルーブリックなどの実務的な対策を冷静に整理します。

開発・エージェント

リランキング(Reranker)でRAGの検索精度を上げる|retrieve->rerankの二段構成

ベクトル検索で粗く多めに拾い、Cross-Encoder型リランカーで関連度を再スコアリングして上位を絞る二段構成(retrieve->rerank)を実務目線で整理します。bi-encoderとの違い、使いどころ、コストとレイテンシのトレードオフ、Hit Rate/MRR/nDCGでの評価、向かない場面までまとめます。

業務活用

AI資格の書籍ガイド|生成AIパスポートとG検定を目的別に選ぶ

生成AI・AIの資格対策本を、目的別に選べるよう整理します。入門者向けの生成AIパスポート(GUGA)と、ディープラーニングの基礎を問うG検定(JDLA)の違いをまず押さえ、公式テキストや問題集を4冊紹介します。合格率や費用は変動するため、最新は必ず公式で確認する前提でまとめました。

開発・エージェント

LLMアプリの評価(eval)の作り方|「動いた気がする」で止めないための実務手順

LLMアプリの品質を測る評価(eval)の作り方を、実務目線で整理します。実運用に似せた評価データの用意、タスク型に応じた指標設計、自動評価と人手レビューの併用、LLM-as-a-judgeの使いどころと落とし穴、失敗トレースをテストへ戻す継続的な評価まで、小さく始める手順にまとめました。