LLM Frontline

#コスト管理 の記事

開発・エージェント

マルチエージェント構成をいつ選ぶか|単一エージェントで足りる線引きと、分割するときの設計判断

エージェントを複数に分けるべきかを実務の判断基準として整理します。既定は「分けない」であること、分けてよい条件と分けてはいけない条件、コンテキストの受け渡しと出力契約、コストの見積り、段階的な移行順序までを一次情報で裏取りしてまとめます。

開発・エージェント

LLM APIのレート制限とリトライ設計|429・タイムアウト・二重実行を本番で捌く

本番でLLM APIを叩き続けるための流量制御を整理します。RPM/TPMなど制限がかかる軸と単位、429・5xx・タイムアウトの切り分け、指数バックオフとジッタ、retry-afterの尊重とデッドライン設計、ストリーミングの3層タイムアウト、冪等性による二重実行対策、バッチAPIとキューでの平準化、監視指標と縮退運転までをまとめます。

ニュース・動向

OpenAIがGPT-5.6のLunaとTerraを値下げ|業務で見直すこと、見直さなくていいこと

2026年7月30日にOpenAIが実施したGPT-5.6のAPI価格改定を、公式Pricingページで確認しながら業務目線で整理します。Lunaは80%、Terraは20%の引き下げでSolは据え置き、Priority processingはFast modeへ改称。事実を押さえたうえで、大量処理の経済性・モデル階層の引き直し・価格が動く前提の設計・乗り換え前の評価と、値下げでも変わらない要件を切り分けます。

モデル比較・選び方

ローカルLLMのモデル保存先を選ぶ|内蔵NVMe増設と外付けSSDの違い

ローカルLLMを動かしていると、モデルファイルの容量で内蔵ストレージがすぐに圧迫されます。内蔵M.2 NVMeの増設と外付けポータブルSSD、どちらを選ぶべきかを、モデルファイルのサイズ感・読み込み速度(PCIe世代・USBインターフェース)・容量計画・外付け運用の注意点から整理しました。

開発・エージェント

知識蒸留(distillation)とは|大きな教師モデルの知識を小さな生徒モデルへ移す仕組み

知識蒸留は大きな教師モデルの振る舞いを小さな生徒モデルに真似させて学習させる技術です。原典のsoft targetとtemperature、量子化やMoEとの違い、現代LLMでのデータ蒸留、教師の質が上限になる勘所、商用APIの出力を学習に使う際の規約上の注意まで、優劣を断定せず整理します。

開発・エージェント

トークンとは/コンテキストウィンドウとは|LLMの入出力を測る単位と上限の仕組み

LLMが文章を扱う単位である「トークン」と、入力と出力の合計を縛る「コンテキストウィンドウ」の仕組みを、実務目線で解説します。サブワードによるトークナイズ、日本語と英語でのトークン数の違い、上限超過時の挙動、トークン単位の課金、そして「上限が大きいほど良いとは限らない」理由と、長文の前処理・見積り・コスト試算といった勘所までを整理します。

業務活用

生成AIの社内導入を学ぶ書籍ガイド|推進・管理職向けに選ぶ実務書

会社やチームに生成AIを導入・推進する担当者や管理職に向けて、組織導入・ルール整備・定着・費用対効果の視点で読む本を4冊紹介します。個人が使いこなすための本とは切り口を変え、進め方とガバナンスの土台づくりに役立つ実務書を、最新は公式で確認する前提でまとめました。

モデル比較・選び方

ローカルLLMを動かすPC・GPUの選び方|VRAMから逆算する構成と予算

ローカルLLMを自分の環境で動かすためのPC・GPU選びを、実務目線で整理します。最重要はコア速度ではなくVRAM容量であること、4bit量子化でメモリを圧縮できること、モデルサイズ別のVRAM目安、Mac(統合メモリ)という選択肢まで、動かしたいモデルから逆算して構成と予算を組む考え方をまとめました。