LLMアプリケーション評価駆動開発 継続的に改善し運用していくための実践知
CRANK

「正解」がわからない出力を、どう評価するのか?LLMアプリ特有の評価の基本から、継続的改善の運用方法まで徹底解説! LLMアプリケーションを価値あるものにするためには、評価が欠かせません。 評価をすることではじめて、LLMアプリケーションの現在地を把握し、改善すべき方向性を見極めることができます。 しかし、LLMアプリケーションの評価は、・出力が確率的かつ自由度が高いため単純に正答率を評価することができない・なにをもって良い出力とするかの軸が定めにくいといったことから、「どう評価すればいいのか分からない」という課題にぶつかることが多くあるのではないでしょうか。 本書は、そういった課題を解決すべく、評価の種類、どういった評価指標を作っていくかはもちろん、近年注目されているLLM-as-a-Judgeを使った実際の評価、リリース後の評価・改善といった、基本から実務で使える知識まで解説します。 ■本書の特徴・評価の基本を網羅的に解説:評価の全体像から評価軸の考え方まで丁寧に解説していきます ・幅広い評価のアプローチの解説:最新の評価手法であるLLM-as-a-Judgeなども取り上げ、幅広い評価のアプローチを習得することで、あらゆる場…

shoeisha.co.jp
Related Topics: AI