RAG評価、精度だけでなく人との協働へ
RAG研究では、回答精度だけでなく、人がAIアシスタントと複数回やり取りしたときの使いやすさ、満足度、コストまで評価する流れが出ています。
何が起きたのか
RAGアシスタントを使った情報探索研究では、3B、8B、70Bといったモデルサイズの違いが、人間との協働タスクにどう影響するかが検証されています。単純なモデル単体評価ではなく、職場に近いマルチターンの利用場面が重視されています。
主要な論点
注目点は、大きいモデルが常に体験価値を大きく高めるとは限らないことです。根拠付き回答、会話の続けやすさ、ユーザーの満足度、運用コストをまとめて見る必要があります。
影響
社内検索、ナレッジ管理、法務・規程確認のようなRAG用途では、最上位モデルだけを選ぶより、用途に合うモデルサイズと検索設計を選ぶ方が現実的です。PoC評価にもユーザーテストが必要になります。
注意点
研究環境での結果は、社内データの品質や検索基盤によって変わります。RAG導入時は、文書整備、権限管理、引用表示、ログ確認まで含めて評価する必要があります。