あらかじめ用意した問い(評価セット)をこのチャットボットに実際に解かせて、答えの質が前より落ちていないかを点数で確かめる機能です。知識・プロンプト・モデル・設定を変えた前後で流すと、良くなったか悪くなったかが数字で分かります。
- knowledge(知識 QA): 現場で聞かれそうな問い 40 問。正しい文書を引けたか(再現@K)、答えに必要な語が入っているか、LLM 採点(0〜1)を見ます
- memory(記憶): 会議で決まったことを話したあと、別の会話で覚えているかを確かめる 6 本
- decision(判断一貫性): 承認が要る判断で申請を出すか、閾値を引くか、過去の決定と矛盾しないかを確かめる 8 本
費用: 「実行」は本番と同じ API を実際に呼びます。目安は knowledge 10 問(LLM 採点つき)で約 $1、decision 8 本で約 $1.5、全部で $2〜4。「検索のみ」は費用がかからず数秒で終わるので、知識を入れ替えた直後の確認に向いています。
使い方: ① 変える前に 1 回流して基準を作る → ② 変更する → ③ 同じ条件でもう 1 回流す → 下の実行履歴で 2 行を比べる(行をクリックすると、どの問いで落ちたかが見えます)。「タグ」に同じ名前を付けると比較しやすくなります。
後始末: 評価は専用の利用者(eval-…)として会話するので、あなたの会話や記憶には混ざりません。評価が作った会話・記憶・承認申請は、終了の約 5 分後に自動で消えます(結果の点数と費用の記録は残ります)。すぐ消したいときは「評価の残り物を消す」。
毎日の点検: 費用のかからない「検索のみ」(知識 QA 全問)は、毎日 3:20 に自動で流れます。前回より 2 問以上外れが増えると、画面の上に赤い警告が出ます。実行履歴ではタグ daily の行です。