Skill Router実装の要点、BM25と埋め込み検索を生かす設計術
ニュースの概要
エージェントが利用できるスキルの数が数十から数千へ増えると、適切な機能を見つけて呼び出す仕組み自体が主要な設計課題になります。今回の論点は、スキルを探す場面ではキーワードの一致に強いBM25と、意味の近さを捉える埋め込み検索を組み合わせる方法が現実的だという整理です。さらに、候補の確信度が低いときに無理に実行せず、確認や再検索へ切り替えるabstainも欠かせません。これは単なる検索機能ではなく、誤作動の損失を抑える制御層としてSkill Routerを捉える動きです。
引用元: Skill Router が大型スキル庫でのエージェント検索の実運用課題を整理、BM25と埋め込みのハイブリッドが有力に(alphalab.site)
分析・見解
検索精度だけでなく「誤って実行してしまう害」まで評価する
Skill Routerの難しさは、検索結果の順位だけでなく、選んだスキルを実行してよいかまで同時に判断しなければならない点にあります。通常の文書検索なら、多少順位を誤っても読者が内容を確認できます。しかしエージェントは、誤ったスキルをそのまま実行してメールを送る、顧客情報を書き換える、返金処理を開始するといった行動に移せます。したがって評価対象は検索の精度だけではなく、誤った選択の発生率、危険な実行を抑止できた割合、確認に回した割合まで広げる必要があります。
BM25と埋め込み検索、それぞれが拾える入力の違い
BM25(単語の一致度を使う検索方式)と埋め込み検索(意味の近さを使う検索方式)を併用するのが有力なのは、両者の弱点が比較的補完的だからです。BM25は「請求書」「解約」「在庫引当」のような業務用語、製品名、規約番号、API名を正確に拾えます。一方、埋め込み検索は「取引先から届いた支払い関連の書類を処理する」のように、利用者がスキル名と異なる表現を使った場合に力を発揮します。例えば、スキル名が「請求書登録」であっても、入力が「仕入先の明細を経理システムへ反映して」と書かれていれば、意味検索が候補を見つけやすくなります。
候補生成と再順位付けを分け、メタデータで判断材料を増やす
実装では、最初から一つの検索方式に賭けるより、候補を集める段階と順位を付け直す段階を分ける設計が扱いやすいでしょう。BM25とベクトル検索からそれぞれ上位10件程度を取り、重複を統合したうえで、入力との一致度、スキルの対象部門、必要な権限、前提条件、過去の成功率を加味して再順位付けします。ここで重要なのは、スキルの説明文だけを索引に入れないことです。入力例、対象外の例、必要な引数、実行による副作用、代替スキルをメタデータとして持たせると、候補選択の判断材料が増えます。
保留は失敗ではなく、しきい値も業務リスクごとに変える
独自の視点として、abstain(判断を保留すること)は「検索に失敗したときの例外処理」ではなく、検索品質を継続的に改善する観測装置にもなります。Routerが自信を持てずに保留した入力を集めれば、未登録のスキル需要、曖昧な説明、似すぎたスキルの境界を発見できます。例えば、保留率が特定部門だけ12%に達しているなら、モデルの性能不足ではなく、その部門の用語辞書やスキル定義が不足している可能性があります。保留を失敗として隠すのではなく、改善用のデータとして扱うことが重要です。
また、信頼度のしきい値を全スキルで共通にするのも危険です。読み取り専用の社内検索は多少の誤差を許容できますが、送金や権限変更に関わるスキルは、より高い確信度と人間の承認を要求すべきです。候補間のスコア差が小さい場合、上位を無理に決めるより「AとBのどちらですか」と質問する方が合理的です。今後は、検索器、ポリシー判定、実行承認、評価ログを分離し、変更の影響を個別に検証できる構成が標準になるでしょう。スキル数が増えるほど、モデルの賢さよりも、分類境界と失敗時の振る舞いを管理する設計力が競争力になります。
ビジネスへの影響
導入前に「誤選択の損失」でリスクを分類する
企業がSkill Routerを導入する際は、まずスキルの登録数を増やすことより、誤って選んだ場合の損失を分類するべきです。検索、要約、社内照会のような低リスク業務と、顧客通知、契約変更、決済処理のような高リスク業務では、求める精度も承認の手順も異なります。後者には、候補を一つに決める前の確認画面、実行権限の分離、入力引数の検証、監査ログを組み込みます。
数百件の評価データでBM25・埋め込み・併用を比較する
導入前には代表的な利用文を少なくとも数百件集め、正解のスキル、許容できる代替スキル、実行してはいけないスキルを人手で付与します。その評価用データで、BM25単独、埋め込み単独、併用方式を比較し、上位1件の正解率だけでなく、危険な誤選択率、abstain率(保留の割合)、応答時間も測定します。例えば、併用によって正解率が82%から89%に上がっても、応答時間が大幅に延びるなら、低リスク業務だけ二段階検索にする判断ができます。
運用開始後は保留率と失敗率を月次で追い、成果指標にする
運用を始めた後は、スキルごとの呼び出し数、保留率、失敗率、再試行率、承認後の取り消し件数を月次で確認します。保留が多いスキルは説明文を直すだけで改善する場合があり、逆に似たスキルを統合した方が効果的な場合もあります。費用の面では、候補を集める処理を軽量な検索基盤で行い、再順位付けや確認だけを高性能モデルに任せると、全件を大規模モデルへ渡す構成より予測しやすくなります。経営判断では、単純な自動化率ではなく、事故を避けながら人の確認作業をどれだけ減らせたかを成果指標に置くのが現実的です。