過去の文献から学ぶ、専門知識の外在化とAgent Skills化

こんにちは、LegalscapeのAIエンジニアのDannyです。

最近、人間の専門性をLLMベースのAIエージェントにどう適切にエンコードするかを扱う研究が数多く現れている。なかでもSKILL.mdの形式は、実行時にエージェントへ専門知識を注入する定番の手段になりつつある。

ただし、ひとくちにSkillといっても、対象となるタスクは様々。タスクはスコープ、規模、粒度、そしてどこまで厳密に仕様を記述すべきか(エージェントの即興をどこまで許容するか)において異なる。さらに、そのSkillは個人利用のためのものか、それとも他者と共有するものか。共有するとして、その目的は何か(自分の意思決定プロセスを完全に再現・外在化することなのか、特定の評価指標を最適化することなのか、など)。

その中で一つ興味深いユースケースが、暗黙知(tacit knowledge) の外在化(externalization)、すなわち、ある専門性を共有可能かつ再利用可能な形にすること。

  • 暗黙知:明示的なルールとして完全に言語化・表現することが難しく、代わりに言葉にならない知覚・判断・行為などを通じて発揮される知識

この概念自体は新しいものではなく、認知心理学や企業のナレッジマネジメントなどの分野で数十年にわたり研究されてきた。

たとえば:

  • 1966年、Michael Polanyi の「我々は語れる以上のことを知っている(we know more than we can tell)」[3]
  • 1995年、Ikujiro Nonaka と Hirotaka Takeuchi のSECIモデル。企業が従業員の直観を捉え、明示的で収益につながるものへと変換するための枠組み [4]
  • 1998年、Thomas Davenport と Laurence Prusak による、組織において暗黙知の何をどう形式知化すべきか/すべきでないかについてのルール [5]
  • 1998年、Gary Klein の再認主導意思決定(Recognition-Primed Decision, RPD)モデル [6]
  • 1998年、Militello と Hutton による応用認知タスク分析(Applied Cognitive Task Analysis, ACTA)。専門家にインタビューし、暗黙的な思考プロセスを引き出す手法 [7]

つまり、専門知識のエンコード手段としてのAgent Skillsは、AIという文脈のもとで生まれた新しいアプローチでありながら、ターゲットする問題そのものは新しいわけではない。

このトピックが今特に面白い理由はまず、バーティカル特化したドメイン専門知識を、AIエージェントに注入し再現してもらう、というのが可能になりつつあることだ。

そして、フォルダベースのSKILL.md形式はシンプルでありながらexpressiveであり、過去の文献にあるアイデアや手法とより整合する形へ拡張していける余地がある。

加えて、本記事のフォーカスではないが、暗黙知の外在化やSKILL.mdに限らず、パーソナライズされたエージェントの設計、エージェントメモリ、continual learningといった領域が、同じプリミティブとフレームワークに収束しうるように見える。

以下では、人間の専門家から暗黙知を抽出するシステムを構築するうえで注意すべき重要な点を見ていく、認知心理学やナレッジマネジメントの先行研究の指摘をもとに見ていく。

専門家がいつ・どのように言語化するのかを考える

専門性の多くは状況認識から成り立っている。手がかりに気づき、予期を形成し、明示的なルールを意識的に適用することなく行為を選択する、というものだ。

引き出し方(elicitation)の手法とタイミングが違えば、見えてくる専門性の部分も違う。専門家が何に気づいているかをリアルタイムに述べたものと、なぜその判断をしたのかを事後に説明したものは、同じ種類の証拠ではない。

たとえば『Protocol Analysis』の枠組みは、言語報告を三つの水準に区別している [8]:

  • レベル1:作業記憶の中にすでに言語形式で存在している内容の発話。変換を必要とせず、進行中の認知プロセスについて最も直接的な証拠となる。
  • レベル2:イメージや音といった非言語的な作業記憶の内容を、言葉へ変換して行う発話。
  • レベル3:現在の作業記憶の内容を超えた検索や推論を要する発話。説明、理由、正当化、一般化などが含まれる。元のプロセスの直接的な記録ではない。

とはいえ、どちらかが普遍的により価値が高いというわけではない。特定のタスク遂行中の認知を再構成することが目的なら、レベル1とレベル2の記録に価値がある。明示的なルールを構築・強化することが目的なら、レベル3の記録のほうが価値を持ちうる。

事後的な説明は、単に既存の知識を記録するだけでなく、知識を生み出すこともある。判断の理由を説明するよう求められたとき、専門家が有用なルールを初めて言語化することがある。そのルールは元の行為の最中に言語形式で存在していたとは限らないが、それでも価値ある外在化された知識になりうる。

実務的には、二つのストリームを分けて収集するとよい:

  1. プロセス:可能ならリアルタイムの自己発話、あるいは「その瞬間、何に気づき、何を予期していましたか?」
  2. 説明:「振り返ってみて、なぜその行為が適切だったのですか?」

どちらも有用でありうる。重要なのは、それぞれの発言がいつ・どのように生成されたのかを保持しておくことだ。

プリミティブと専門知識のモデリング

暗黙知を外在化するための基本的なプリミティブは三つある。

  • Raw Evidence(生の証拠):記録、トレース、判断、結果、観察、そして専門家の発言・言語化。
  • Reusable Knowledge(再利用可能な知識):ヒューリスティクス、ルール、ルーブリック、関係性といった、より高い抽象度の対象をモデル化した構造化データ。
  • Executable Knowledge(実行可能な知識):エージェントや実行系がそのまま動かせる形式・構造。

この三つはいずれも、項目を並べただけのフラットなリストや列ではない。それぞれが本質的に関係的な情報を含んでいる。

たとえば、生の証拠の一つひとつは、特定のタスク、イベント、時刻、出典、引き出し手法、観察された結果に紐づいている。再利用可能な知識は、手がかり、目標、予期、行為、例外、結果といった高次の概念をモデル化し、それらは関係や依存で結ばれうる。

自由度の高いMarkdownファイルは実際に実用的な表現形式の一つとなっている。その理由は、自然言語とTransformerの組み合わせが、グラフデータベースを必要とせずにグラフ的な関係をゆるくimplicitにencodeしてくれるからだ。

その一方で、関係や構造をより明示的にできる表現も存在する。型付きオブジェクトのリスト、DAG、グラフ、コードなどだ。こうしたアプローチはより強い制約と決定性をもたらすが、たいていはスキーマ設計とキュレーションにより多くのコストを要する。

専門性の外在化は継続的なプロセスである

一度きりの抽出から得られた知識ベースはsnapshotにすぎず、専門家・タスク・環境の変化によって急速にobsoleteになりうる。

たとえばRPDモデルは、実行時(シミュレーション)をループに組み込んだ、より有用な順序を示唆している [6]:

  1. パターン認識:状況を認識し、もっともらしいフレームを取り出す。
  2. シミュレーション:提案された行為が期待どおりの結果を生みそうかを検討する。
  3. 診断:フレームが適合しないなら、状況をより深く観察し、代替を探す。

多くのエージェントシステムは最初の一つしか実装していない。似たものを検索して行為する、というものだ。しかし検索には、認可・フィルタリング・グルーピングが必要になることが多い。その知識が現在の文脈に当てはまるのか、まだ有効なのか、すでに上書きされていないのかを、システムは依然として判断しなければならない。

実際には、あらゆる(実際運用環境、またはそれに近い環境での)実行をトレースをし、継続的なサイクルにする必要がある:トレースは、モデル修正のための証拠の一種とする。

ここにおいて、Agent Skills、エージェントメモリ、パーソナライゼーション、contunual learningは収束しうる。いずれも、経験を将来の再利用可能な behaviors へと変えつつ、将来の経験がそこへ戻ってそれを修正できるようにすること、という関心を共有しているからだ。

最後

最後に、これらの文献の視点からSKILL.mdを眺めたときに見えてくることをまとめたい。LLMはプリミティブ間の境界をきわめて流動的にする。本来なら型やグラフ、if-statement を要するような構造を、Markdown文書がlooseに表現できてしまう。実装は、実行可能・かつ一定有用な状態になるまでに、それほど厳密である必要がない。

その柔軟性はSKILL.mdの強みであると同時にリスクでもある。関係や条件といった情報が十分に規定されていないとき、LLMは黙って情報のギャップを埋めてしまう可能性がある。Behaviors の一部が専門家に厳密に由来(provenance)するものではなく、その場で作り出されたものであったとしても、実行時には一見うまく動いているように見えてしまう。

したがって、よく externalize された専門性は、次のような情報を保持することがポイントになるだろう:各知識 atom がどの種類の証拠に由来するのか、互いにどう関係するのか、いつ適用されるのか、どのような結果がありうるのか、そして将来の実行時利用がそれらをどう更新しうるのか。


参考文献

[1] "A Comprehensive Survey on Agent Skills." arXiv:2605.07358, May 2026.

[2] Agent Skills open specification. agentskills.io, December 2025.

[3] Polanyi, M. The Tacit Dimension. Doubleday, 1966.

[4] Nonaka, I. & Takeuchi, H. The Knowledge-Creating Company. Oxford University Press, 1995.

[5] Davenport, T. H. & Prusak, L. Working Knowledge: How Organizations Manage What They Know. Harvard Business School Press, 1998.

[6] Klein, G. Sources of Power: How People Make Decisions. MIT Press, 1998.

[7] Militello, L. G. & Hutton, R. J. B. "Applied Cognitive Task Analysis (ACTA): A Practitioner's Toolkit for Understanding Cognitive Task Demands." Ergonomics 41(11), 1998.

[8] Ericsson, K. A. & Simon, H. A. Protocol Analysis: Verbal Reports as Data. MIT Press, 1984(改訂版 1993).

[9] Chi, M. T. H., Bassok, M., Lewis, M. W., Reimann, P. & Glaser, R. "Self-Explanations: How Students Study and Use Examples in Learning to Solve Problems." Cognitive Science 13(2), 1989.

We Are Hiring!

Legalscapeでは、単に汎用的なLLMを導入するにとどまらず、リーガルという「一分の隙も許されない」高度な専門領域において、AIの限界を特定し、それを克服するための挑戦を続けています。法制度の複雑さに技術で挑み、信頼できるリーガルAIを社会に実装していく。この技術的挑戦を共に楽しんでくれる仲間を募集しています!