文書の事前解析と要素ごとの照合により、Rerankerに依存しない検索と、一般的なPCでのオフライン利用を目指す

日本語文書検索AIの基本設計を完了。実装・学習・検証フェーズへ
光数株式会社は、2026年8月に研究開発開始を発表した日本語文書検索向け次世代小型AIモデルについて、モデルの基本設計を完了しました。今後は、設計に基づく実装、学習用データの整備、モデルの学習・評価を進める開発フェーズへ移行します。
今回の設計では、専門文書の情報をどのように整理・保持するか、検索条件とどのように照合するか、検索品質と処理負荷をどのように評価するかを具体化しました。特許・技術資料を最初の検証対象とし、日本語専門文書の検索に適したモデルの開発を進めます。
文書の情報を事前に整理し、検索時の処理を軽くする
新モデルは、文書を取り込む際に内容を解析し、検索に利用する情報を事前に保存する構成です。検索時には利用者の検索条件を解析し、保存済みの情報と照合して関連文書を探します。
一般的な「Embeddingによる候補検索+Rerankerによる再評価」という構成では、検索のたびに候補文書と検索条件を別のAIモデルへ入力して評価します。新モデルでは、文書側の解析を取り込み時に済ませ、検索時は事前に計算した情報を使って照合・順位付けを行います。
この設計により、検索のたびに候補文書と検索条件をAIで個別に再評価する処理を省き、検索品質を保ちながら応答時間と計算負荷を抑えることを目指します。
文書全体の類似度に加え、技術要素の一致を捉える
専門文書の検索では、話題が似ているだけでなく、必要な条件や技術要素が含まれているかを確認することが重要です。
例えば特許文書では、装置の構成、材料、処理手順、数値条件などの違いが、文献を確認するうえで重要な判断材料になります。新モデルでは、文書の内容を複数の要素として保持し、検索条件との対応を評価する方式を採用します。
また、検索に用いる情報を原文の該当箇所と結び付けることで、利用者が「どの部分が検索条件に対応しているか」を確認できる仕組みを目指します。検索結果の提示から原文の確認までをつなぎ、専門業務における調査を支援します。
一般的なPCで、文書を外部へ送らずに利用できる構成へ
利用時の環境として、一般的なPCのCPUで動作するローカル構成を想定しています。モデルと検索用データを端末内に保持し、外部APIへの文書送信や常時インターネット接続を必要としない利用環境を目指します。
機密性の高い技術資料や社内文書を扱う企業など、クラウドサービスへの文書送信に制約がある環境での活用を見据え、検索品質とあわせて処理時間、メモリ使用量、保存容量を検証します。
今後は実装・学習と比較評価を進める
設計完了を受け、今後は以下の開発に取り組みます。
- 日本語の特許・技術文書を用いた学習用データと評価用データの整備
- 新モデルおよび検索処理の実装と、モデルの学習
- 既存のEmbeddingモデルやEmbedding+Reranker構成との比較評価
- CPU環境での検索速度、メモリ使用量、オフライン動作の検証
今後、モデルの学習・評価を通じて、検索品質と処理速度を既存方式と比較し、実用性を検証します。
光数は、NEDO「GENIAC-PRIZE」でのPoCを通じて得た知見を生かし、日本語専門文書の検索品質と実用的な処理効率の両立に向けて研究開発を進めてまいります。
Web:https://ai.wdx.jp
お問い合わせ:ai@wdx.jp