エンタープライズRAGの「文書チャンキング」問題を、コスト95.7%削減しながら解いた手法が発表されました。
タイトル: D-RAC: Document Retrieval-Aware Chunking
URL:
📌 概要
PDF・DOCX・PPTX・スキャン画像などバラバラな企業文書を、いったんPDFに正規化してからマルチモーダルLLMで検索最適化Markdownに1回だけ変換し、そのあとはID単位で決定的にチャンク計画を立てる4段階パイプラインです。
❗ 解決する課題
従来のルールベース抽出は表や見出し階層を壊してしまい、精度重視のエージェント的チャンキングは文書全体を再生成するためコストが高くつくというジレンマがありました。
🛠️ 方法論・提案手法
表を列見出し付きの1文にする「行レベル散文化」、見出し階層の再構成、ID配列だけを渡すチャンク計画など、検索精度とコスト効率を両立する設計を随所に採用しています。
📊 実験結果
236文書・795ページの評価で、出力トークンを95.7%削減しつつRecall
@6は0.798とエージェント的手法(0.795)やルールベース(0.717)を上回りました。処理時間も75%短縮しています。
🏢 ユースケース
自動車・銀行・クラウドなど複数業界の文書で安定した性能を確認しており、本番のエンタープライズRAGパイプラインへそのまま組み込みやすい設計です。
#
RAG# #
ドキュメント処理#