デジタル人文学(Digital Humanities: DH)は、人文学的探究と計算機科学の手法を融合させることで、文化遺産や歴史的文書の解析に革命をもたらしてきた。歴史的に、人文学における計算手法の導入は、細部のニュアンスを犠牲にして規模(スケール)を優先するもの、あるいは文脈の豊かさを抽象化と引き換えにするものとして、しばしば懐疑的な視点に晒されてきた1。しかし、大規模言語モデル(LLM)の台頭は、この長年の緊張関係における転換点を示している。構造化された入力や事前定義されたカテゴリに依存する従来の手法とは異なり、LLMは非構造化テキストを動的に処理し、文脈から意味を推論する能力を備えている1。
現在、LLMは単なるテキスト生成・抽出ツールではなく、知識の構造化、意味論的推論、および仮説生成を担う「認識論的インフラストラクチャ(epistemic infrastructure)」としての地位を確立しつつある1。本報告書は、英語、ドイツ語、フランス語、中国語、日本語の各言語圏における最新の研究プロジェクトや技術動向を広範に調査し、DH領域におけるLLMの応用状況を体系的に分析するものである。本調査では、マルチモーダルLLMによる歴史的テキストの光学文字認識(OCR)におけるブレイクスルーとその副作用である「過剰歴史化」、低資源言語(古代中国語、くずし字など)におけるベンチマーク評価、ハルシネーションを抑制するためのナレッジグラフとニューロシンボリックAIの融合、そしてLLMの登場が研究者のメソドロジーそのものをいかに変容させているか(「Promptotyping」の台頭など)について、深く掘り下げて論及する。
歴史的文書のデジタル化と自動テキスト認識(ATR: Automated Text Recognition)、特に手書き文字認識(HTR)および光学文字認識(OCR)は、DH研究の基盤である。近年、汎用的なマルチモーダルLLMが、歴史的文書のテキスト化において専用のHTR/OCRシステムに匹敵、あるいはそれを凌駕する性能を示し始めている2。
歴史的文書のテキスト化においては、これまでTranskribus、eScriptorium、Krakenといった専門的な機械学習プラットフォームが標準的に用いられてきた4。これらのシステムは、非ラテン文字や歴史的スクリプト向けにオープンソースの枠組みを提供し、研究者が独自のグラウンドトゥルース(正解データ)を用いてモデルをファインチューニングできる点で極めて有用であった4。
しかし、Gemini、Qwen、GPT-4oなどのマルチモーダルLLMは、画像全体を文脈として捉える全体論的なページ処理能力を有しており、複雑なレイアウトや非標準的なタイポグラフィを含む未見の文書に対しても、ゼロショットで高い認識精度を達成することが報告されている2。例えば、18世紀から19世紀の英語文書を対象とした評価では、GPT-4oやGeminiが5.7〜7%の文字エラー率(CER)を達成し、歴史的な手書き記録において従来の手法を大幅に上回る結果を示した4。
LLMの強力な生成能力は、歴史的テキストの認識において、従来のOCRには存在しなかった特異なパラドックスを引き起こす。18世紀のロシア語の市民書体(Civil font)を対象とした最新の大規模評価において、GeminiやQwenなどのLLMが従来のOCRを上回る精度を示す一方で、「過剰歴史化(Over-historicization)」と呼ばれる現象を体系的に引き起こすことが明らかになった2。
過剰歴史化とは、LLMが「これは歴史的文書である」という文脈を過度に認識し、対象となる特定の時代にはすでに廃止されていたり、使用されていなかったりする古風な文字や正書法(例えば、語尾の i, ѣ, ъ など)を、確率的な推測によって勝手に挿入してしまう現象である2。これは、LLMの事前学習コーパスにおいて様々な時代のテキストが混在していることに起因する「時代的混同(Temporal conflation)」の現れであり、テキストの視覚的特徴を忠実にマッピングするのではなく、歴史的な「雰囲気」をシミュレートしてテキストを生成していることを示唆している2。
この問題を定量化するため、デジタル人文学の研究者たちは、従来のCER(文字エラー率)やWER(単語エラー率)といった指標がLLMの評価には不十分であると指摘し、新たな評価指標を導入している2。これには、歴史的な固有の文字が現代の文字に誤って正規化されずに正確に保持された割合を示す「HCPR(Historical Character Preservation Rate)」や、画像上に存在しない時代錯誤な古字が挿入された割合を示す「AIR(Archaic Insertion Rate)」が含まれる2。興味深いことに、OCR出力に対するLLMを用いた事後修正(Post-OCR correction)は、この過剰歴史化をさらに助長し、全体的な性能を逆に低下させることが実証されている2。
英語を中心とした汎用LLMが発展する一方で、歴史的な言語や非ラテン文字(日本語のくずし字、古代中国語、アラビア語など)は、DHにおいて「低資源(low-resource)」ドメインと見なされてきた。現在、各言語圏において、これらのドメインに特化した基盤モデルの開発や、厳密なベンチマークの構築が活発化している。
中国では、数千年に及ぶ歴史的・文化的遺産をデジタル化するため、古代中国語(文言文)に特化したLLMの開発が進んでいる。南京農業大学と中華書局が共同開発した「荀子(Xunzi)」モデルは、四庫全書などの膨大な古典籍コーパスを用いて事前学習モデル(Qwen、Baichuan、GLMなど)をファインチューニングした特化型モデルである9。このモデルは、白文への自動句読点付与、異体字の変換、古典の現代語訳、さらには歴史上の人物の思考パラダイムを模倣した対話生成などにおいて活用されている12。また、北京大学の「識典古籍(Shidian Guji)」や「吾与点(Wuyudian)」プラットフォームは、BERTやLLMを活用して自動校勘や命名実体認識(NER)を実装し、構造化情報の抽出と知識グラフの構築を行っている14。
古代中国語に対するLLMの理解力を客観的に評価するため、「AC-EVAL」という革新的なベンチマークが開発された17。AC-EVALは、歴史、地理、思想、詩詞など13のタスクからなる3,245問の多肢選択問題で構成され、「一般的歴史知識(易)」「短文理解(標準)」「長文理解(難)」の3段階でモデルの知識と推論能力を測定する17。
| モデル名 | 一般的歴史知識 (易) | 短文理解 (標準) | 長文理解 (難) | 平均正答率 |
|---|---|---|---|---|
| ERNIE-Bot 4.0 | 77.54% | 68.11% | 66.42% | 70.69% |
| GLM-4 | 76.63% | 66.66% | 67.70% | 70.33% |
| Qwen-max | 73.77% | 64.88% | 63.84% | 67.50% |
| Qwen-7B-Chat | 62.74% | 48.76% | 44.97% | 52.16% |
| Xunzi-Qwen-Chat | 60.20% | 44.31% | 30.87% | 45.13% |
| GPT-4 | 66.11% | 55.11% | 47.38% | 56.20% |
| GPT-3.5 Turbo | 53.50% | 43.72% | 36.94% | 44.72% |
表1: AC-EVALベンチマークにおける主要LLMのゼロショット・アンサーオンリー設定での正答率比較(一部抜粋)17
この評価結果は、いくつかの深い第三次の洞察(third-order insights)を提供する。第一に、事実の検索を主とする「一般的歴史知識」では高いスコアを出すモデルも、高度な意味構造の把握を要する「長文理解」では正答率が急落し、複雑な構造情報を持つテキストにおけるLLMの推論能力の限界を示している17。第二に、古代中国語を専門にファインチューニングしたはずの「Xunzi-Qwen-Chat(45.13%)」が、そのベースモデルである汎用の「Qwen-7B-Chat(52.16%)」よりも低いスコアを記録したというパラドックスである17。これは、狭い領域の歴史的コーパスで過剰に学習させることが、一般的な推論能力や広範な意味論的容量を破壊する「破滅的忘却(catastrophic forgetting)」を引き起こすリスクを示唆している19。
さらに、甲骨文字や青銅器銘文、竹簡などの「出土文献」を対象としたベンチマーク「AncientBench」では、LLMが字形認識(Glyph comprehension)において人間に遠く及ばない一方で、辞書的な意味を問うタスクでは人間を上回る傾向が確認された21。これは、LLMが高度な事前学習を通じて高頻度の辞書的意味に過剰適合(overfitting)しており、真の意味での文脈的理解よりも統計的な頻度バイアスに依存していることを証明している21。
日本では、大学共同利用機関法人情報・システム研究機構データサイエンス共同利用基盤施設の人文学オープンデータ共同利用センター(CODH)が主導する「つくし」プロジェクトが、古典籍と現代人との距離を縮める画期的な取り組みを展開している22。
同プロジェクトの中核となる「IIIF Tsukushi Viewer」は、IIIF(International Image Interoperability Framework)準拠の画像ビューワに生成AIチャット機能を統合したシステムである22。このシステムは、資料の特定ページや領域のコンテキストを管理する機能を備えており、未翻刻のくずし字資料に対しても、オンデマンドでAIくずし字OCR(Tsukushi OCR Service)を実行し、その抽出テキストに基づいて現代語でチャットを行うことが可能である25。さらに、「つくし堂」と名付けられたAI生成書店では、古典籍のメタデータに基づいてLLMが現代的なキャッチコピーや要約を自動生成し、書店のPOP風の視覚的インタフェースを通じて資料の発見を支援している27。
国立国会図書館(NDL)は、数百万文字規模の学習データセットを用いて自館で開発した「NDLOCR-Lite」を一般公開し、日本のデジタルアーカイブ全体への貢献を図っている29。さらに、館内サーバ上で稼働するローカルLLMとNDLOCR-Liteを連携させ、外部通信を行うことなく(データのプライバシーとセキュリティを担保しつつ)、構造化、情報抽出、機械翻訳、要約を完結させる実証実験を推進している31。民間セクターにおいては、Sakana AIが江戸時代のテキストデータセットを継続学習させた古文風チャットボット「からまる(Karamaru)」を開発し、数千万文字規模の「日本古典籍くずし字データセット」が分野特化型LLMの構築に極めて有効であることを実証した32。また、同社は複数の最先端LLM(GPT、Claude、Geminiなど)をタスクに応じて動的に切り替えるマルチエージェントオーケストレーションシステム「Fugu」を構築しており、単一のモデルに依存しないエージェントアーキテクチャの有効性を提示している34。
アラビア文字の文書は、カリグラフィーの多様性、合字、発音区別符号の存在により、従来のOCRや自然言語処理パイプラインにとって極めて難易度が高い。イタリアのITSERRプロジェクトに属する「Digital Maktaba」は、Kraken OCRモデル(eScriptoriumインターフェースを介して利用)とLLMを統合し、不完全なテキストデータ(Textually imperfect data)からでも意味のある要約やキーインサイトを抽出するアプローチを採用している35。このプロジェクトは、Dublin Coreなどのメタデータスキーマを活用し、Europeana Data Model(EDM)と連携することで、多言語の文化遺産データの意味的関係を強化している36。
ラテン語や古代ギリシャ語圏では、「LatLM」や「Medieval Latin LLM」といったSentence-BERTベースのモデルがHugging Face等で公開され、文の類似度計算や意味論的検索に利用されている38。古代哲学の研究プラットフォーム「EleutherIA」では、ギリシャ語とラテン語のコーパスに対して、多言語対応(英・仏・独・伊・希)の知識グラフとRAG(Retrieval-Augmented Generation)を組み合わせたFAIR準拠のシステムが構築されており、LLMが歴史的テクストの引用と推論を正確に行うためのエージェント的基盤を提供している39。
ヨーロッパの研究インフラストラクチャは、データ主権(Data Sovereignty)、多言語対応、およびオープンサイエンスの原則(FAIR原則)に基づいて構築されており、LLMの統合においてもこれらの原則が厳格に適用されている。
ドイツ語圏のデジタル人文学(DHd)コミュニティでは、NFDI4Memoryなどのコンソーシアムを通じて、歴史的文書の計算論的解析が推進されている40。特に注目すべきは、「AGKI-DH(Angewandte Generative KI in den Digitalen Geisteswissenschaften)」ネットワークの活動であり、歴史学や文学研究におけるRAGの応用、固有表現抽出(NER)、プロンプトの脆弱性(Brittleness)と汎化性に関する議論を主導している41。
具体的な応用例として、ベルリン・ブランデンブルク科学アカデミー(BBAW)のTELOTAが開発した「genderTagger」がある。これは、TEI-XMLで記述された人物辞書におけるジェンダー分類を、TransformerモデルやローカルLLMを用いた自動分類と、研究者によるゲーミフィケーション化されたアノテーションUI(タイムアタックモードやスコアボード機能など)を融合させたツールである42。LLMによる推論をそのまま鵜呑みにするのではなく、人間の専門知識を効率的かつ遊び心を持って介入させる「Expert-in-the-Loop」の優れた実践例と言える。
フランスの国立科学研究センター(CNRS)とInriaが支援する巨大インフラストラクチャ「Huma-Num」は、人文社会科学向けのデータリポジトリ「ISIDORE」の次世代版(ISIDORE 2030)において、RAGの本格的な実装を進めている43。Huma-NumのHN Labの研究では、単にRAGを導入するだけでなく、研究対象の文書の「トポグラフィー」に合わせた文献学的なチャンキング戦略の重要性が指摘されている。例えば、500文字のチャンクサイズに対して50文字のオーバーラップを持たせることで、文の切断による意味の喪失を防ぎ、セマンティック検索のコヒーレンスを保証している46。
また、フランスでは研究データが米国のテック企業に依存することのリスク(データの不透明性や文化的バイアス)を軽減するため、フランス語と英語のバイリンガルに特化したオープンかつ主権的(Sovereign)でリソース効率の高いLLM「CroissantLLM」の開発が行われており、DH分野への応用が期待されている47。さらに、XLM-RoBERTaのエンベディングとNeedleman-Wunschアルゴリズムを組み合わせて、翻訳テキストにおける「カットダウン(意図的な省略)」を自動検出するLLMパイプラインなども構築されている48。
英国のユニヴァーシティ・カレッジ・ロンドン(UCL)やシェフィールド大学のDigital Humanities Instituteは、人工知能と機械学習を用いて巨大な文化的データセットの言説分析を行っている49。特筆すべき事例として、18世紀から19世紀のロンドンのオールド・ベイリー(中央刑事裁判所)の裁判記録を対象とした分析がある。研究者たちは、歴史的テキストに特化した言語モデル「MacBERTh」を用いて当時のテキストから「困窮の感情(hardship sentiment)」を定量化し、それを時系列分析モデル(VARやTemporal Fusion Transformer)にかけることで、困窮の感情の増大が5〜6週間後の死亡率の上昇を予測する強力な先行指標となること、そして死亡率の上昇が裁判所での有罪判決率の上昇に先行するという、社会・経済・司法のダイナミックな因果関係を実証した51。これは、LLMが単なるテキスト処理ツールを超えて、マクロな歴史的力学を解明するための社会科学的推論エンジンとして機能することを示している。
LLMは大規模なデータパターンを学習する能力に長けているが、その一方でハルシネーション(もっともらしい嘘)を生成しやすく、訓練データに内在する文化的・歴史的バイアスを再生産する危険性を孕んでいる。
フランスのLIAS研究所が行った「Experimental Historian LLM」プロジェクトでは、ポワトゥー地方の歴史に関する62の質問を12種類のLLMに投げかけ、精度と信頼性を測定した52。
| モデル名 | 正答数 | その他の回答 | 正答率 (Precision) |
|---|---|---|---|
| Gemini | 377 | 159 | 70.34% |
| Copilot | 303 | 233 | 56.53% |
| ChatGPT (GPT-4) | 287 | 249 | 53.54% |
| Mixtral-8x7b | 272 | 264 | 50.75% |
| Bard | 244 | 292 | 45.52% |
| Guanaco | 184 | 352 | 34.33% |
| Falcon | 22 | 514 | 4.10% |
表2: フランス・ポワトゥー地方の歴史に関するQ&AタスクにおけるLLMの精度比較(一部抜粋)52
Geminiが70.34%の正答率でトップとなったが、分析の結果、汎用LLMの多くは、同じ名称を持つ過去の複数の出来事(例:複数の異なる「ポワティエの戦い」や「ラ・ロシェル包囲戦」)を混同する強い傾向があることが判明した52。歴史家が個人的・文化的なバイアスに基づいて事実を誤認するのに対し、LLMは情報空間における名称の重複や文脈の欠落(アルゴリズム的バイアス)によって事実を混同する53。
同様に、1908年のメッシーナ地震に関する歴史的メディア(新聞)の抽出実験においては、LLMが英語のプロンプトや特定の出力フォーマットに対して強い選好(Format Preferences)を示すこと、またWikipedia等の主流な英語ソースに過度に依存した歴史理解しか持ち合わせていないことが確認された54。これは、非英語圏の歴史事象を分析する際、LLMが英語中心主義的なパラダイムを無意識のうちに適用してしまうリスクを浮き彫りにしている。
これらのハルシネーションとバイアスを克服するため、DH領域では「ニューロシンボリックAI(Neuro-Symbolic AI)」への回帰と進化が起きている55。これは、ディープラーニングの柔軟な言語処理能力と、オントロジーやナレッジグラフ(KG)の論理的・構造的な知識表現を組み合わせるアプローチである37。
スペインの「HerStory」プロジェクトは、フランコ政権下の弾圧や検閲に関するジェンダーの不平等を明らかにするため、Wikidataのオントロジーを基盤としたKGを構築し、それをLLMのRAGアーキテクチャに組み込んでいる55。これにより、LLMの出力がKGの確固たるファクトと出所(Provenance)にグラウンディングされ、歴史的事実に基づく説明可能でコミュニティのセマンティクスに整合したAIが実現されている55。
また、テキストの構造化と注釈の標準フォーマットであるTEI/XML(Text Encoding Initiative)とLLMの連携も進展している。シュヴェリーン伯爵夫人の回想録(18世紀)を用いたケーススタディでは、LLM(Qwenなど)がゼロショットで多言語間(フランス語とドイツ語)の固有表現抽出(NER)とアノテーション転写を行い、97%以上の精度で翻訳文へのタグ付けを成功させた57。興味深い現象として、中高ドイツ語概念データベース(MHDBDB)のように、維持管理コストの極めて高い数十億のRDFトリプルベースのグラフ構造から、LLMが読み取りやすい「TEI-first」なXMLモデルへとアーキテクチャを逆戻り(再設計)させる動きも現れている58。これは、LLMが高度なコンテキスト理解能力を獲得した現在、古典的なTEI/XMLが、AIによる拡張性と文献学的な正確性を両立する上で最も費用対効果の高いデータ構造であることを示唆する重要な第三次の洞察である。
LLMの性能向上は、DHにおけるソフトウェア開発やデータ探索のアプローチそのものを根底から覆しつつある。
オーストリアの研究者Christopher Pollinらが提唱する「Promptotyping(Prompt + Prototyping)」は、最先端のLLM(Claude 3.5 SonnetやGPT-4など)を用いて、研究者自身が研究ツール、ワークフロー、データモデルを極めて迅速にプロトタイピングする手法である59。この手法の核心は、単なる「プロンプトエンジニアリング」から「コンテキストエンジニアリング(Context Engineering)」への移行である60。研究者はプログラミングの構文を覚えるのではなく、研究データ(TEI-XMLやRDF)とドメイン知識(歴史学的な要件やUser Story)をLLMのコンテキストウィンドウにいかに効果的にマッピングするかに注力する。LLMはこれを受け、Pythonスクリプトやインタラクティブな可視化ツールを瞬時に生成する61。
このアプローチは、従来のDHプロジェクトで多大な予算と時間をかけて開発されていた「One-Size-Fits-All(万能型)」の検索・探索ダッシュボードの存在意義に根本的な疑問を投げかけている61。あらゆるユーザーのあらゆる想定質問に静的なUIで対応しようとする巨大なシステムは時代遅れになりつつある。代わって、個々の研究者の特定の「問い」に応じて、LLMがその場で動的にコードを生成しデータを可視化する「使い捨ての高度なカスタムインタフェース(Agentic DH)」が主流になるという予測が有力である23。これにより、ツール開発の主導権がソフトウェアエンジニアから、歴史家や文学者といったドメインエキスパートの手に確実に戻りつつある。
本調査の分析を通じて、デジタル人文学におけるLLMの応用が、単なる「テキスト処理の自動化」から「認識論的なパラダイムシフト」へと深化していることが明確に示された。
第一に、低資源言語や非ラテン文字圏(古代中国語、くずし字、アラビア語など)において、分野特化型LLMの構築とマルチモーダルLLMの適用が、歴史的文書の解読における長年の壁を打ち破りつつある。しかし、LLMによるOCRが引き起こす「過剰歴史化」という現象は、AIが歴史的コンテキストを「理解」しているのではなく、学習データに基づく確率的な「模倣」を行っているに過ぎないことを証明している。専門的にファインチューニングされたモデルが汎用モデルよりも推論タスクで劣る「破滅的忘却」のリスクも含め、HCPRやAIRといった新たな評価指標を用いてAIの振る舞いを人文学的に統制するプロセスが不可欠である。
第二に、LLMのハルシネーションと英語中心主義的なバイアスを補完するため、ナレッジグラフやTEI/XMLといった構造化データとの融合(ニューロシンボリックAI)が急速に進展している。膨大で複雑なRDFグラフからLLM親和性の高いTEI-firstモデルへの回帰に見られるように、データの表現形式そのものがAI時代に合わせて再定義されている。
最後に、「Promptotyping」の台頭は、研究と開発の境界を融解させている。デジタル人文学は今、AIという強力な「増幅器」を手に入れたことで、単なるデータのデジタル化や規模の追求を終え、AIが提示する結果を批判的に吟味し、文化や歴史の深淵な意味を研究者自身の手で直接的かつ動的に再構築する「Expert-in-the-Loop」の成熟したフェーズへと移行している。
このページは、ユーザーが提供したMarkdown資料「デジタル人文学におけるLLM応用動向.md」をDokuWiki記法に転記したものです(2026-08-18)。