喃字情緣--漢喃文獻資料庫的重生

中央研究院中國文哲研究所與數位文化中心合作開發建置的「越南漢喃文獻資料庫」於2024年上線。

先看看這頁書影,是否發現一些像漢字、卻又不識的文字?它們是越南的喃字(Chữ Nôm),一種以漢字為基礎所創造的文字。在20世紀拉丁化越南文通行前很長的一段時間,漢字與喃字並行使用的漢喃文(Hán Nôm),成為越南書寫系統之一,至今留存不少漢喃文獻。這些文獻部份來自中國的重抄重印本、另一部份則是越南人受漢化文影響所撰的著作。



《程國公阮秉謙詩集》(Trình Quốc công Nguyễn Bỉnh Khiêm thi tập)書影。作者:阮秉謙。影像來源:Internet Archive。公眾領域(Public Domain)。

1993年越南漢喃院與法國遠東學院合作出版《越南漢喃文獻目錄提要》越文與法文版,2002年該院又出版《越南漢喃文獻目錄提要補遺》越文版,二書共收錄7000餘種漢喃古籍與地方文獻。2000至2004年,中央研究院中國文哲研究所陸續進行二書的漢譯、修訂與出版工作,同時依中文版內容建置成「越南漢喃文獻目錄資料庫」,公開予各界使用。2023年,文哲所與中研院數位文化中心合作(下稱本中心),一方面將「越南漢喃文獻目錄資料庫」的書目資料結構化,二方面重新設計系統架構、開發功能與使用介面,於2024年推出嶄新的「越南漢喃文獻資料庫」,無償提供公眾運用。

究竟這個新版資料庫有哪些特色?將書目資料結構化對使用者又有什麼助益?

📢特色1:在書目之外,新增人物檢索功能。
 👉能透過人名、所屬朝代以及擔位書籍工作之角色(如撰、校訂等)進行查詢,得知某人參與了哪些書、擔任書籍工作的什麼角色。甚至能進一步了解,該人物參與的是該書主體部份亦或相關內容的工作。


📢特色2:重新設計使用介面,強化操作體驗。
 👉使用者除了能輸入檢索詞,亦能不輸入文字、藉由各種屬性篩選(點選)出感興趣內容。在書目分類與地點屬性部份,更導入樹狀結構,忠實呈現原本的分類架構與行政區級。


📢特色3:新增逾13,500筆人名、神祇、地名與出版地權威詞。
 👉從既有的書目內容整理出這些權威詞,有助於更深入掌握書籍細節,提升資料分析的面向與可能性。

💡之所以能提供這麼多維度的檢索與串結各種資料,正是因為將資料結構化。


現階段的「越南漢喃文獻資料庫」只有書目資料,並無書影檔案與全文。即使我們從書目提要與基本後設資料抽取出諸多細部資料,使用者能獲得的訊息相對有限。為提升本資料庫的廣度與深化學術應用,我們自2025年起藉由國際合作與開放資料,獲得書目的數位化書影;後續將運用本中心建置的「中央研究院文字辨識與校對平臺」(下稱OCR平臺)與研發中的喃字辨識技術,對書影進行全文辨識。於「OCR平臺」自動辨識完成或經人工校正後的文本會回傳資料庫,提供閱覽與檢索全文功能。如此,「越南漢喃文獻資料庫」終成為一個整合書目、書影與全文的研究型知識庫。

更多資料庫的特色與功能,等你來體驗!


🎉同場加映🎉

1️⃣今年9月,本中心團隊於「太平洋鄰里協會2025年年會暨聯合會議」以”From Bibliographic Databases to Research-Oriented Knowledge Bases: A Case Study of Academia Sinica's ‘Vietnamese Hán-Nôm Literature Database’ ”為題,進行報告並展示海報論文,說明以上「越南漢喃文獻資料庫」開發歷程與未來願景。



"From Bibliographic Databases to Research-Oriented Knowledge Bases: A Case Study of Academia Sinica's ‘Vietnamese Hán-Nôm Literature Database’ ” 海報論文

2️⃣中研院文哲所劉柏宏助研究員所撰〈從文獻書目到知識庫─「越南傳統文獻資料整理近況」專輯導言〉(《中國文哲研通訊》,35:2(2025.6),頁1-3。),從近年越南傳統文獻整理角度,說明新、舊資料庫在這過程中扮演的角色。
「越南傳統文獻資料整理近況」專輯更多文章請點此閱讀