# Fileset

[JOSS_10min_nims.amano.public.pdf](https://mdr.nims.go.jp/filesets/056c274b-e5ae-45c2-afe4-2930e9c98a68/download)

## Creator

[天野 晃](https://orcid.org/0000-0002-8079-4941)

## Rights



## Other metadata

[テキストマイニングXML論文の整理](https://mdr.nims.go.jp/datasets/b2288ca9-9d78-44b1-b9c9-a4967bb55ba7)

## Fulltext

大学図書館による研究データ流通のサポート2018.06.18 物質・材料研究機構天野晃(1)イントロダクション(2)テキストマイニングXML論文の整理(1)イントロダクション※実際の業務をベースに発表用にアレンジしています。※未実装のものもあります。※個人的提案及び見解として聞いてください。ご注意(1)イントロダクション弊職の業務のひとつに-テキストマイニング用XML論文の整理があり、具体的には-データの取得-取得データの整理-検索機能-アクセスビリティ-バックアップがあります。今日は検索を中心にお話しします。※非公開(2)テキストマイニングXML論文の整理(2).1 データの取得とXMLの整理- XMLデータの取得- XMLタグ解析-全文検索(2).2 XML以外のデータを検索可能にする(図・画像)-文字列(画像中の)- Plot(Key:Value)-化学式(化合物)※数式はMathML記述されており"ひとまず"処理不要(2).1データの取得とXMLの整理:XMLデータの取得オープンデータ(論文)の例：- NCBI PubmedCentralftp://ftp.ncbi.nlm.nih.gov/pub/pmc/oa_bulk/ツール: 直接ダウンロード- Elsevier Developershttps://dev.elsevier.com/index.htmlツール: Python- Springer Open Access APIhttps://dev.springernature.com/ツール: curl + bash※非公開(2).1 データの取得とXMLの整理:全文検索Neo4j(GraphDB)画像図のパートセクション論文③論文の要素毎データをインポートツール(neo4j-import)を使用してデータを取り込むElasticsearch(全文検索エンジン)論文(全文検索用)④論文の要素毎データをデータ管理ツール(Logstash)を使い、Elasticsearchへ同期 DOIで紐づく画像図のパートセクション論文(その他の項目)論文(XMLファイル)画像ファイル論文メタデータ(CSVファイル)②画像処理API(Tesseract-OCR)を使い、画像の文字列を抽出する ①データ抽出アプリケーション(自作のJavaアプリケーション)を起動し、各出版社の論文から要素毎のメタデータを抽出する。⑤全文検索用データをデータ管理ツール(Logstash)にてインポート(2).2 XML以外のデータを検索可能にする:図中文字列XML論文の図の文字列のインデクシング例:1. XML論文と図のリンク処理(Logstash)2. 図中の文字列の抽出(Tesseract-OCR)3. 上記関係をインデクシング(Elasticsearch)YukawaInput: Type=String Output: Fig +書誌情報全文検索システム(2).2 XML以外のデータを検索可能にする:PlotPlotからの[Key:Value]抽出例:1. 線分と文字(数字)情報の分離2. 線分情報から図内の複数plotを分離3. 分離後各plotよりX-Y暫定値抽出4. 数字の位置をヒントに暫定値を修正5. DBへ投入(Elasticsearch)※5以外すべて機械学習Input: Type=Key:Relation:ValueKVS検索システムPE 0.004>=Output: Fig +書誌情報(2).2 XML以外のデータを検索可能にする:化合物化合物検索例:1.1 本文 => SMILES抽出(テキスト処理)2.1 化合物表示の図を選択(機械学習)2.2 図の化合物表示 => SMILES(OSRA)3. SMILES => MOL変換(Open Babel)4. MOL =>結合隣接行列(テキスト処理)5. マッチング(次スライド)C1=C(NC=N1)CC(C(=O)O)NInput: Type=SMILES化合物検索システムOutput: Fig +書誌情報※非公開