ModernBERTは日本の放射線レポートにおける胸部CT所見の分類において従来のBERTよりも効率的である
カテゴリ:診断支援・画像解析
公開日:2026年4月4日
タイトル:ModernBERT is more efficient than conventional BERT for chest CT findings classification in Japanese radiology reports.
雑誌名:Sci Rep. 2026 Apr 03; doi: 10.1038/s41598-026-44292-z.
概 要:
本研究は、日本語の医療テキスト分類における複雑な語彙や文構造の課題に対処するため、胸部CT所見のマルチラベル分類において、BERT Base、JMedRoBERTa、ModernBERTの3つの日本語モデルを比較しました。CT-RATE-JPNデータセットを使用し、全モデルを同条件でファインチューニングしました。ModernBERTは、トークン数が大幅に少なく、トレーニングと推論が他のモデルよりも速く、内部テストデータセットにおいても比較可能な性能を維持しました(正確な一致率:74.7%対72.7%)。一般化能力を評価するために、同じスキーマで注釈された243件の自然言語で書かれた日本の放射線レポートからなる外部データセットRR-Findingsを構築しました。この領域シフト設定では、性能差が顕著になり、BERT BaseがJMedRoBERTaとModernBERTの両方を上回りましたが、ModernBERTは正確な一致率が最も大きく低下しました。平均精度の差は小さく、ModernBERTはキャリブレーションが低下しても合理的なランキング能力を保持しました。全体として、ModernBERTは計算効率が高く、ドメイン内での性能が強い一方で、実世界の言語変動に敏感であることが示されました。
方 法:
この研究は、胸部CT所見のマルチラベル分類を目的としたもので、BERT Base、JMedRoBERTa、ModernBERTの3つの日本語モデルを比較しました。CT-RATE-JPNデータセットを用いて、全モデルを同条件でファインチューニングし、内部テストデータセットでの正確な一致率を評価しました。また、外部データセットRR-Findingsを構築し、領域シフト設定での性能を比較しました。
結 果:
ModernBERTは、内部テストデータセットにおいて正確な一致率74.7%を達成し、BERT Baseの72.7%を上回りました。しかし、外部データセットRR-Findingsでは、BERT Baseが他の2モデルを上回り、ModernBERTは正確な一致率が最も大きく低下しました。平均精度の差は小さく、ModernBERTは合理的なランキング能力を保持しました。
結 論:
ModernBERTは計算効率が高く、ドメイン内での性能が強いものの、実世界の言語変動に敏感であることが示されました。多様な自然言語トレーニングデータとドメイン特有のキャリブレーション戦略が必要であることが強調され、異種の臨床環境での現代のトランスフォーマーモデルの展開における堅牢性の向上が求められます。