テックブログ
医療AIのモデルを載せ替えるとき、何を測れば安全か
AIモデルは頻繁に新しくなります。同じ仕事をより速く、より安く処理できるモデルが出れば、載せ替えたくなります。
ところが医療の記録では、速くなったかどうかより、精度が落ちていないかのほうが重要です。そして精度の劣化は、目で見ただけでは分かりません。 同じ音声を新旧の両方に通して比べる検証が要ります。
「なんとなく悪くなった気がする」では判断できない
音声から記録を作る処理でモデルを載せ替えると、出来上がる文章は変わります。ただし、劇的に壊れるわけではありません。多くの場合、もっともらしい文章のまま、細部が違うという形で現れます。
精神科の記録でこれが起きると、薬剤名が近い別の言葉になったり、制度の名称が日常語に引き寄せられたりします。読める文章なので、読み流すと気づきません。
だから「体感」で判断してはいけません。載せ替えの可否は、数えられる形で測る必要があります。
何を数えるか
MENTRAでモデルの載せ替えを検討したときに測ったのは、次の観点です。
- 誤字の件数 — 同じ音声を新旧のモデルに通し、確定後の記録との差分を数える
- どの種類の誤りか — 薬剤名・制度用語・人名・数値のどこで起きているか
- 処理時間 — 何秒縮むのか
- 打ち切りの有無 — 出力が途中で止まっていないか
このうち決め手になるのは1つ目と2つ目です。全体の誤字が少し増えるのは許容できても、薬剤名で増えるなら載せ替えないという判断ができます。誤りの総数だけを見ていると、この区別がつきません。
実際に測って、戻した
MENTRAでは実際に、より軽量なモデルへ載せ替えたことがあります。処理は速くなりました。
ところが同じ条件で誤字を数えたところ、誤字が4.2倍に増えていました。 体感では気づけない範囲でしたが、数えれば明らかでした。
このときは、精度側に戻す判断をしました。あわせて、精神科領域の用語辞書を増強し、生成の条件を調整しています。速度は別の方法で取り返せますが、記録の正確さは他の方法で取り返せないからです。
速さは、別のところから取れる
実際、その後に処理時間を短くしたのは、モデルを軽くする方法ではありませんでした。
- 文字起こしと話し手の切り分けをひとつの処理にまとめた
- 録音が終わった時点ですぐ処理を始めるようにした
構造を変えるほうが、モデルを落とすより効きました。現在、診察が終わってからカルテの下書きができるまでの中央値は16秒です(本番実測。9割は45秒以内)。
「速くしたい」の答えが「モデルを軽くする」とは限りません。 ここを先に確かめないと、精度を差し出して速度を買うことになります。
モデル移行を判断するときの手順
いまMENTRAでは、モデルの載せ替えを次の順で判断しています。
- 同じ音声を新旧の両方に通す。 別の音声で比べると、差がモデルのせいか音声のせいか分からない
- 確定後の記録との差分を、種類ごとに数える。 全体の件数だけを見ない
- 段階的に適用する。 すべての記録種別に一斉に入れず、影響の小さいところから
- 戻せるようにしておく。 戻す手順を先に用意してから適用する
4つ目は当たり前のようで、抜けやすいところです。適用の手順だけ用意して、戻す手順を用意しないまま本番に入れるということが起こります。
医療で使うAIは、更新の方針まで含めて製品
AIモデルは今後も新しくなり続けます。だから「いまどのモデルを使っているか」より、どういう基準で載せ替えるかのほうが、長く使ううえでは重要です。
MENTRAでは、記録の種別ごとに別の処理を持たせているので、一斉に載せ替えずに済む構造になっています。診察の記録と看護記録で違う判断ができます。
AIカルテ・診療記録に仕組みをまとめています。AIの更新方針について院内で説明が必要な場面がありましたら、そのまま使える形でご説明しますのでお気軽にご相談ください。
