テックブログ

医療AIの品質チェックは、どこまでを見ているのか

目次
  1. 検査には「効く範囲」がある
  2. どの音声まで見られるのかを、実測で出す
  3. 「想定と合うか」ではなく「ありうる範囲か」で見る
  4. 検査を通さなかった回も、記録に残す
  5. プロンプトに書いた禁止事項は、指示であって仕様ではない
  6. 精神科の記録で、この設計が効く理由

AIが作った記録を、機械で検査しています。「音声の長さに対して、本文が短すぎないか」「同じ文が繰り返されていないか」——記録として成立しているかを、人が読む前に確かめるしくみです。

医療の記録では、この検査自体の品質が問われます。検査がどの範囲まで効いているのかを、数字で言えること。 MENTRAではそこまでを実装の一部として扱っています。

検査には「効く範囲」がある

音声の長さに対して本文が短すぎないかを見るには、その音声が何分あるのかを知る必要があります。

長さは2つの方法で分かります。ひとつは録音した画面が測った値、もうひとつはファイルの大きさからの推定です。片方だけを信じると、まれに起きる計測のずれをそのまま受け取ることになるので、2つが噛み合っているときだけ検査する設計にしていました。

ここで効いてくるのが「噛み合っている」の定義です。ファイルの大きさから長さを推定するには、1秒あたり何バイトの音声かという前提が要ります。この前提を1つに固定すると、検査が効く範囲もその前提の周りに限られます。

どの音声まで見られるのかを、実測で出す

そこで、実際に扱う音声のバイト率を測りました。

音声 1秒あたり 想定した前提との比
アプリで録音した音声(実測) 約 3,900 バイト 0.68 倍
録音の設定を上げたあと 約 5,800 バイト 1.02 倍
ICレコーダーの標準的な取り込み 約 16,000 バイト 2.81 倍
非圧縮の音声ファイル 約 176,000 バイト 31 倍

前提との比が 0.5〜2 倍に収まることを条件にしていたので、この条件で見られるのは 22.8〜91.2kbps の帯という計算になります。アプリで録音した音声はここに入りますが、ICレコーダーから取り込んだ音声は、この帯の外側にあります。

数字にして初めて、条件の意味がはっきりしました。

「想定と合うか」ではなく「ありうる範囲か」で見る

条件の書き方を変えました。

想定した1つの前提に合うかで見ると、見られる範囲はその前提の周りに限られます。音声としてありうる範囲かで見ると、扱う音声のほぼ全体が対象になります。

守りたかったのは「録音の長さの申告が、実際と大きく離れている場合」です。これは音声として物理的にありえない値になるので、そこを直接見れば足ります。1秒あたり 2,000〜400,000 バイトという幅で判定するようにしました。下限は毎分の会話として成立する最小のあたり、上限は非圧縮の音声が収まるところです。

この形にすると、アプリの録音もICレコーダーの取り込みも非圧縮のファイルも、同じ検査の対象になります。前提を1つ置くのをやめて、物理的な幅で見るようにしただけで、見られる範囲が広がりました。

検査を通さなかった回も、記録に残す

もうひとつ入れたのが、検査を適用しなかった回を残すことです。

検査が動かなかったとき、記録の上では「異常が見つからなかった」ときと同じに見えます。この2つは意味がまったく違うので、区別できる形にしました。適用しなかった回には理由を添えて残し、あとから「その回は見ていない」と分かるようにしています。

医療の記録では、確かめた範囲を言えることが確かめた結果と同じくらい大事です。「全部を見て問題なかった」と「見た範囲では問題なかった」を混ぜないために、どちらなのかがログに残る形にしています。

プロンプトに書いた禁止事項は、指示であって仕様ではない

検査の話とは別に、出力に出てはいけないものを止める場面があります。

たとえば診察の画面に常に出しておく要約では、病名や診断名、自傷や他害に関わる記述を出さないと決めています。このときまずプロンプトに「書かないこと」として並べますが、プロンプトに書けるのは指示までで、そのとおりに書かれる保証はありません。

そこで、プロンプトとは別の層に禁止語のフィルタを置き、出力を受け取ってから落とす形にしました。実際に要約を作らせたところ、このフィルタが作動したのは全体の約14%でした。禁止語を含む記述を落とすか、作り直させた回です。プロンプトだけに任せていたら、その分はそのまま通っていたことになります。

ただしこの層にも効く範囲があります。止められるのはリストに持っている語だけで、同じ意味の別の言い回しは通ります。語を足していけば近づきますが、言い換えは無限にあるので、列挙だけで閉じることはできません。

だから最後に効くのは、そもそも読ませないことです。禁止したい事柄が書かれている欄を、材料として渡さない。診察の主観と会話の要約・看護の構造化された欄・面談の要約だけに絞ると、そこに書かれていない事柄は原理的に出てきません。

層 止められるもの この層だけでは足りないところ
プロンプトの指示 出力の方向づけ 指示どおりに書かれるとは限らない
出力の禁止語フィルタ リストに持っている語 同じ意味の別の言い回し
読む材料の選択 その欄に書かれた事柄すべて 別の欄に同じ内容が書かれていた場合

上の層ほど安く直せて、下の層ほど確実です。どれか1つに寄せず、3つとも置くのが、いまのところ一番現実的だと考えています。

精神科の記録で、この設計が効く理由

精神科の記録は、録音の入り口が1つではありません。

診察室ではアプリで録音し、訪問看護では持ち出した端末で録り、委員会や事例検討会ではICレコーダーを回してあとから取り込む——同じ施設の中で、録り方の違う音声が並びます。

入り口が増えるほど、「想定した形の音声」を前提にした検査は届きにくくなります。物理的にありうる範囲で見る形にしておくと、どの入り口から入った音声も同じ基準で確かめられます。

MENTRAはSOAP記録・看護記録をはじめ5種類の記録を扱っていて、それぞれ録り方も長さも違います。検査の有効範囲を実測で決めておくことは、種類が増えるほど効いてきます。

「録音の入り口が複数あって、それぞれ品質の見え方が違う」「機械で検査はしているが、どこまで見えているかを説明できない」——そうした状態を整えるところから、一緒に取り組めます。MENTRAは自社のプロダクトで毎日この設計を動かしていて、検査の有効範囲を数字で言える状態を運用の前提にしています。まずは現状をお聞かせいただくところから、ご相談ください。

↑ このページの先頭へ

まずは、30分だけ話を聞かせてください。

今の記録の流れを伺うところからで大丈夫です。資料の準備は不要です。

精神科病院からメンタルクリニックまで、規模を問わず。院内の運用に合わせた調整もご相談ください。