あなたの皿の上のブラックボックス: AI カロリートラッカーがあなたの摂取量を 3 分の 1 も過小評価する理由

何百万人もの人が毎日カロリー追跡アプリを開き、昼食の写真を撮り、画面に表示される数値を信頼して体重管理を決定しています。写真、アルゴリズム、正確なカロリー計算など、科学的だと感じます。しかし、NUTRITION 2026カンファレンスで発表された新しい研究は、自信が見当違いである可能性を示唆しています。国立衛生研究所の研究者らの研究によると、4つの人気のあるAIを活用したカロリー追跡アプリは、標準化された食事のカロリー量を一貫して約3分の1過小評価しており、誤差は平均して1食あたり250~345カロリーに達していることが判明した。

7月26日に米国栄養学会の年次総会で、国立糖尿病・消化器・腎臓病研究所(NIDDK)の博士研究員アーロン・ヘンジスト氏とNIDDKの学士課程修了研究員オリビア・チャールズ氏によって発表されたこの研究結果は、消費者向けの健康AIの急速に拡大する世界について不快な疑問を投げかけている。これらのツールはほぼ完全に医療機器規制の範囲外で動作し、その内部動作は企業秘密であり、データが示すように、そのエラーはランダムなノイズではなく、それらに依存しているまさに人々の目標を静かに妨害する可能性のある組織的な歪みです。

この研究は、低炭水化物(ケトジェニック)食と標準的な食事パターンを比較する大規模なNIH臨床センター栄養試験の中で実施されました。この設定により、研究者らはプレート上に何を入れるかを完全に制御できるというまれな利点を得ることができました。食事は、すべての材料が 0.1 グラム以内に計量される研究グレードの食品調理施設であるメタボリック キッチンで調理されました。各食事の本当のカロリーと主要栄養素の含有量は、実験室の精度で判明しました。その後、そのような食事 102 個の写真が、MyFitnessPal、LoseIt!、CalAI、Appediet の 4 つの主要なアプリに送信されました。第 2 フェーズでは、200 を超える追加の食事がデータセットに追加されました。

結果は 4 つのプラットフォームすべてで顕著でした。平均して、アプリは食事のカロリー量を 250 ~ 345 カロリー過小評価していました。研究での食事の量が中量から大量までの範囲であることを考慮すると、これは真の値より約 30% 低い誤差を表します。脂肪含有量は 1 食あたり約 30 グラム過小評価されており、大きな差がありました。対照的に、炭水化物の推定値は、グラウンドトゥルース値と著しく一致していました。

Quality journalism takes time and resources. Your support helps us focus on accuracy instead of advertising.

Become a supporter

エラーのパターンはアプリや食事の種類によって均一ではなく、その不均一性が独自の物語を物語っています。親NIH試験の中心となるケトジェニック食事を含む高脂肪食は、最も大きな差異を生み出した。アプリは一貫してこれらの食事の脂肪分を過小評価し、その結果総カロリーを過小評価していました。これは些細な例外的なケースではありません。ケトジェニックやその他の高脂肪の食事パターンの人気が急上昇しており、それらを実践している人の多くは、まさに主要栄養素の目標値内にとどまるために追跡ツールに最も依存しているユーザーです。

アプリ間にも大きな違いがありました。 MyFitnessPal と LoseIt!は、高カロリーの食事の方が精度が高いことを示しており、一部のアルゴリズムは特定の範囲内では十分に機能するが、他のアルゴリズムでは大幅に低下する可能性があることを示唆しています。一方、CalAIとAppedietは、食事の量や構成に関係なく、全体的に一貫してカロリー数を過小評価していた。

振り返ってみれば、これは驚くべきことではありませんが、それでも驚くべきことである、と研究者らは指摘しています。アプリはユーザーに対して自らを測定器として提示し、測定器は正確であることが求められます。ただし、体重計や血糖値モニターとは異なり、これらのツールは食品医薬品局によって医療機器として規制されていません。これらは消費者向けソフトウェア製品であり、精度の基準はなく、そのアルゴリズムはブラック ボックスであり、そのトレーニング データと障害モードは一般に知られておらず、多くの場合科学界にも知られていません。

これは、消費者向け AI 健康ツールのブラックボックス問題です。ユーザーが卵、アボカド、ベーコンの皿を写真に撮っても、アプリは人間の栄養士のように食べ物を認識しません。視覚的特徴をラベル付き画像のトレーニング データセットと照合し、写真測量またはヒューリスティックによって部分サイズを推定し、それらの推定値を栄養素データベースと相互参照します。そのパイプラインの各ステップでエラーが発生します。視覚的な認識により、見た目が似ている食べ物が混同される可能性があります。分量の目安は、写真の角度やボウルの深さによって異なる場合があります。栄養素データベースのエントリは、実際にお皿に載っているものとはほとんど似ていない、食品の一般的なバージョンに対応している可能性があります。また、これらのシステムのトレーニング データは独自のものであるため、外部の研究者はパイプラインがどこで故障したかを監査できません。

NIH の調査結果で特に懸念されるのは、エラーの系統的な性質です。アプリがカロリーを過小評価するのと同じくらい頻繁にカロリーを過大評価する場合、ユーザーが 1 週間にわたって摂取量を追跡すると、平均化によって真実に近づく可能性があります。しかし、一貫して約 30% 過小評価するツールは、単に不正確であるだけではありません。それは偏見です。 1 日あたり 2,000 カロリーの目標を維持するためにこのようなアプリに依存している人は、ツールから何か問題があるという信号がなくても、実際には毎日 2,600 カロリーを消費している可能性があります。 1 週間で、この不一致は 4,000 カロリー以上に達し、多くの減量計画で目標とされているカロリー不足を完全に相殺するのに十分です。

その影響は、個々のユーザーの混乱を超えて広がります。このようなアプリから得られる消費者の健康データは、研究調査、電子健康記録、さらには臨床上の推奨事項にまで取り入れられることが増えています。そのデータを生成するツールにこの規模の系統誤差が含まれている場合、その上に構築された分析にはそれらの歪みが引き継がれます。アプリベースの食事想起データに依存している公衆衛生研究者らは、集団レベルの食事パターン、特に脂肪摂取量や低炭水化物ダイエットを行っている人々の食生活が著しく偏っているという結論を導き出している可能性がある。

研究者らは、これが予備的な学会発表であり、まだ査読を受けていないことに注意している。第 1 フェーズの 102 食のサンプルは慎重に管理されていますが、すべてのアプリのバージョンとプラットフォームにわたるすべてのエッジケースを特徴付けるには十分な量ではありません。 200食以上の追加食事の第2段階は、問題の範囲と一貫性を明確にするのに役立つだろう。しかし、予備的であろうがなかろうが、4 つの主要なアプリが一貫して実質的で方向性の偏ったエラー パターンを共有しているという発見は、研究コミュニティと一般の人々が真剣に受け止めるべき危険信号です。

現時点では、ユーザーにとって重要なのは、必ずしもこれらのツールを放棄することではなく、得られると考えているものを再調整することです。 AI カロリー トラッカーはカロリー計ではありません。これは、未知のデータに基づいて訓練された独自のアルゴリズムによって生成された便利な推定値であり、規制の監視を受けずに動作し、明らかにそれを使用する人々にとって最も重要な栄養素そのものを過小評価する傾向があります。食事の量が実際よりも少なかったことを確実に伝えるブラックボックスを盲目的に信頼しない限り、体重管理は十分に困難です。

NIH チームは、拡張されたデータセットの分析を継続し、これらのアプリの新しいバージョンで改善が見られるかどうかを調査する予定です。しかし、AI 健康ツールの市場が加速する中、暗黙の医学的主張を行う消費者向け製品のテストの負担を学術研究者だけに負わせるべきではありません。この研究で明らかになった問題は、これらのアプリが時々間違っているのかということではありません。どの測定ツールもそうです。問題は、国民が自分たちの健康データや食事の決定をブラックボックスに入れる前に、どのような方向に、どのような状況で間違っているのかを知る資格があるかどうかだ。

雅子 訳

Scroll to Top