你盘子里的黑匣子:为什么人工智能卡路里追踪器会低估你三分之一的摄入量

数百万人每天打开卡路里跟踪应用程序,拍摄午餐照片,并相信屏幕上显示的数字来指导他们的体重管理决策。它感觉很科学:一张照片、一种算法、精确的卡路里计数。但 2026 年营养大会上提出的新研究表明,这种信心可能是错误的。美国国立卫生研究院研究人员的一项研究发现,四种流行的人工智能卡路里追踪应用程序始终低估标准化膳食的卡路里含量约三分之一,平均每餐误差达到 250 至 345 卡路里。

美国国家糖尿病、消化和肾脏疾病研究所 (NIDDK) 博士后访问研究员 Aaron Hengist 和 NIDDK 学士后研究员 Olivia Charles 于 7 月 26 日在美国营养学会年会上公布了这一研究结果,提出了关于面向消费者的健康人工智能快速扩张领域的令人不安的问题。这些工具几乎完全在医疗设备监管之外运行,其内部工作原理是专有秘密,正如数据显示的那样,它们的错误不是随机噪音,而是系统性扭曲,可能会悄悄破坏依赖它们的人的目标。

该研究是在美国国立卫生研究院临床中心一项更大规模的营养试验中进行的,该试验将低碳水化合物(生酮)饮食与标准饮食模式进行比较。这种设置给了研究人员一个罕见的优势:完全控制盘子上的食物。餐食是在代谢厨房中准备的,这是一个研究级的食品制备设施,每种成分的重量都在 0.1 克以内。每餐的真实热量和常量营养素含量均通过实验室精确了解。随后,102 份此类膳食的照片被提交给四个领先的应用程序:MyFitnessPal、LoseIt!、CalAI 和 Appediet。第二阶段向数据集中添加了 200 多种额外餐食。

所有四个平台的结果都是惊人的。平均而言,这些应用程序低估了膳食的热量含量 250 至 345 卡路里。鉴于研究中的膳食量从中等到大,这代表着比真实值低约 30% 的误差。每餐的脂肪含量被低估了大约 30 克,差距很大。相比之下,碳水化合物的估计值明显更符合地面实况值。

Support independent reporting built on evidence, transparency, and scientific rigor.

Help us grow

不同应用程序或膳食类型的错误模式并不统一,这种不均匀性说明了自己的情况。高脂肪膳食,包括母体 NIH 试验的核心生酮膳食,产生了最大的差异。这些应用程序始终低估了这些膳食的脂肪含量,从而低估了总热量。这不是一个微不足道的极端案例。生酮和其他高脂肪饮食模式越来越受欢迎,许多追随它们的人恰恰是最依赖跟踪工具来保持宏量营养素目标的用户。

应用程序之间也存在有意义的差异。 MyFitnessPal 和 LoseIt!对高热量膳食表现出更好的准确性,这表明某些算法可能在某些范围内表现良好,而在其他范围内则显着降低。与此同时,CalAI 和 Appediet 更一致地全面低估了卡路里计数,无论膳食量或成分如何。

研究人员指出,回想起来,这一切都不足为奇,但事实确实如此。这些应用程序向用户展示自己为测量仪器,而测量仪器应该是准确的。但与浴室秤或血糖监测仪不同,这些工具不作为医疗设备受到美国食品和药物管理局的监管。它们是消费软件产品,不受准确性标准的约束,它们的算法是黑匣子,其训练数据和故障模式不为公众所知,而且通常也不为科学界所知。

这就是消费者人工智能健康工具的黑匣子问题。当用户拍摄一盘鸡蛋、鳄梨和培根的照片时,该应用程序不会像人类营养师那样识别食物。它将视觉特征与标记图像的训练数据集进行匹配,通过摄影测量或启发式估计部分大小,然后将这些估计与营养数据库交叉引用。该管道中的每个步骤都会引入错误。视觉识别可能会混淆外观相似的食物。照片的角度或碗的深度可能会影响份量的估计。营养数据库条目可能对应于食物的通用版本,与盘子上的实际食物几乎没有相似之处。由于这些系统的训练数据是专有的,因此外部研究人员无法审计管道发生故障的位置。

NIH 的调查结果尤其令人担忧的是该错误的系统性。如果应用程序高估卡路里的次数与低估卡路里的次数一样多,那么用户在一周内跟踪自己的摄入量可能会通过平均来接近真相。但持续低估大约 30% 的工具不仅仅是不精确。这是有偏见的。一个人依靠这样的应用程序来维持每天 2,000 卡路里的目标,实际上每天可能消耗 2,600 卡路里,而该工具没有发出任何信号表明出现了问题。在一周内,这种差异相当于超过 4,000 卡路里的未计算卡路里,足以完全抵消许多减肥方案所针对的卡路里赤字。

其影响超出了个人用户的困惑。来自此类应用程序的消费者健康数据越来越多地被纳入研究、电子健康记录甚至临床建议中。如果生成该数据的工具存在如此严重的系统误差,那么基于它们构建的任何分析都会继承这些失真。依靠基于应用程序的饮食回忆数据的公共卫生研究人员可能会得出有关人群饮食模式显着偏差的结论,特别是对于脂肪摄入量和遵循低碳水化合物饮食的人来说。

研究人员谨慎地指出,这是初步的会议演示,尚未经过同行评审。第一阶段的 102 份餐食样本虽然经过严格控制,但还不足以描述每个应用程序版本和平台上的每种边缘情况。第二阶段200多顿加餐将有助于澄清问题的范围和一致性。但无论初步与否,四个主要应用程序共享一致、实质性且有方向性偏差的错误模式的发现是一个危险信号,研究界和公众应该认真对待。

目前,用户的收获不一定是放弃这些工具,而是重新调整他们认为自己得到的东西。人工智能卡路里追踪器不是热量计。这是一种方便的估计,由经过未知数据训练的专有算法生成,在没有监管监督的情况下运行,并且显然容易低估对使用它的人来说最重要的营养素。如果不盲目相信一个可靠地告诉你你的饭量比实际少的黑匣子,体重管理就已经够困难的了。

NIH 团队计划继续分析扩展的数据集,并探索这些应用程序的新版本是否显示出改进。但随着人工智能健康工具市场的加速发展,测试隐含医疗声明的消费产品的负担不应仅仅落在学术研究人员身上。研究提出的问题不是这些应用程序有时会出错。每个测量工具都是。问题是,在将健康数据和饮食决定放入黑匣子之前,公众是否应该知道错误程度、方向和条件。

婷 翻译

Scroll to Top