对于人类来说,判断一个人是不是疼痛,往往并不困难。皱眉、闭眼、咬紧牙关,甚至一个下意识的动作,都可能暴露身体的不适。
但如果把这种判断对象换成马,事情就复杂得多。
马是一种非常善于隐藏痛苦的动物。作为长期处于被捕食风险中的猎物动物,它们在漫长的进化过程中形成了隐藏虚弱和疼痛的本能。即使身体已经出现明显不适,马也未必会像人一样表现得十分明显。这种特性也让兽医在判断马匹疼痛程度时,需要依靠大量经验去观察一些非常细微的面部变化。
如今,人工智能正在尝试接手这项工作。
来自特拉海学术学院等机构的研究人员开发了一套名为SHIC-XE的人工智能可解释性框架,希望让AI不仅能够判断一匹马是否正在经历疼痛,还能够进一步回答一个更关键的问题:AI究竟是“看到了”马脸上的什么变化,才做出了这样的判断?
研究结果颇有意思。AI与兽医专家在马的耳朵位置和脸颊肌肉变化方面出现了一定程度的判断一致,但在眼睛这一重要区域,两者却出现了明显的反向关系。
也就是说,AI确实在某些方面“看对了”,但它关注马脸的方式,并没有完全按照人类兽医的经验来进行。
这项研究之所以受到关注,并不只是因为AI能够识别动物疼痛,更重要的是,它尝试解决人工智能领域一个长期存在的问题——我们到底应该怎样相信AI?
过去,一套AI系统即便能够较准确地区分“疼痛”和“不疼痛”,研究人员仍然很难确定它为什么会得出这样的结果。
例如,一段马匹视频中,AI生成的热力图可能显示它特别关注鼻子附近,也可能下一帧突然转移到背景区域。由于马匹在视频中不断移动,AI每一帧所关注的位置也可能发生变化。最终得到的热力图看起来五花八门,却很难判断这些关注点到底有没有实际意义。
对于兽医而言,这显然是一个问题。
如果AI只是告诉医生“这匹马可能很疼”,却无法解释自己究竟依据了什么,那么即使识别准确率不错,在真正需要辅助诊断的场景中,医生也很难完全信任它。
SHIC-XE的思路,就是试图让这种“AI注意力”变得更加稳定。
研究人员建立了一个固定的马匹三维面部模型,然后把视频画面中的二维信息映射到这个三维模型上。这样一来,无论马的脑袋转向哪个方向,AI在不同视频帧中关注的区域,都能够对应到同一个真实的面部位置。
简单来说,如果AI连续几帧都在关注马的鼻梁,那么这些信息可以被累积到三维模型中的同一个位置,而不会因为马匹头部移动导致不同帧之间的信息彼此分散。
这种处理方式看似只是技术上的改进,却为研究人员提供了一个重要机会:他们终于可以更加系统地比较AI关注的区域,与专业兽医真正用于判断疼痛的区域是否一致。
研究人员随后使用了三组不同的数据进行测试,覆盖了不同类型的马匹疼痛。
第一组数据来自39匹接受常规去势手术的马匹,研究人员通过手术前后的影像观察疼痛变化;第二组涉及6匹出现实验性关节炎症的马匹;第三组则包含11匹马,通过对上唇施加刺激来产生急性疼痛反应。
为了尽可能避免AI只是“记住”某一匹马的外貌,研究采用了留一受试对象测试的方法,也就是让模型始终面对训练过程中没有见过的马匹。
在三组数据中,模型的视频级表现分别达到0.67、0.80和0.70。研究人员认为,这一结果与此前相关马匹疼痛识别方法处于相近水平,同时SHIC-XE不需要为马脸上的每一个区域分别训练独立的分类器。
真正值得注意的发现,则出现在AI与兽医专家的比较上。
兽医在评估马匹疼痛时,通常会参考“马匹痛苦表情量表”,也就是Horse Grimace Scale。这套方法主要观察马脸上的多个细节,包括耳朵的位置、眼睛周围的紧张程度、眼睛是否收紧、脸颊肌肉是否紧张、下巴区域的变化,以及鼻孔周围的变化。
研究人员选取了第一组数据中的114张经过兽医专家评分的图像,然后比较AI的注意力区域与专家评分之间的关系。
结果显示,在耳朵区域,AI和专家的判断存在比较明显的正相关。
这意味着,当兽医认为马匹耳朵的位置表现出了较强的疼痛信号时,AI也更倾向于把注意力放在这一位置。
脸颊肌肉区域也出现了类似趋势,不过相关程度相对较弱。
这两个结果让研究人员看到了一个积极信号:AI并非完全依靠一些无法解释的视觉特征进行判断,它确实在一定程度上捕捉到了兽医长期以来用于判断马匹疼痛的面部线索。
然而,当研究人员把目光转向眼睛时,情况突然发生了变化。
眼睛区域出现了具有统计学意义的负相关。
换句话说,当兽医专家认为眼睛周围存在比较明显的疼痛表现时,AI反而没有表现出相应的关注,甚至呈现出相反的趋势。
这也是整项研究中最令人意外的部分之一。
毕竟,在人类观察动物疼痛表情时,眼睛通常是非常直观的观察区域。眼睛是否收紧、周围肌肉是否紧张,都是兽医判断马匹状态的重要依据。
那么,AI为什么没有按照专家的方式观察?
目前研究人员并没有给出一个确定答案。
一种可能性是,AI实际上发现了某些人类并不容易注意到的细微变化。深度学习模型能够从大量图像中寻找复杂的像素和纹理关系,因此它可能会捕捉到人眼难以稳定识别的面部组织变化。
研究中就发现,AI除了关注兽医评分体系中的区域之外,还对额头和鼻梁等部位表现出了明显关注。
这意味着,AI关注的区域并不完全等于人类专家所使用的传统疼痛指标。
当然,这并不能直接证明AI已经发现了新的疼痛标志。
另一种可能同样不能排除:AI注意到的这些区域可能只是某些与疼痛没有直接关系的视觉特征。
这也是为什么研究人员强调,不能因为一张AI热力图“看起来很合理”,就认为AI真的理解了问题。
在人工智能研究中,这其实是一个非常重要的问题。
很多时候,人们看到一张色彩鲜明的AI注意力热力图,会自然认为模型正在关注正确的位置。但“看起来合理”和“经过科学验证”完全是两回事。
SHIC-XE的意义,就在于它试图把这种主观判断变成可以量化和检验的指标。
研究人员不再满足于展示一张漂亮的热力图,而是进一步问:AI关注的区域,是否真的与专业人士判断疼痛时使用的信息存在统计上的联系?
这种思路也可能影响未来的动物健康AI研究。
如果一套系统只能给出最终结果,却无法说明依据,那么它更像一个黑箱。相反,如果AI能够明确展示自己关注了哪些解剖区域,并且这些区域与兽医经验之间存在稳定联系,医生就更容易理解和评估它的判断。
不过,这项研究距离真正应用于临床还有相当长的距离。
研究人员自己也强调,目前的结果属于初步验证,并不能说明这套系统已经可以直接用于兽医临床诊断。
其中一个非常明显的问题,就是数据规模仍然有限。三组数据分别只有39匹、6匹和11匹马,尤其是关节炎症数据只有6匹动物,这样的样本数量显然不足以代表所有马匹。
不同品种之间的头部结构也可能影响AI判断。
目前系统使用的是一个统一的标准三维马匹模型,而阿拉伯马、重型马等不同品种之间,在头部形状和面部结构方面存在差异。如果实际马匹与标准三维模型之间存在较大区别,二维画面与三维模型的对应关系就可能出现误差。
此外,当马匹的脸部被遮挡,或者头部处于非常极端的角度时,三维映射同样可能受到影响。
还有一个值得注意的问题是,研究主要通过平均方式整合视频中的注意力信息。这样能够提高空间上的稳定性,却可能牺牲一些时间上的细节。
比如,马匹可能只在某一个瞬间出现非常短暂的面部变化。如果把整个视频中的信息平均到一起,这种持续时间很短的“微表情”可能就会被削弱甚至消失。
因此,AI究竟能不能真正理解马匹疼痛,还需要更多、更大规模的数据进行验证。
尽管如此,这项研究依然提供了一个值得关注的方向。
过去,人们更关心的是“AI能不能识别疼痛”;现在,研究人员开始进一步追问“AI为什么认为马正在疼痛”。
这两个问题看似接近,实际上存在明显区别。
前者考察的是AI的准确率,后者考察的则是AI判断过程是否可信。
而在动物医疗领域,这一点尤其重要。马无法用语言告诉人类“这里疼”“那里不舒服”,很多时候只能通过细微的行为和面部变化传递信号。如果AI能够持续观察这些变化,并且帮助兽医发现肉眼容易遗漏的异常,那么它未来或许能够成为传统观察方法的重要辅助工具。
更有意思的是,SHIC-XE的技术思路并不一定只能用于马匹。
研究人员认为,将二维视频中的信息稳定映射到三维结构模型上的方法,也可以应用到其他需要观察空间位置的领域,例如人类医学影像以及工业质量检测等场景。
从这个角度来看,这项研究真正的价值或许并不只是让AI“看懂马脸”。
它更像是在尝试建立一座桥梁,把人工智能的视觉判断与专业人士能够理解、验证的现实结构连接起来。
AI可以发现人类没有注意到的模式,但人类仍然需要知道这些模式到底意味着什么。
至少目前来看,AI与兽医专家已经在马匹耳朵和脸颊等区域表现出了一定程度的共识,而眼睛区域的分歧则提醒我们:机器看到的世界,并不一定与人类完全相同。
这种差异究竟意味着AI发现了新的疼痛信号,还是模型出现了某种偏差,仍然需要未来研究给出答案。
而这或许正是人工智能进入动物医疗领域后最值得关注的一件事——真正可靠的AI,不应该只是告诉我们“答案是什么”,还应该逐渐让我们知道,它为什么会得到这个答案。
对于那些无法直接告诉人类自己正在经历什么的动物来说,如果未来AI能够把这些难以察觉的细微变化转化为更清晰、更稳定的健康信号,那么技术与动物医疗之间的结合,也许会打开一个全新的应用空间。
目前,这项研究还只是起点,但它至少证明了一件事:当人工智能开始尝试理解动物的表情时,真正困难的已经不只是“看见”,而是如何证明自己看见的东西确实有意义。
原文:https://studyfinds.com/ai-reads-pain-on-horses-face-with-one-surprising-blind-spot/