社会神经科学家经常长时间视频记录互动动物,对这类问题特别感兴趣。尽管大量新工具(如改进的追踪和姿态估计器)帮助研究人员简化了工作,但局限性仍然存在。一个特别的缺陷是:在一个实验室的数据上训练的分类器通常不适用于其他实验室。为了解决这个问题,Kennedy和她的同事组织了一个“多智能体行为挑战”。参赛者将接收来自15个不同实验室的互动小鼠视频的姿态估计,以及记录行为的手工注释。然后,参赛者在这些姿态估计上训练定制算法,并测试它们预测36种行为(包括嗅探、攻击、骑跨、追逐、僵直)的能力。开发出能最准确分类测试数据集中行为的模型的人将获得2万美元现金奖励。本文基于《The Transmitter》的报道,系统解析竞赛的目标、设计及其对领域的意义。
一、问题:行为分类器的跨实验室泛化失败
| 问题 | 描述 |
|---|---|
| 跨实验室不兼容 | 在一个实验室的数据上训练的分类器通常不适用于其他实验室 |
| 猴群暴力例子 | 在泰国Lopburi,敌对猕猴群体争夺稀缺食物;即使对于灵长类动物学家,从视频中判断它们为哪一方而战也很困难 |
| 工具局限性 | 现有方法适用于单只动物,但多动物情况变得非常具有挑战性 |
二、竞赛概述
| 参数 | 描述 |
|---|---|
| 名称 | 多智能体行为挑战 |
| 启动日期 | 2025年9月18日 |
| 数据来源 | 15个不同实验室 |
| 数据类型 | 互动小鼠视频的姿态估计 + 记录行为的手工注释 |
| 要分类的行为 | 36种行为(嗅探、攻击、骑跨、追逐、僵直等) |
| 奖金 | 第一名2万美元;第二至第五名另有奖金 |
| 主办方 | Ann Kennedy(Scripps研究所)等 |
三、竞赛设计
| 阶段 | 描述 |
|---|---|
| 训练 | 参赛者在来自15个实验室的姿态估计和手工注释上训练定制算法 |
| 测试 | 测试模型在新的姿态估计(注释被扣留)上预测36种行为的能力 |
| 核心问题 | “除了学习适用于任意任务的表征之外,你能否学习一个通用的行为表征,对所有不同的实验室特定噪声源保持不变?” |
四、竞赛的价值
| 价值 | 描述 |
|---|---|
| 比较模型 | 在计算机科学领域,这种挑战很常见;如果所有模型都在不同数据集上评估,很难比较和理解模型是否因为不同数据集、更好的架构或更长的训练而工作得更好 |
| 建立基准 | 确定领域的当前状态和哪些问题仍需解决 |
| 揭示趋势 | 例如,2022年竞赛中所有表现最好的模型都使用了变换器(大型语言模型中使用的机器学习工具) |
| 跨领域合作 | 将不同领域的研究人员聚集在一起;计算机科学家可能没有神经科学背景来知道如何识别领域中的问题 |
| 开放资源 | 计划竞赛后免费提供数据和获胜模型供研究人员使用 |
五、以往竞赛
| 年份 | 焦点 |
|---|---|
| 2021 | 基于从单个实验室收集的视频追踪和姿态估计分类小鼠行为 |
| 2022 | 创建多种物种(小鼠、苍蝇、甲虫)行为的表征 |
六、对领域的意义
| 意义 | 描述 |
|---|---|
| 跨实验室通用分类器 | 识别跨实验室工作的分类器将是进步,是朝着对领域有用的方向迈出的一步 |
| 理解社会行为 | 改进可能有助于推进领域对其他物种社会行为的理解 |
| 后续项目 | “一旦数据集被整理和发布,希望它可以用于各种后续项目” |
七、结论:机器学习与神经科学的交叉
多智能体行为挑战代表了机器学习与神经科学交叉的前沿。通过汇集来自15个不同实验室的数据,竞赛旨在开发能够跨实验室泛化的行为分类器,解决社会神经科学中的关键瓶颈。竞赛不仅提供2万美元奖金,还将创建开放数据集和基准模型,推动领域对动物社会行为的理解。
核心信息:
问题:行为分类器通常不能跨实验室泛化。
竞赛:多智能体行为挑战(2万美元奖金)。
数据:15个实验室的互动小鼠视频姿态估计+手工注释。
目标:36种行为(嗅探、攻击、骑跨、追逐、僵直)的分类。
价值:比较模型、建立基准、揭示趋势、跨领域合作、开放资源。
关键问题:能否学习一个通用的行为表征,对所有实验室特定噪声保持不变?
参考来源:
Kennedy, A., Sun, J., et al. (2025). Competition seeks new algorithms to classify social behavior in animals. The Transmitter.