BIAAROBOTICS & AI
菜单
项目赛事研究关于
全部项目
BIAA / PROJECTS / BABEL
NEXT · 即将开设

BIAA Babel

AI 宠物语言翻译器

结合声音、姿态、表情、活动规律和环境背景,探索宠物情绪与需求识别。系统输出概率、证据和不确定性,不把动物行为包装成人类语言的逐句翻译。

动物行为识别多模态 AI个体基线动物福利
01 / SCIENTIFIC POSITION

不是读心术,
而是多模态行为解释。

单独一声叫声通常不足以判断需求。Babel 计划把声学特征与耳朵、尾巴、身体姿态、活动变化、时间和环境事件共同分析,给出“可能紧张、想互动或存在异常”的分级提示。

项目必须先限定一个物种、一个场景和少量可观察标签。犬与猫、个体与群体、家庭与诊所数据不能直接混用。

项目尚未启动,不能替代兽医诊断,也不会承诺逐句翻译宠物语言。

FIRST SPECIES犬或猫,尚待选择

不同物种必须有独立行为学框架。

FIRST LABELS少量可观察状态

例如休息、互动、回避或异常活动,不直接标注复杂“想法”。

OUTPUT概率 + 证据 + 其他解释

明确模型可能不知道或需要专业评估。

STATUS问题与数据伦理定义

尚无自建数据集或公开模型结果。

02 / MULTIMODAL SYSTEM
01 / AUDIOA

声音模式

叫声频率、时长、节奏、强度和个体声学基线。

02 / VISIONV

姿态与动作

耳尾位置、身体张力、接近回避、步态和活动变化。

03 / CONTEXTC

环境背景

时间、地点、人物、其他动物、声音、喂养与既往事件。

04 / EXPLANATIONE

证据化解释

状态概率、支持信号、冲突证据、其他可能性和行动建议。

03 / OUTPUT, NOT TRANSLATION

系统应该说“可能”,
也应该说“不知道”。

设计重点是帮助照料者观察变化,而不是给宠物配上拟人化台词。

检测事件

发现叫声、姿态或活动相对个体基线发生变化。

收集背景

结合时间、地点、近期喂养、访客和环境刺激。

比较解释

给出多个候选状态,而不是只输出一个确定标签。

展示证据

说明哪些声音、动作和背景支持或反对判断。

建议下一步

观察、提供选择、远离刺激或在异常持续时联系专业人员。

04 / DATA PRINCIPLES

高质量标签,
不能靠人为制造痛苦。

动物状态标签需要行为学定义、多人一致性和场景记录。采集过程不得为了获得“害怕、疼痛、攻击”等数据而诱发伤害。

OBSERVABLE

标注可观察行为

优先记录动作和环境事件,谨慎推断主观情绪。

INDIVIDUAL

建立个体基线

同一信号在不同品种、年龄、经历和健康状态下含义可能不同。

WELFARE

不诱发高风险状态

使用自然发生、专业监督和最低干预的数据采集方式。

PRIVACY

同时保护家庭隐私

宠物音视频也会包含家庭成员、位置和日常活动。

05 / STARTUP ROADMAP
PHASE 00当前

物种与标签定义

与兽医、行为学和真实照料者共同选择少量可观察状态。

PHASE 01条件启动

小型多模态数据集

采集自愿、自然发生并有背景记录的声音和视频。

PHASE 02规划

个体基线模型

比较通用模型与个体适应,保留不确定性校准。

PHASE 03规划

照料者观察研究

测试输出是否帮助观察,而不是增加误解或延误就医。

06 / VALIDATION METRICS
LABEL QUALITY

标注一致性

不同专业人员对可观察行为与场景标签的一致程度。

待建立基线
GENERALIZATION

跨个体表现

品种、年龄、家庭和设备变化下的性能下降。

待建立基线
CALIBRATION

概率校准

输出 70% 时是否在相似条件下接近真实发生频率。

待建立基线
UNCERTAINTY

拒绝判断能力

证据不足、冲突或超出训练分布时能否明确不确定。

待建立基线
HUMAN FACTOR

照料者理解

用户能否正确解释概率、证据和行动建议。

待建立基线
WELFARE

动物福利影响

采集和使用是否增加压力、错误互动或延误专业处理。

待建立基线
07 / ETHICAL BOUNDARIES
VETERINARY

不替代兽医

异常、疼痛或持续行为变化应由专业人员评估。

ANTHROPOMORPHISM

避免拟人化确定结论

“它在生气”必须拆成可观察信号、概率和其他解释。

BIAS

数据偏差

单一品种、家庭或设备数据不能代表所有宠物。

MISUSE

避免用于惩罚或强迫

系统不应成为为人类偏好强制纠正动物正常行为的工具。

宠物真的有可以逐句翻译的“语言”吗?

动物会通过声音、姿态、气味和行为交流,但目前不能把这些可靠地逐句映射成人类语言。Babel 更准确的方向是情境化行为识别。

只录声音可以判断情绪吗?

通常不足。声音需要与姿态、活动、个体基线和环境事件结合。

为什么要显示多个可能解释?

相同叫声或回避行为可能来自陌生人、疼痛、兴奋、疲劳等不同原因。展示备选解释能减少错误确定性。

理解信号。
尊重不确定性。

返回项目总览 →