EVALUATION REPORT
模型评测报告
从综合指标、场景表现和失败案例解释模型差异,并追溯训练数据版本。
核心指标
与上一版本及生产基线对比
任务成功率
94.6+3.8
抓取稳定性
92.1+2.4
泛化能力
89.8+5.2
动作效率
93.4+1.8
异常恢复
86.2+6.4
v7.3v7.2
能力雷达
六维评测结果
成功率稳定性泛化效率恢复安全性
分场景表现
成功率与样本覆盖
自然光厨房12,840 样本
暖光厨房9,860 样本
逆光场景6,420 样本
透明容器8,240 样本
遮挡目标5,180 样本
数据与模型血缘
评测结果可追溯到每个数据版本
1
原始数据28 名采集员 · 32 台设备
842,680 条可追溯记录
2
加工流程厨房操作数据清洗 v3
Pipeline Run #8912
3
训练数据集厨房灵巧操作数据集 v3.2
DS-KITCHEN-03
4
训练任务TRAIN-0878
H100 × 8 · 3h 08m
5
模型评测EVAL-GRASP-07
Grasp-Bench 2026.2
典型失败案例
高价值错误模式与改进建议
逆光透明杯抓取失败
原因:反光导致深度缺失
建议补充逆光透明材质数据置信度68%
遮挡场景误判容器边界
原因:目标可见区域低于 35%
增加重遮挡标注样本置信度74%
湿滑表面抓取滑落
原因:触觉反馈延迟 48ms
优化动作策略与传感同步置信度82%