准备更换模型或执行框架?Lab 帮助您用自己的工作案例衡量差异。在可比的上下文中比较模型与机制配置,再实际验证所选引擎的表现。这些评估不能替代对工具和外部效果的完整试用。选择模型与执行框架。
分别检查十一种机制
| 类别 | 机制 |
|---|---|
| 工作准备 | Dispatcher、Briefing、Planner |
| 整理与学习 | 主题检测、记忆提取、学习 |
| 跟进 | Goal 跟进 |
| 执行 | 任务、对话与语音执行器 |
| 诊断 | 任务分析 |
事件日志是独立界面。Briefing 仍可测试并查阅历史,但出现在 Lab 中不代表每个当前流程都使用它。
围绕具体问题建立测试集
按机制创建案例,包含测试变量、上下文和预期结果。可以收录带来源的任务、对话轮次或语音轮次。导入前可查看源配置与测试集参数的差异。
区分工作集、验证集和保留集。案例类别包括常规、歧义、上下文不完整、多语言、稳健性、真实事件或其他有效答案。不完整案例仍为草稿;模型提出的参考答案需要复核。
先执行,再评判
候选模型与评判模型分别选择。启动时固定案例、参数和模型。第一轮产出结果和客观检查,第二轮评判;候选模型不会收到预期答案。
各维度评分、理由、关键失败和未评分案例可以查看。活动结束不等于全部成功;评判模型失败时评分保持缺失。
测量稳定性并恢复评估
每个条目可重复 1 至 20 次,比较成功率、均值、极值和离散情况。取消时保留已发布结果;可按原快照继续剩余案例,也可直接重新评判已有输出,无需再次调用候选模型。
可选预算用于接纳候选和评判的新阶段。重复测试只衡量这些案例上的稳定性,不代表所有未来情况。
加入独立人工评审
评审可隐藏模型身份与自动评分。每人先打分并说明理由,再揭示自动判断,便于查看分歧。已揭示的评审固定保存;重新评判创建新的活动。
把问题变成检查案例
结合人工上下文分析任务档案,无需重新执行任务。也可收录诊断,评估分析机制本身。
模拟工具不会证明真实外部效果。语音 Lab 评估转写文本,不测量 STT/TTS 声学质量。事件跟踪 为评估提供补充。
评估实际允许的选择
Dispatcher Lab 检查框架允许的模式,并保留确定性决策及其理由。Briefing 可在这里测试,但当前任务策略仍禁用它。Lab 的十一项评估机制与 Dream 的十二项后台机制是不同目录。


