Galaris

Lab:用实际工作案例比较

收录真实情况、比较候选模型,并通过人工评审核对评分。每次评估活动保留上下文与结果。

准备更换模型或执行框架?Lab 帮助您用自己的工作案例衡量差异。在可比的上下文中比较模型与机制配置,再实际验证所选引擎的表现。这些评估不能替代对工具和外部效果的完整试用。选择模型与执行框架。

分别检查十一种机制

类别 机制
工作准备 Dispatcher、Briefing、Planner
整理与学习 主题检测、记忆提取、学习
跟进 Goal 跟进
执行 任务、对话与语音执行器
诊断 任务分析

事件日志是独立界面。Briefing 仍可测试并查阅历史,但出现在 Lab 中不代表每个当前流程都使用它。

实验室机制 — 调度器、规划器、记忆和执行器的测试入口。
实验室机制 — 调度器、规划器、记忆和执行器的测试入口。C43

围绕具体问题建立测试集

按机制创建案例,包含测试变量、上下文和预期结果。可以收录带来源的任务、对话轮次或语音轮次。导入前可查看源配置与测试集参数的差异。

区分工作集、验证集和保留集。案例类别包括常规、歧义、上下文不完整、多语言、稳健性、真实事件或其他有效答案。不完整案例仍为草稿;模型提出的参考答案需要复核。

先执行,再评判

候选模型与评判模型分别选择。启动时固定案例、参数和模型。第一轮产出结果和客观检查,第二轮评判;候选模型不会收到预期答案。

各维度评分、理由、关键失败和未评分案例可以查看。活动结束不等于全部成功;评判模型失败时评分保持缺失。

测量稳定性并恢复评估

每个条目可重复 1 至 20 次,比较成功率、均值、极值和离散情况。取消时保留已发布结果;可按原快照继续剩余案例,也可直接重新评判已有输出,无需再次调用候选模型。

可选预算用于接纳候选和评判的新阶段。重复测试只衡量这些案例上的稳定性,不代表所有未来情况。

加入独立人工评审

评审可隐藏模型身份与自动评分。每人先打分并说明理由,再揭示自动判断,便于查看分歧。已揭示的评审固定保存;重新评判创建新的活动。

实验室人工评审 — 对保存的输出进行盲审;尚未提交评审意见。
实验室人工评审 — 对保存的输出进行盲审;尚未提交评审意见。C52

把问题变成检查案例

结合人工上下文分析任务档案,无需重新执行任务。也可收录诊断,评估分析机制本身。

模拟工具不会证明真实外部效果。语音 Lab 评估转写文本,不测量 STT/TTS 声学质量。事件跟踪 为评估提供补充。

评估实际允许的选择

Dispatcher Lab 检查框架允许的模式,并保留确定性决策及其理由。Briefing 可在这里测试,但当前任务策略仍禁用它。Lab 的十一项评估机制与 Dream 的十二项后台机制是不同目录。