可直接试用的资料
Atelier Horizon 是虚构组织。资料包提供输入和人工参考答案,并非 Galaris 已执行过的演示结果。
下载完整测试资料包 ↓提供来源,暂时保留更正
使用一个智能体、一个模型和两份初始笔记,将资料包中的 @task 说明复制到 Chat。暂不提供 S3 和人工参考。
| 来源 | 信息 |
|---|---|
| S1 · 团队 | 9 月 12 日星期六;两名技术人员;最多六台设备 |
| S2 · 场地 | 仅 9 月 13 日星期日可用;雨天备用方案未确认 |
| S3 · 稍后提供的人工决定 | 确认星期日;雨天方案仍待定 |
首次结果在对话中交付。持久文件需要获准文档或文件工具。
观察矛盾如何处理
智能体应引用两份笔记,保留日期待定,不能编造预订或协议。审阅首次结果后再提供 S3,检查日期是否更新,同时雨天决定仍未被擅自解决。
与可读参考比较
S3 之后:9 月 13 日星期日 9 点至 12 点 [S3];两名技术人员、最多六台设备 [S1, S3];带电源的场地 [S2]。雨天备用方案 [S2, S3]、预算与价格 [S1] 仍待决定。正式宣布开放前先处理雨天方案。
表达可以不同,验收关注事实来源、不确定性保留和未执行外部操作。
增加复杂度之前先测量
记录版本、模型、执行框架、权限、耗时、修正及可用用量。任务说明不会自动配置权限。验收后再增加第二个智能体,并通过获准委派工具检查贡献返回。
验收结果后再扩展
接下来可以生成可导出文档、将资料连接到主题,或请求委派贡献。每次只改变一个维度,才能判断改善来自哪里。
将试验扩展到自己的文档
第二次试验可在有权访问的长文档中搜索具体段落,再打开引用和修订版本。已获取的附件描述可补充检索。始终区分原文与摘要,结果排名本身不能验证结论。
