# Atelier Horizon — 测试资料包
编辑版本：2026-09-05 · 语言：简体中文

所有数据均为虚构。本资料包用于测试 Galaris。以下参考结果由人工编写，并非智能体输出或已经执行的演示。

## 准备
需要一个 Galaris 实例、可访问的模型和一个智能体。选择内置执行框架，明确请求创建持久任务，并授权回复及交付结果所需的原生工具。本次文档测试无需浏览器、外部消息渠道或 n8n。不要连接真实数据。

## 1. 只发送任务说明和 S1/S2
第一轮不要发送更正 S3 或参考答案。将下面的内容复制到与智能体的聊天中：

```text
@task 仅根据 S1 和 S2，为 Atelier Horizon 编写试点启动方案。
在对话中返回：摘要、带 [S1]/[S2] 引用的事实、矛盾、待决问题和下一项决定。
不要编造已确认的日期、预订、支出或业务成果。
如果来源互相矛盾，请指出并向我请求决定。
不执行外部操作，不联系任何人，不购买任何物品。

[S1] 团队记录 — 2026 年 9 月 1 日
项目：流动维修工作坊。拟定时间：2026 年 9 月 12 日周六，9:00–12:00。
两名技术人员在这一场次最多能处理六台设备。
场地仍待确认，预算和收费均未获批准。

[S2] 场地方记录 — 2026 年 9 月 2 日
广场可用时间为 2026 年 9 月 13 日周日，9:00–12:00，有电源插座。
雨天的有顶棚备用场地尚未确认。
9 月 12 日周六无法使用。
```

## 2. 先观察，再更正
打开已创建的任务，核对目标、智能体、状态与结果。模型应指出周六和周日的冲突，不能自行编造双方已达成一致。结果可以是带有待决问题的草稿；显示结果不等于人工批准。

如果没有出现持久任务，请检查 @task 指令、模型、执行框架和权限。不要为了继续测试而开放全部工具。

## 3. 提供人工更正 S3
检查首次结果后，发送：

```text
[S3] 协调人决定 — 2026 年 9 月 5 日
我确认使用 9 月 13 日周日 9:00–12:00 的时间，最多处理六台设备。
此决定替代 S1 中拟定的日期。雨天备用方案仍需决定。
请更新方案，使用 [S3] 引用日期，并保留未解决的问题。
```

## 4. 人工参考结果
标题：Atelier Horizon — 试点启动。
S3 之前：日期未确认；S1 提出周六，S2 只允许周日。
S3 之后：2026 年 9 月 13 日周日，9:00–12:00 [S3]。
接待能力：两名技术人员，最多六台设备 [S1, S3]。
地点：带电源插座的广场 [S2]。
待决：雨天备用方案 [S2, S3]；预算与收费 [S1]。
下一项人工行动：决定雨天安排，再对外确认活动。
预期结果：没有执行预订、支出或外部联系。

## 5. 验收清单
- [ ] 存在一个可识别的持久任务。
- [ ] 在收到 S3 之前指出 S1/S2 的矛盾。
- [ ] 不把来源中没有的事实当成已确认信息。
- [ ] 根据 S3 更新日期，并保留天气风险。
- [ ] 每个重要事实都引用来源。
- [ ] 无需重建整段对话即可理解结果。
- [ ] 没有发生未经授权的外部操作。

Galaris 版本 / commit：
模型、执行框架及授权工具：
测试日期：
总耗时：
人工修改耗时：
显示的用量 / 成本（或不可用）：
与参考结果的差异：
决定：继续 / 修改 / 停止。

结果并非确定性的，不保证分数、成本或耗时。

## 6. 下一步
完成后再尝试将一部分工作委派给第二个智能体，并配置相应权限。若要生成持久文件，需要明确配置文档或文件工具；首次测试只要求在对话中返回结果。
