根据需求或参考图片生成图像
描述一张插图,或提供需要编辑、组合的参考图片。智能体使用已配置的图像资源,将结果写入可写目标,再附加到对话或文档中。
参考图可来自附件、文档、邮件、控制台或网页。请求尺寸会匹配模型支持的原生尺寸,系统返回实际尺寸。编辑方式、参考图数量和格式取决于选用的资源。
把录音整理成会议纪要
转写功能接受音频或视频资源。长内容会分段处理,逐字稿保留为文件,再通过分层摘要汇总。会议与视频使用的摘要指令可以分别配置。
对于公开 YouTube 链接,Galaris 获取已有字幕,不下载视频,也不会在缺少字幕时虚构逐字稿。阅读者可以回到原文核对决策或引述。
理解语音以外的内容
视觉资源可以根据问题分析图片。音频和视频功能可分析环境声、乐器、声音事件或视频内容。这些使用专用资源,与语音转写不同。
当前检查的实现将 Multimedia 读取限制为 32 MB 和 20 分钟。模型必须支持请求的输入类型。
跟踪耗时生成
| 产物 | 此流程的集成 |
|---|---|
| 音效 | ElevenLabs、SunoAPI.org 音效服务 |
| 音乐 | Eleven Music、通过 OpenRouter 的 Lyria、SunoAPI.org |
| 视频 | OpenRouter、通过 BytePlus LAS 的 Seedance |
请求包含指令、受支持的选项和保存目标。系统返回 Process 引用,因此对话可以继续。只有文件实际写入并关联原任务后,才记录成功结果。
恢复交付,无需重新生成
不支持的选项会被拒绝。调用标识区分同一请求的重试与新版本生成。提交或写入结果不确定时,可能需要明确核实处理。
交付修复可以关联已有文件,或在核实后允许重新写入;不会自动购买新一次生成。未知费用仍会标记为未知。
Multimedia 连接在初始化时启用;已有的停用设置会保留。请先启用所需资源并确认服务账号;SunoAPI.org 是独立第三方服务。Galaris 不会自动开放每个供应商的全部商业功能。
保存可复用的图片描述
image_read 在报告成功前保存描述。对有效文档附件,它会补充对应记忆并保留修订与来源;其他 URI 的描述仅属于该智能体与资源组合。存储失败会使工具失败,保存描述不会共享源文件。
在对话中直接理解附件
使用内部执行引擎与兼容模型时,消息中的图片、音频、视频和 PDF 附件可以直接传给模型,包括保留的历史消息。智能体无需每次都调用单独的分析工具。
支持情况取决于模型、格式与传输配置。系统检查智能体权限和总字节预算,优先处理当前消息。文本中提及链接本身不会触发下载。持久转写、保存描述或不受支持的格式仍可使用专门工具。Dream 对视频的分析仍仅处理音轨。

