多模态的价值,在于理解同一个任务
文字、图片和语音如何共同表达需求,以及为什么上下文比输入方式更重要。
表达方式不同,目标应该一致
一张参考图可能表达视觉风格,一段语音可能补充使用场景。多模态交互的价值是将这些线索与当前任务联系起来,而不是分别处理后给出互不相关的回答。
连续修改需要明确的参照
在应用创作中,说“把这里改一下”需要明确正在查看的版本、相关元素和用户想保留的部分。表达更具体的修改范围,有助于降低上下文歧义。
能力与边界都需要可见
模型可能误解图片或遗漏要求。预览、版本对比与用户确认,是发现问题的重要环节。涉及真实业务的数据和结论仍需验证。这篇文章介绍设计原则,不代表独立的模型评测结果。