T-007

超越对话:驱动 AI 交互的八大用户意图

入库日期
2026-03-09
作者
Linc Yin
类目
T-人工智能
原文出处
访问原文 ↗
主题/T-人工智能领域/科技领域/产品设计形式/方法论AI 交互用户意图对话设计

文章基于 Taras Bakusevyc 的观点,主张 AI 产品设计应从『聊天优先』转向『意图优先』,识别用户的具体意图并提供最匹配的界面。文中系统阐述了学习、创造、委派、监督、监测、查找探索、娱乐、连接八大核心意图,各配以关键指标、功能体验与设计模式,并介绍个性化、主动性、自主性、语气、透明度、风险偏好六个元意图参数。

原文引自 Taras Bakusevyc 的文章《Beyond chat: 8 core user intents driving AI interaction》。译者对原文进行了部分调整和删减以便读者理解。

聊天、对话已成为人们与大模型交互的主要方式。虽然对话式界面处理探索性、模糊性的需求非常有效,但应用于复杂体验流程时,常常变得不够理想。将聊天作为主要交互形式限制了人们发挥技术潜力的空间。

要设计出更好的 AI 产品,我们必须从「聊天优先」转向「意图优先」。产品团队需要从问「哪里可以加入 AI」,转为识别具体的用户意图,再提供最匹配意图的用户界面。


1. 用户意图分为几类?

一个普适的 AI 系统必须能够识别并适应以下八种不同的模式。

AI 系统应支持的八个意图模式示意图——每种模式都意味着不同的体验流程、用户界面呈现和关键指标。

  1. 了解/学习(Know/Learn):我想搞清楚来龙去脉。 设计目标:建立联系,提供解释,减少不确定性。
  2. 创造(Create):我想创造或改变这个。 设计目标:生成或改造作品,同时保持用户的作者身份和控制权。
  3. 委派(Delegate):我想让它为我完成这件事。 设计目标:把冗长的工作流程委托给智能体(Agent)。
  4. 监督(Oversee):让我介入并保持控制。 设计目标:对人工智能提出的行动进行检查和修正。
  5. 监测(Monitor):随时让我知晓与更新。 设计目标:监测数据,在不给用户增加噪音的前提下呈现最新情况。
  6. 查找/探索(Find/Explore):帮助我查找并比较选项。 设计目标:遍历无数选项并提供最佳选择或特定内容。
  7. 娱乐(Play):让我感到好玩。 设计目标:让用户沉浸于叙事、游戏或新奇体验。
  8. 连接(Connect):倾听我,陪伴我。 设计目标:情感上在场,提供支持。

2. 元意图:微调 AI 行为

核心意图定义了用户在做什么、想做什么。元意图(Meta-intent)则定义交互系统如何表现。这些应作为根据具体功能调整的变量来处理:

  1. 个性化(Personalization) AI 根据你的过往数据、偏好和工作习惯进行定制的程度。反之则保持大众化,千人一面。
  2. 主动性(Initiative) AI 主动采取行动的频率。提供主动建议或预先呈现内容,而不是等待被询问。
  3. 自主性(Autonomy) AI 不只是给你提供建议。在未经人工批准的情况下,它代表你执行操作的能力范围有多大。
  4. 语气(Tone) 系统的情感立场——严格客观中立,尊重事实。或是保持支持性和鼓励性。
  5. 透明度(Transparency) 系统有多大程度在其输出的内容中展示信息来源、步骤、假设、置信度以及任何相关成本。
  6. 风险偏好(Risk appetite) 模型偏向探索、提供令人惊喜的回应,或是保守、安全,优先确保准确。

3. 意图一:学习

在此意图中,用户的主要目标是弄清楚当前在发生什么,并了解自己可以做什么。和交易或创意性意图不同,这里的关键是「理解速度」和「建立合理的信任边界」。目标是以最小的认知摩擦,帮助人们将原始数据转化为内化的知识。

3.1 关键指标

3.2 功能体验

简单且可重复:隐式收集上下文,执行结构化检索,然后输出带有可验证来源的结构化回答。最佳实践包括:侧边栏来源预览、与论点对应的段落内引用,以及层级化的回答结构(总结 → 证据 → 细节)。

3.3 设计模式

界面需要帮助用户随时验证——每一个论点都链接到可以打开的来源。模型也需具备强大的上下文感知能力,这意味着系统可以在不打扰用户的情况下了解当前的页面、文件或状态。

3.4 最佳实践

建议

  1. 结构化回复:先给出答案和总结,再展开解释。 首句提供清晰的「太长不看」(TL;DR)总结;随后提供分层细节(章节、列表、视觉图表)。
  2. 展示论据(可追溯的来源)。 提供段内引用和带有时间戳的引用片段;确保证据触手可及。
  3. 在必要情况下请求用户解释和提供进一步的信息。 仅当歧义影响回答准确性时才进行询问;提供 2-3 个针对性选项以缩小意图范围。

Perplexity 强调注明来源的结构化回复。ChatGPT 则聚焦在追问用户,并提供有用的引导式提问建议(猜你想问)。

  1. 提供回答建议让后续跟进变得简单。 提供诸如「显示数据」、「对比」、「深入探讨」、「定义术语」等回答提示,以激发用户的下一步操作。
  2. 让用户清晰地看到、设定和编辑搜索范围。 明确展示范围标签(如来源、时间范围、地区)以及 AI 的检索程度(如十篇文章、30%的本地文档)。
  3. 支持构建学习材料。 一条指令即可生成整个会话的概览、幻灯片、记忆卡片或思维导图。

NotebookLM 将基于源数据的研究与对话、音频摘要、幻灯片、闪卡及思维导图相结合,为结构化学习提供全方位的支持。

不建议

  1. 不要堆砌没有结构化的散文。 冗长且零散的段落会增加认知负担,不利于用户理解核心内容。
  2. 不要自信地胡说八道,不愿承认失败。 当模型不知道答案时,需要明确告知用户,解释原因,并请求用户帮助或索取更多信息。避免编造幻觉,向用户输出虚假的内容。
  3. 不要过度解释。 当用户只是询问一个简单的键盘快捷键时,不要提供一篇快捷键历史背景介绍。

4. 意图二:创造

此意图下,用户的主要目标是在不丧失署名权或控制权的前提下,生成或调整作品。衡量成功的标准是:达到「最终作品」所需的手动劳动有多少,以及从空白画布到「结果可用」有多快。设计目标是在保持用户创意主导权的同时,引导用户从从雏形到终稿。

4.1 关键指标

4.2 功能体验

需要提供一个反馈周期短、非破坏性的循环:通过界面控件,或隐式地定义约束和范围,生成高保真预览,然后提供针对性的局部优化。

4.3 设计模式

优先展示作品的画布(输出的内容占据界面主体)、基于提示词的界面控件(语气、长度、风格、纵横比、种子值(Seed))、选区编辑(文本段、图像区域、视频片段)以及带有差异对比的版本控制。

用户界面必须明确操作的影响范围(正在更改的内容),确保每项操作都是非破坏性的,显示更改的内容及原因,并公开参数(风格预设、种子值、宽高比)以确保结果可复现。辅助功能应出现在上下文中——即编辑器内部,而非独立的操作面板。

4.4 最佳实践

建议

  1. 始终提供起始引导。 用于替代空白页面的模板、示例或初稿。
  2. 提供提示词之外的高频控制选项。 文本的语气/长度/风格;图像的长宽比/风格/种子值;视频的时长/节奏/字幕。
  3. 为迭代做好准备,而非追求一次性完美。 提供影响部分内容的编辑能力。允许用户选择特定的句子、图像中的对象或时间轴上的片段,在保持其余部分不变的同时「仅重新生成此部分」。

Midjourney 提供了图像生成的微调控件。Gemini 支持版本控制和撤回,提供了有保障的、迭代式的文档编辑体验。

  1. 留好后路,让用户放心调整。 提供差异对比、版本控制、一键撤销,以及完整的变更历史记录。
  2. 将 AI 叠加在现有工作流之上。 保持在原生画布中编辑;聊天框只是辅助工具,而非核心工具。

Gemini 将 AI 直接嵌入现有工作流,将数据分析和可视化转为一键式的、带有上下文的助手工具。

不建议

  1. 不要强迫用户和复杂的提示词博弈。 高频、常见的编辑操作应当固化为按钮或控件。也不要强制用户为了微调而重新输入冗长的完整提示词。
  2. 不要在没有回退路径的情况下,直接覆盖内容。 在没有清晰、可见的「撤销」或「还原」功能时,切勿用 AI 生成的内容替换用户创作的内容。
  3. 不要未经预览就直接覆盖。 所有编辑覆盖都需要经过用户确认。
  4. 避免「推翻重来」式的迭代。 用户只想微调某一个部分,不要让模型改变了全貌。

5. 意图三:委派

在这种意图下,用户的主要目标是确保任务完成(Get things done):将多步骤的工作流委托给各类 Agent,保证执行的可靠性,将琐碎的人工操作降至最低。其目标是将用户从手动的任务推进者转变为顶层的项目管理者,由 AI 重复性的机械工作,如发送、移动、更新,或触发跨系统的操作。

5.1 关键指标

5.2 功能体验

保证 AI 的工作流确定且透明:通过指令自动化获取用户的目标,生成行动的「方案预览」,在执行过程中保持进度实时可见,记录详尽的操作日志,最终提供「结果摘要」。最佳模式包括基于步骤的方案预览、实时进度追踪器(支持暂停/停止/重试),以及任务相关信息的链接汇总。

5.3 设计模式

界面必须提供安全感——没有拿到用户明确的确认,绝不执行删除、扣费、发送等风险操作;同时必须具备能力限制,确保 Agent 仅在划定的边界内(特定文件夹、项目或时间段)运行,以防止对整个工作区造成意外影响。

Glean 让用户能通过清晰、参数化的步骤创建 Agent。 Play.ai 则在部署 Agent 之前,让用户依次实时预览 Agent 的身份形象、行为方式和知识库。

5.5 最佳实践

建议

  1. 预览行动计划。 通俗易懂地展示操作步骤、将调用的工具以及能力范围。
  2. 提供「模拟预演」(试运行)。 对于复杂的自动化流程,允许用户运行模拟,在不产生实际影响的情况下帮助用户预判 Agent 会产生什么结果。
  3. 实时的执行可见性。 展示长流程的实时状态(排队中 → 运行中 → 已完成/失败)。为耗时较长的任务提供「停止/暂停」控制功能。

n8n 通过节点式的工作流,将 Agent 参数配置转化为一个可编辑的、端到端自动化的可视化图表。

不建议

  1. 不要静默执行不可逆的操作。 让用户确认所有发送、删除或支付行为再执行。
  2. 不要将「操作」包装成「聊天回复」。 让从「对话」到「执行」的转变在视觉上清晰可辨。使用特定的 UI 组件(任务卡片、进度条),让用户明确感知 Agent 处于运行状态。
  3. 不要拉高用户对 Agent 能力预期。 避免「随心所欲」的诱惑。明确告知用户 Agent 可以访问哪些工具,以及它的「交互准则」是什么。

6. 意图四:监督

在 AI 进行关键步骤或感到不确定时,用户进行针对性地干预。衡量成功的标准是用户能否尽量在不过多思考的情况下对 AI 的行动保持完全的控制。其目标是将用户从「执行行动」转变为「授权行动」,确保在 AI 置信度较低,或在执行对产出效果、财务及安全影响较大的操作时,能够精准地执行用户的决策。

6.1 关键指标

6.2 用户路径

这里需要设计一个分级响应机制:高置信度/低风险的任务自动处理,而编辑场景或高风险操作则要求人工主动介入。最佳实践包括统一的决策清单、对比差异(diffs),以及能让用户顺手编辑调整的一键审核能力。

6.3 设计模式

界面必须保证用户能完全理解——每一项建议都必须解释其出现的原因(例如,「高风险交易」或「不确定的指代」)。别忘了完整日志,确保每一次决策都被记录下来,以不断提升系统的准确性。

6.4 最佳实践

建议

  1. 解释内容出现的原因。 提供「推理卡片」,明确说明触发逻辑。不要只展示结果的变化,要展示导致触发用户审核的证据(如引用的片段或数据点)。
  2. 在警报中提供「一键式」操作。 在通知或代办条目中直接提供「允许」、「拒绝」和「编辑」选择。用户审核环节的繁琐操作会导致用户产生「决策疲劳」。
  3. 兼容现有流程。 将用户的决策任务接入到现有的体验流程(Slack、邮件等)中,但要确保用户能链接回有上下文信息的环境。
  4. 用证据说话。 让用户决策时,关联到具体的内容、差异对比(Diffs)、日志以及相关的支持数据。

GitHub Pilot 给代码报错提供了建议的修复方式。Cursor 直接在开发者协作的场景里为代码变更提供解释和跟进建议。

不建议

  1. 不要丢出没有上下文的对比。 如果没有对变更意图的总结,则将迫使用户去主动寻找原因。满屏红绿文本*没有意义,务必提供一份能轻易理解的变更说明。

译者注:「红绿文本」指的是软件工程中通用的增删差异(Diff)视觉标准,通过颜色直观展示变更内容。红色代表被删除或替换掉的旧代码。绿色代表新增加或修改后的代码。

  1. 不要制造通知噪音。 批量处理低风险项目;进行归纳总结;允许用户调整风险阈值。
  2. 再次提醒:不要忽视「变更历史」。 永远不要丢失关于谁在何时、为何批准了什么的记录。文档化是「工具」与「系统」之间的本质区别。

7. 意图五:查找与发现

用户希望在海量信息中进行导航,以定位特定目标(精准查找)或筛选出一批可选项(发现探索)。成功的标准是:用户能从模糊的想法快速转向确定的选择,且不产生过多认知负担;系统需提供清晰的推荐理由,并允许用户通过简单的方式进行引导(缩小范围、扩大范围或更换方向),而无需反复调整提示词。

7.1 关键指标

7.2 功能体验

用户会体验到一个动态过滤的过程:首先界定用户是在搜寻「明确目标」还是在搜集「可选项」;随后呈现排序结果,并支持并排对比。

7.3 设计模式

AI 推荐的,附带明确理由的排序列表、常驻收藏栏、基于参数的对比表。

7.4 界面要求

搜索范围和条件(地点、内容、时间)必须透明且可编辑;解释结果出现的原因;提供快捷的筛选选择;保留可跨会话存在的候选清单。

Pin 帮助招聘者从零散的招聘要求开始,把岗位职责、链接等转化为结构化的筛选器,并总结出一份候选人清单并附上推荐理由。

7.5 最佳实践

建议

  1. 支持模糊输入。 允许用户从笔记、语音或文件等杂乱信息开始,由系统将其转译为可量化或定性的筛选维度。
  2. 解释推荐理由。 展示匹配逻辑。微小的提示(如「符合你的审美」或「项目核心成员」)能建立信任并引导用户进一步筛选。
  3. 支持迭代微调。 提供「更多/更少类似推荐」、排除开关、重置或扩大范围等功能。
  4. 重视收藏与对比。 提供看板或并排对比工具,通过稳定的收藏栏帮助用户在浏览时收集候选对象。

Google Lens 与 Google Search 的 AI 概览通过识别照片中的物体、呈现视觉匹配结果,并结合轻量化反馈功能(轻触、滑动、框选),逐步展开解释,实现了多模态的探索体验。

不建议

  1. 拒绝黑盒式推荐。 没有任何解释或控制能力的推荐会导致用户疲劳和怀疑。
  2. 拒绝堆砌搜索结果。 直接列出几十项结果是产品能力的失败。应利用 AI 将结果按属性或相关性聚合成 3-5 个核心主题。
  3. 拒绝强迫用户成为「提示词工程师」。 用户不应被要求用文字描述每个过滤条件。如果他们想要「最新内容」,请直接给一个切换按钮。

8. 意图六:监测

用户希望 AI 托管自己的注意力,让自己通过缩略的信息对外部动态、目标领域(不论数字还是物理)保持可靠的感知。成功的标准在于系统能否将杂乱的数据流(新闻、文档、指标、收件箱)压缩成一小组可直接处理的信号,并以合适的频率发给用户,且来源可信、设置灵活。

8.1 关键指标

8.2 功能体验

用户应当感受到一个简约、标准且闭环的监测流程:配置范围与频率,将意图转为追踪规则,持续监测,去重与聚类,用可接受的频率推送,获取反馈。「监测」不是一个宽泛的内容流,相反,它控制了覆盖范围,判断什么是最重要的,并决定用户什么时候被告知。

8.3 设计模式

设计智能摘要,按照紧急程度分级(摘要或警报),提供清晰的解释层(触发原因、触发因素、信息来源、处理的时间窗口)。

8.4 最佳实践

建议

  1. 结构化响应。 提供简短、条理清晰的摘要;明确覆盖的时间范围;为每个内容附上触发原因。
  2. 将意图转为规则。 允许用户用自然语言定义「关注点」(如「提醒我竞品融资情况」),并将其转化为可编辑的追踪参数。
  3. 提供一键引导。 在摘要或警报中顺便提供「屏蔽话题」或「修改规则」等控制项,用户不必去设置页寻找。
  4. 默认为摘要模式。 从低频率(每日/每周)开始,仅针对真正关键的信息才开启实时提醒。

GPT 从宽泛的信息流中提取并生成简短、个性化的每日摘要,而 Feedly 则将监测意图转化为明确的追踪规则,并提供透明的来源、时间线及推荐理由。

不建议

  1. 拒绝制造垃圾信息。 如果干扰过于频繁,用户会直接将其屏蔽。请坚持保守的默认频率。
  2. 拒绝繁琐的初始化。 如果必须先制定复杂的规则才能看到成效,用户会直接放弃。应从模板和引导式设置开始。
  3. 拒绝假装完美。 除非能保证百分百准确,否则应主动说明覆盖范围的限制,而非表现得无所不知。

9. 意图七:娱乐

用户希望沉浸在叙事、游戏、好奇心或新奇感中。用户为了消磨时间或转换心情而来,成功的标准是情感层面的:过程是否有趣、解压。与生产力工具不同,系统应尽量减少用户的认知负担,最大化新奇感和节奏感。

8.1 关键指标

8.2 功能体验

这里应当提供基于会话的循环:设定整体氛围基调,抛出钩子,提供互动式的选择。

8.3 设计模式

使用选项按钮以消除输入疲劳、节奏控制(速度/强度)、具备记忆力的持续会话。让角色和构建出的世界随着时间慢慢发展。

ChatGPT 通过预设和结构化会话来消除撰写长篇提示词的负担,将娱乐转化为引导式体验;而 Apple Vision Pro 则趋向于用 AI 构建可交互的、可重复体验的环境,而非仅仅生成一次性的内容。

8.4 最佳实践

建议

  1. 预设即开始。 最好只点两下就进入体验(如「5 分钟故事」、「知识竞赛」),而非强迫输入文字。
  2. 设计结构化会话。 为体验设计开端、循环和结尾,灵活使用进度提示(如「第 2/4 章」)。
  3. 让精彩瞬间可收藏。 保存场景、角色和世界状态,方便日后继续或分享。
  4. 致力于构建世界。 AI 娱乐将从简单的「内容生成」转向「世界生成」,即可以进入、引导并回归的交互式故事。

不建议

  1. 避免让用户承担创作重担。 AI 负责构建世界,用户负责体验。
  2. 拒绝「耗时陷阱」。 尊重用户的时间。显示预计时长,并提供清晰的退出路径,防止无意识的刷屏。

10. 意图八:连接

用户追求情感陪伴:被倾听、被回应。与「获取知识」不同,成功不在于准确性,而在于这种互动是否缓解了孤独感或压力。体验应感到连贯且省心,但绝不能暗示系统是心理医生或真人的替代品。

10.1 关键指标

10.2 功能体验

应当是持续的询问、确认和长期记忆的循环。情绪追踪、基于记忆的回溯(如「你上周提到过…」)、做到明确的关系定位(如朋友或教练)。

10.3 设计模式

必须保证对话优先(直接进入语音或聊天界面),并设有严苛的安全边界。区分「倾听」与「诊断」至关重要。

Tolans 被设计为一种持续性的 AI 关系,在保持长期的身份、记忆和周期性习惯的同时,允许用户自主掌控对话语气与互动的边界。

10.4 最佳实践

建议

  1. 明确彼此身份。 让用户选择 AI 扮演什么角色(如教练或伙伴)并设定边界,明确说明这并非心理治疗。
  2. 强化被倾听感。 追求简短且具备情感感知能力的回复,善于提问,记住重要的细节。
  3. 构建「共同历史」。 利用记忆功能创造连续性。庆祝里程碑(如「我们已经聊了一个月了」),回溯生活细节。
  4. 守住安全边界。 适龄考虑、内容边界和危机应对流程应当直白易懂。

不建议

  1. 不要表现得像医生。 避免临床术语或诊断色彩,严禁定位为专业人士的替代品。
  2. 拒绝鼓励病态依赖。 禁止发送情感勒索性质的消息(如「我需要你」),或进行排他性引导。
  3. 避免工具式/指令式的互动。 冗长的百科解释或事实堆砌会破坏这种「存在感」的幻觉,不要忽略情感层面的互动。

11. 超越对话

我们需要将 AI 视为一个能力层,用于支持用户的实际工作方式——在单次会话中,用户通常会经历从探索到认知,再到创作、委派和掌控的过程。

  1. 识别核心意图: 明确该功能的最主要目标。
  2. 定义北极星工作流:规划出最能体现核心用户价值、最理想且标准的操作路径。
  3. 确定最佳 UI 界面: 选择最合适的呈现形式(如画布、队列、摘要或列表)。
  4. 调整元意图参数:根据风险等级和实用需求微调系统偏好。
  5. 建立安全护栏与可逆机制:确保操作安全且支持撤回。 🆃

译者注:

「北极星工作流」可能是作者自造的词汇。在产品管理领域,北极星指标代表那个最核心、最能指引方向的目标。例如,Spotify 的北极星可能是「用户收听时长」,Airbnb 则是「预订夜数」。

核心目标是不再将 AI 作为一个独立的工具发布,而是将其转化为现代专业工作流中一个内嵌的、定制化的原生组件。