游乐游手机版
首页/AI热点日报/热点详情

腾讯万字实录:AI时代用户研究员的三位一体能力模型

类型:热点整理2026-07-22
基于用户研究员在AI时代的实践,提出“工具、素养、优势”三位一体能力模型。工具分为通用研究助理、自动化工作流与创新引擎三层次。AI素养涵盖核心原理、提示词工程、输出评估与数据伦理。强调AI提效显著,但人类独特价值在于理解与判断。

先说几个核心判断。

上周六(8月23日)在腾讯北京总部做了一场分享,感谢腾讯问卷和UXRen搭建的平台。很早以前就开始参加UXRen的活动,学到不少东西,也在那里认识了后来很熟的朋友。这次把分享的文字实录整理出来,回馈一下社区。

今天聊的主题是「价值重塑:用户研究员在AI时代的三位一体能力模型」。

能聊这个话题,首先是因为一直在做用户研究,对技术进展始终保持着关注。很早学了Python,2022年底GPT-3.5出来以后就没断过跟踪。后来把思考和实践中积累的东西写了出来,到现在已经积累了150多篇用研+AI相关的文章。

另一方面,所在的是一家K12教育公司。教育行业一个显著特点是销售导向,由此积累了大量的销售与家长沟通文本。大模型最擅长的正好就是文本处理——它本质上是语言模型。所以在公司里利用大模型做了很多文本分析的事情,比如分析用户的退费原因、续报失败的原因,或者做AI质检,检测班主任有没有对家长做出过度承诺。还推动了不少场景的AI落地工作,按不同阶段与内部数据做了不同层次的结合。

基于这些积累,今天来做一个深入的交流。

腾讯分享万字实录:用户研究员在AI时代的“三位一体”能力模型

AI-Native用户研究员能力模型概览

先看这个能力模型的结构:工具、素养、优势,三个维度。

工具比较好理解,就是类似腾讯问卷这样的东西,把它分成三个层级。

接着是AI素养,这是比较核心的部分。很多时候用AI发现效果不好,问题到底出在工具上还是人的使用上?个人倾向于认为是人的问题——要么没用对,要么哪个环节还不够细,或者场景选得不对。

最后是人类优势。AI当然有它的优势,但人类的优势在哪?作为用户研究员、分析师,当我们在做各种研究项目的时候,与AI相比,我们的独特价值到底在哪?这是今天想重点探讨的一个方向。

一、AI工具:效率翻跟斗

第一大方面,AI工具的角色是效率翻跟斗。

AI工具分层

第一层:AI增强的通用研究助理。可以简单理解成在一个通用大模型里完成相应任务,比如用DeepSeek、GPT,用一些结构化的提示词去获取想要的结果。

第二层:自动化与智能工作流。利用Agent和集成工具,把重复性、流程化的任务自动化,建立持续的数据洞察监测管道,实现规模化研究。这比聊天窗口复杂一些,是一个工作流,需要用自己的访谈数据、问卷数据去做真正的产出。

第三层:AI驱动的创新引擎。这是一个更完整的解决方案。比如腾讯问卷演示的AI主持人,可以视为一个完整方案——它能够访谈、根据话题生成提纲、执行访谈、最后生成报告。

第一层:AI增强的通用研究助理

需求拆解。现在大家应该已经很熟悉了。直接给一个简单的指令,或者加上更多要求,它就能呈现一个非常明确的需求拆解结果。

生成访谈提纲。要求可以写得比较详细,比如提纲要包含开场白、用户基本情况、使用背景信息、深入探寻以及结束语。但现在的AI已经不需要说这么多了,直接告诉它“我需要一个访谈提纲”,它就会自动生成开场白、破冰问题、每个部分以及大致的时间分配。

智能转录与总结。这个在定性工作中用得已经很多了。以前做研究要转录,要么现场找速记员打字,要么结束之后花一天时间转录。现在基本不需要转录员了,现场录音完,飞书妙记、通义这些工具转得都非常快。而且根本不用追求100%准确率,偶尔出现的错字AI会自动纠正过来。

定性的自动总结更不用多说。通义这种工具直接给出会议转录的摘要和结构化内容。关键是,做总结的时候可以自己定义一个结构化的模板——其实就是你那份访谈提纲。把提纲和全部转录文本一起扔给大模型,让它按照提纲总结出相应内容,出来的就是一份很好的用户故事和访谈纪要。省下的时间非常可观。

有人担心输入内容太多——访谈提纲加上转录文本可能几万字,大模型能不能处理?完全不用担心。大模型现在的上下文最长可以达到约200万字。做定性总结、用户纪要用这个方式处理,包括习惯用Excel做总结的,告诉大模型输出Excel格式就行,直接复制使用。

第二层:自动化与智能工作流

桌面研究——Deep Research工具。有一个非常好用的工具,各家模型基本都推出了Deep Research产品。目前做得比较好的两家:Gemini和ChatGPT。Gemini的特点是宽泛,一句话能生成几万字的报告,全部联网搜索出来,基本不会有幻觉,每段后面都附带链接。GPT的深度研究模式则内容更深。

国内也有,秘塔搜索和Kimi的Research模式都能输出大量内容。做前期桌面研究的话,这些已经完全够用了。

自动化数据处理——以微软Lida为例。Lida是GitHub上的开源模型,是一个完整的工作流。上传CSV或Excel文件,它会先生成数据摘要——行数、最小值、最大值、标准差,然后自己生成分析目标,完全不需要手动指定。接着自动生成图表,还支持对话式微调,比如“这个图不要绿色的,线条全改成黄色”,它就能直接调整。

当然,ChatGPT也可以做到类似的事情,直接把数据丢给它就能生成图表。但Lida作为完整的数据工作流,效果更好一些。使用过程中可能需要调几轮才能达到满意效果,这也有相应的方法可以优化。

批量文本分析——以Dify为例。之前有老师提到过,腾讯AI工具里主观题分析功能很受欢迎。用研同学做文本分析确实是个痛点。现在有大量工具可以做批量文本分析,比如Dify。它是一个无代码的工作流搭建工具,新建一个应用,编写结构化的提示词,就能使用批量生成功能。上传Excel文件,规定好格式,每一行放一段文本内容。核心关键在提示词的编写。

提示词里可以规定分析目标:比如提取用户对产品的情感,要求输出积极、中性、消极三种类型。至于分析准不准,需要自己去调,后面在AI素养部分会详细讲。

第三层:AI驱动的创新引擎

大模型给用户研究员提供了很多全新的可能性,这里提供几个新视角。

新数据:用研只能用访谈和问卷获取数据吗?

以前文本分析做不了,想做情感分析只能找算法同学排期。现在用Dify这样的工具,甚至用多维表格就能做。多维表格里有大模型相关的AI捷径工具,不需要写代码、不需要写Python,只要把提示词规定好,告诉它“我是一份什么样的文本,请从中提取用户的情感,输出积极、消极、中性”,它就能直接输出结果。

音频信息和视频内容解析,通常还是先转成文字再处理。实际上已经有一些多模态模型,比如Google的Gemini,可以直接从音频和视频中提取情感信息,包括笑声、掌声这些无法转成文字的内容,国内相应的模型也能做到。

举例:利用多维表格和Dify进行批量、结构化文本分析。这就是前面提到的结构化文本分析的实现路径。

新洞察——或许你都不需要访谈真实用户了。

现在有很多创业公司在做合成用户。合成用户能用吗?企业认不认?准确度如何?这里面有大量工程细节。如果只是简单告诉AI“你是一个25岁的女性用户,喜欢什么”,让它回答问题,效果肯定不够细。

可以看看atypica的做法。他们的AI角色(虚拟用户)是基于深度访谈构建的。已经访谈了约1000位真实用户,基于这些用户的几万字真实访谈信息,再去让AI扮演这样的用户回答之前没问过的问题,包括对其他产品的看法。它的真实度远超仅用简单画像做出来的效果。

研究显示,AI虚拟人物与人类行为的一致性可以达到85%。这个数字可能让人半信半疑,但所有做合成用户的产品都源自斯坦福的一篇论文。研究者用AI访谈工具访谈了1000个用户,以这些用户为基底测试各种学术性、经济学、社会学问题,发现一致性非常高。从那以后,做合成数据的厂家就多了起来。

除了基于真实访谈文本构建虚拟用户,还有一种创新方式:基于全网数据爬取。比如从小红书获取数据——上面很多用户分享真实的使用感受、想法和个人生活。把有信息含量的内容形成AI角色,产生的洞察也是不一样的。

这个方向有很多可做的事情,而且会是趋势。因为提效实在太快了。严谨访谈10个用户可能要一两个星期,而线上100个用户可能一小时就能完成。而且这个东西可以积累,积累的真实用户访谈越多,AI角色就越真实。储备1000个用户的池子,按人口统计学的性别、年龄、城市交叉分类,已经可以区分出很多维度。

新交付——甚至你也不需要交付报告了。

一个例子是益普索交付的数字人。在企业微信、飞书里可以直接跟这个虚拟人沟通,让它参与头脑风暴,随时召唤它了解更多细节。

腾讯最近的企业微信5.0更新也做了类似功能——机器人可以上传资料做知识库。把你的访谈用户知识库上传,把机器人拉到群里。产品经理说“我不信用户是这么想的”,你可以直接@虚拟人,让产品经理亲自问它。这种创新的交互方式,对乙方的调研公司来说尤其有吸引力——天天交付几百页PPT,大家都会枯燥,但直接跟真实用户的反馈互动,冲击力是完全不同的。

创建过程也很简单,在Coze里上传访谈文本,让它基于文本回答问题就可以了。

二、AI素养:认知升级

AI素养,核心在于人的使用。同样的模型,不同人用出来的效果肯定不一样。就像K12行业,教材一样、老师一样,每个学生的吸收也都不一样。工具一样,但怎么用好它,差距非常大。

AI更新换代快、工具又多,想一劳永逸地用好也不现实,还是需要多去用、多去思考。

用户研究员的AI素养

具体来看,把它分成四个层面。

第一个是大模型的核心原理。不需要完全掌握背后的技术细节,但要对它的能力、边界、局限性有比较好的了解。之前有老师提到AI不能完成某些任务,那恰恰是对AI能力边界的体现。有些事情它现阶段就是做不好,那就不要在这一点上死磕。而且大模型发展非常快,可能一个月之后它的能力就补充上来了。

第二个是Prompt工程与方法。前面有老师提到用两种方法解决大模型输出不稳定的问题,本质上就是这块内容。

第三个是输出评估与风控。这块比较重要——如何判断大模型输出的东西对不对?有一个体会:当年学SQL的时候,跑不对就很烦,觉得哪出了问题;等到能轻松跑出数据了,又开始慌——它跑得到底对不对?大模型也是一样。它输出之后,准确率、召回率有没有达到要求,需要花很多时间做校准。很多人诟病大模型在某些方面反而更费时间,大多就费在这一步。

第四个是数据素养与伦理意识。在公司使用外部大模型工具时,用户隐私问题是必须注意的。合规性越来越受重视,如果做海外业务,数据合规会更加重要。

用户研究员的AI素养平均为7.45分,达到优秀水平

AI素养问卷是自行编制的,153人答题,平均分7.45。坦白说这个结果让人有点意外。之前找身边人测试时,很多人做到第一道题就做不下去了。那天看到群里很多九分、十分,确实很震惊,后来把PPT的深度提升了一些。

九到十分的占了26.8%,比例非常高,说明行业对AI的关注和使用已经非常强了。

区分维度来看——基本原理的掌握有些欠缺。最基础的那道题——大模型生成文本的核心机制——正确率只有56.9%。核心机制就是“下一个token预测”,技术原理虽然复杂,但归结到底就是这一点。Embedding相关的题目更专业一些:Embedding向量通常用于文本嵌入,做知识库上传与处理时经常用到,它会把文本转成数字,向量数据库一般是1000多维,用来做相似性统计。

区分维度来看——Prompt工程掌握很好。Prompt工程相关题目准确率普遍在95%以上,说明大家平时用得比较多,知道怎么跟大模型沟通。比如要提升输出质量,堆砌形容词没用,需要结构化、做角色设定、限定输出格式,这些都没问题。

区分维度来看——输出评估与风控掌握一般。有一道题问到哪种方法最能显著降低幻觉,正确答案是RAG(检索增强生成),也就是知识库。幻觉来源于模型自身的训练数据,那就不要让它基于自身数据,而是基于你上传的资料。联网搜索本质上也是一种RAG——知识库是实时搜索到的十条、三十条信息,所以联网搜索一般不太会出现幻觉。

1.大模型核心原理

几个小问题值得聊一下。

现在最强的大模型是哪个?

国内国外的答案都是:分场景。全球来看,目前是Gemini-2.5-Pro和GPT-5。个人使用过程中,觉得GPT-5并没有那么突出,Gemini-2.5-Pro的指令遵循和语言风格更接近人类。代码能力最强的是Claude Sonnet 4——现在AI Coding工具很火,对大家来说也很有用,可以写SQL、写SPSS语法、写Python代码,都完成得不错。

国内开源做得比较好的是DeepSeek和阿里通义。在普通任务上,国内模型已经完成得很好了。最近开源的Kimi K2和智谱GLM-4效果也都很好。

大模型能处理的最长文本是多少?

前面提到最长200万字,其实有些实验性模型能做到400万。说这个是想告诉大家:不用担心输入过多。一份访谈提纲,加上十个、几十个访谈文本全部输入进去,它能提取出不同用户的姓名和针对某个问题的回答。当然上下文太长提取能力会有下降,这是肯定的。

大模型有记忆吗?

没有。大模型刚出来时很多人困惑这个问题。它没有类似人类的记忆。我们现在感知到的“记忆”,不是它本身的能力,而是工程化方法:通过工具把每次对话中的有用信息提取出来存到某个地方,下次对话时把指令和存储的记忆一同发给模型。比如ChatGPT保存的一些记忆,并不是模型记住了,只是存储下来,下次调出来用。

2.Prompt工程与方法

写结构化Prompt的方法。分享一个在之前公司做文本分析时的提示词案例。

先交代背景:公司类型、课程内容、需要完成什么任务。然后告诉它流程:第一步生成摘要——总结家长与班主任的沟通内容;第二步判断退费原因——有两种方法,让模型完全自主判断(它有这个能力),或者给一些标签让它从中选择;第三步在做出判断时说明依据。第一步和第三步都是为了后续迭代提示词、迭代准确率和召回率做准备。

规则很重要。标签可能非常多(比如35个),模型在匹配时容易混淆,需要在规则里解释清楚。比如“班主任态度不好”比较容易理解,“班主任引导退费”可能指的是什么,边界条件需要定义清楚。

最后是输出格式。要求用JSON格式输出,配合Python做统计,输出格式稳定后直接做解析统计。提示词可以学习,Python不会的话也可以让大模型写代码——GPT-5和最近发布的DeepSeek 3.1代码能力都很强,写一个简单的JSON解析代码做统计处理非常容易。

Prompt设计——12个经典框架。WaytoAGI社区有总结。但这些框架不需要刻意去记,只需要记住一个原则:当给大模型布置复杂任务时,就把它当实习生。你给实习生布置任务时,是不是要交代清楚背景、12345的步骤、以及期望的产出形式?照着这个逻辑写就行。

3.输出评估与风控

做批量文本分析时,如何优化提示词达到较高的准确率和召回率?本质上是一个迭代过程。先写一个提示词,让大模型打标,然后与人工打标结果对比。人工打标可能做不了全部,但可以抽样人工标注100行文本,机器同时标注这100行,计算准确率和召回率。

达不到标准怎么办?去看模型在哪些地方判断错了。这也是为什么在前面案例中要求模型输出判断证据——有了证据就知道它为什么这么打、为什么出错,然后改提示词,再次人工验证。按照之前的经验,三轮循环下来,准确率可以从50%多提升到90%左右,提升非常明显。

4.数据素养与伦理意识

隐私保护是绕不开的。用大模型处理公司数据时必须注意。数据预处理非常重要——那句经典的“Garbage in, garbage out”。很多做企业知识库的公司,最大卡点就在于企业知识散落在各个地方。前期数据预处理要做充分,把企业微信、钉钉聊天数据、邮件数据等全部融合到一起,需要调用什么时就能调什么。

算法偏见也需要警惕,不过在国内大模型上这个问题相对温和一些。还有一个重要原则:明确自己是最终负责人。不能把问题归咎于“大模型生成的”,要真正由自己来承担责任。

三、人类优势:价值护城河

提出问题的能力:人类与AI的核心差异

人类的优势如何体现?最核心的就是提出问题的能力。

有研究提到,使用大模型最大的问题之一是让人丧失了思考。心理学上看一个人是否在深度思考,会看脑区激活程度。最近有研究发现,使用大模型的人脑区激活的区域和程度都明显更少、更浅。这很容易理解——你不再自己思考了。

这里有一个核心问题:如果把全部思考都外包给大模型,你的核心价值体现在哪里?

提出问题的能力,是拉开差距的关键。工作五年、十年的用研,对需求的把握、对问题的理解、提出问题的质量,差异是非常大的。

在K12行业,有的孩子学不进去、听不懂,但不同人的反应完全不同。一个很大的差别在于主动性——听不懂的时候,他会不会主动想办法解决。大模型现在已经具备了人类历史上几乎所有的知识。而且它作为老师,既有耐心,又可以给你答案,也可以一步步引导你。

当你能学会任何东西的时候,你该学什么?该问什么样的问题?这才是感知人与AI差异、提升自身价值的关键所在。

情感共鸣与信任

情感共鸣与信任方面,AI不能替代人的究竟是什么?

比如AI作为主持人去访谈用户,虽然未来AI的声音会越来越像人类,很快分不清,但有一个问题:线上调研和线下调研终归不同。线上调研无法捕捉用户的非语言信息、肢体信息。前面有老师展示过案例——用AI访谈外国人对辣条的喜好,外国人通常愿意夸奖别人,嘴上说“很喜欢”,但你看不到他的眉头是皱着的。

需要与人建立情感链接和信任关系,才能获取到更多信息。在这方面,AI还没有那么胜任。

创造力与战略洞察

创造力是大模型最欠缺的。创造力不是问一个问题、它生成一个内容出来——那是它最基本的生成能力,不是创造力。创造力是指,如果大模型已经了解人类历史上所有的知识,它能不能像爱因斯坦那样提出相对论?

现在的AI做不到,原因是它的基本原理——对下一个token的预测。不过很多一线的专家认为这只是现状,未来AI创造科学理论很快就会实现。马斯克也说过,到年底进化后的Grok 4就能发现新的物理理论。现在基本上每季度就有一个非常厉害的大模型出来,按线性发展会很快,如果出现涌现式的指数级增长,那就更快了。

回顾一下三位一体能力模型

回顾这个框架,在思考时把它对应到了三个层面:术、法、道。

  • 术——工具
  • 法——使用的法则,偏AI素养
  • 道——人类优势

这个框架可以帮助思考如何在工作中应用AI,以及建立一些预见性。AI发展非常快,如果每天去跟踪进展,是很累也很焦虑的事情。从一个前瞻性、预见性的角度去判断——按照当前发展速度,五年后大模型会呈现出什么状态?这个框架可以帮助思考未来五年工具会怎么变、需要掌握哪些素养、人类的优势还能不能保持。进而引导重新审视和定位自己的职业发展方向。

最后:AI会替代用研吗?

会不会替代?现场举过手,觉得会的很少。

但个人还是比较坚信,AI会替代用研。这个替代不是说五年内大家工作就没了,而是说用研或分析师这个岗位一定会发生变化。基础性工作肯定交给AI来做,需要人来做的事情会越来越贵。这是确定的趋势。

比如AI心理咨询——AI当然可以做。未来会怎么发展?付不起高价人类咨询师费用的人,用AI做心理咨询,这也是进步——以前他们享受不到这样的服务。对用研来说也一样,语音转录这类工作已经不需要现场速记了。虽然像这样直接替代的例子还比较少,但整体上,用研要做的事情、价值和定位都会发生变化。

当问到这个问题时,很多人可能会想着“看时间节点”——某个时间段内还不会替代,或者分场景来看。但从长期来看,影响一定会非常大。

Ilya Sutskever的观点

用Ilya Sutskever的一段话作结尾。Ilya可以被称作“GPT之父”——没有他就不会有GPT这样的东西存在。他很早就加入OpenAI,导师是刚获得诺贝尔物理学奖的Hinton。他和导师坚持了很多年做神经网络、深度学习,一路发展到今天,有了大语言模型和层出不穷的模型。

2025年他在多伦多大学的演讲中说:“AI会不断变强,直到有一天它能做我们能做的所有事情——不仅是部分,而是全部。任何你我能学习的技能,AI将来也能够掌握。你可能会问我怎么敢这么确定。因为我们每个人的大脑本质上就是一个生物计算机,而AI是数字计算机。如果大脑能做的事,为什么数字大脑不能?”

这其实就是神经网络的基本原理。大模型几十亿、几百亿、几千亿的参数,把它理解成神经元,跟人脑神经元的数量差别并不大。现在最大的差别在于能耗——人脑可能十几瓦的能耗就能思考很多事情,AI被诟病的一点就是太耗电。但这个差距未来也可能会发生变化。

他还说:“你可以不关心整治,但整治迟早会关心你。AI也一样,甚至程度更深。所以不要回避它。哪怕只是用AI观察它今天能做什么,你就能慢慢形成直觉。这种直觉会越来越清晰。等到未来一两年后,我们今天讨论的很多事情就不再是空想,而是真实发生在眼前的事实。”

Ilya是激进派。他离开OpenAI后创建了SSI——Safe Super Intelligence,担心AI会反过来控制人类,所以希望有一个超级安全的超级智能。他提到未来一两年就会发生很大的变化。

最后还有一句:“最终,没有任何文字、论文或解释,比得过你亲眼所见、亲身体验的力量。”

这句话最能帮助大家去理解AI未来究竟会带来什么样的影响。

发展建议

AI时代可以做哪些事情:

  • 主动尝试新工具。各家大模型推出的新功能,都值得去试一试。
  • 提升AI素养。
  • 发挥人文关怀。
  • 持续迭代、优化、反思,不断完善与AI的协作流程。

(完)

来源:https://www.53ai.com/news/LargeLanguageModel/2025082870341.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。