智能AI
morning
我们仍然不知道人们如何真正使用人工智能
摘要
Additionally, exchanges that the researchers labeled as sensitive use—meaning ones with potentially harmful or restricted content, including sexual harassment and hate speech—dropped. That might sugge...
the
and
that
for
with
more
from
researchers
use
were
2026-08-18
1 阅读
约3分钟阅读
Eileen Guo
字号:
此外,研究人员标记为敏感用途的交流(即具有潜在有害或受限内容的交流,包括性骚扰和仇恨言论)也有所下降。这可能表明平台普遍部署了更有效的保障措施。人工智能观察站还发现,根据模型的不同,人工智能的使用看起来有很大不同。根据工具的不同,用户的主题、交互风格、对话结构以及敏感用例的可能性和类型也各不相同。例如,研究人员发现人们更频繁地使用 Grok 和 Gemini 进行信息检索。尤其是 Grok,它在新闻和政治信息方面尤其受欢迎,但它也是错误信息往往集中的地方。 (这与其他研究一致,其他研究也表明错误信息在 Grok 上很容易扩散。xAI 没有回应置评请求。)与此同时,人们更有可能转向 Anthropic 进行编码,转向 Gemini 进行社交和角色扮演用途,转向 ChatGPT 寻求家庭作业帮助。甚至同一型号的不同版本之间也存在差异。研究人员发现,当 ChatGPT 由 GPT-3.5 提供支持时,人们与 ChatGPT 的对话时间较短,而当使用 GPT-4o 时,人们与 ChatGPT 的对话时间更长且迭代次数更多——考虑到该版本因导致情绪成瘾而闻名,这是有道理的。然而,公司报告并没有倾向于捕捉到他们自己的模型中甚至内部的这些细微差别。 “没有哪家公司的报告能够讲述全部故事,”刚刚从麻省理工学院媒体实验室毕业的博士生 Shayne Longpre 说道,他与 Reuel 共同领导了这项研究。为了创建 AI 观测站,Reuel 和来自麻省理工学院、斯坦福大学、数据起源计划和其他机构的研究人员从之前研究收集的 7 个真实世界数据集中汇总了 85,633 个对话轮次(即用户提示和相应的 AI 响应)中的 24,521 个保守点。这些对话来自 2023 年至 2025 年间与 52 个不同模型交互的 5,000 位用户,包括 ChatGPT、Gemini、Claude 和 Grok。但与大型实验室本身可以访问的数据相比,这些对话只是杯水车薪。例如,最新的人类经济人工智能指数是基于对 100 万条克劳德对话的分析; OpenAI 关于人们如何使用 ChatGPT 的报告分析了 150 万个对话。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱