首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

从回答问题到把事办完,消费Agent还缺什么?飞猪新一代 AI 产品 V10 的一次探索

2026-08-07 1 阅读 约10分钟阅读 InfoQ 中文站
分享:
字号:
信息检索和Coding,是过去两年率先找到产品市场匹配的AI应用方向。前者改变了人们获取信息的方式,后者则让模型开始理解目标、调用工具并执行任务。 但类似的突破尚未发生在消费领域。AI可以完成越来越复杂的代码任务,却仍然很难稳定地处理一次涉及实时供给、交易和后续履约的消费需求。 在上周的飞猪新一代AI产品评测会上,飞猪CTO陈烨将这种落差放到了整个AI产业的价值链中观察。 在他看来,当前行业的注意力和价值仍然高度集中在基础模型、GPU、算力基础设施和Token层,应用层尚未出现足够多能够承接价值的产品。这种结构并不是一个可持续的终局。一个更加健康的AI生态,价值应该逐渐向下游延伸,进入编排层和应用层。 这也把讨论带向了一个更具体的问题:Coding已经证明,应用可以在基础模型之上建立独立价值;这种路径能否进一步进入旅行、电商等真实消费场景? 飞猪在评测会上展示的新一代AI产品V10,可以被看作对这一问题的一次阶段性探索:当AI从回答问题走向把事情办完,产品和工程体系还需要补齐什么? Coding已经找到PMF,消费Agent为什么还没有? 陈烨提到,AI产品正在经历从大模型、Chat、Coding,到Agent、自进化,再到PhysicalAI的发展过程。 当前行业的主要关注点正在进入Agent阶段,下一步则可能走向能够利用工具和环境反馈持续进化的Agent。但消费Agent还没有取得与CodingAgent类似的进展。 陈烨认为,AgenticCoding给行业展示了一条重要路径:模型可以理解目标、调用工具,并在执行反馈中修正结果。Coding的一个特殊优势,是大量问题能够以相对封闭的方式进行验证。代码能否运行、测试能否通过,通常可以得到较为明确的判断。 消费场景则不同。一张机票是否合适,不只取决于价格,还可能涉及出发时间、中转地点、是否需要过境签、能否过夜以及航司偏好。两家酒店都可能真实存在,但哪一家更适合当前用户,还要结合位置、预算、同行人和个人偏好判断。 与此同时,机票和酒店都是高度时间化的商品。日期变化后,库存、价格、房型和可售状态都可能发生变化。交易完成后,还会进入值机、航变、退改和售后等履约环节。 从Coding走向消费场景,难点不只是模型能否理解需求,还包括数据能否实时更新、结果能否验证、供应链能否响应,以及交易后的履约能否继续完成。 V10想改变的,不只是一个AI入口 如果只看界面,飞猪V10最直观的变化,是增加了一个可以展开和收起的AI Panel。 在此前的版本中,用户需要主动进入一个独立的AI页面。到了V10,AI Panel可以出现在首页、酒店、机票、度假和订单等页面,并根据用户当前所在的场景提供相应的推荐问题和能力。 这不仅是入口位置的变化。更准确地说,飞猪正在尝试让AI从一个独立页面,进入搜索、交易和订单履约等具体场景。 V10将主要能力概括为“帮我想、帮我订、帮我办”。 “帮我想”对应旅行灵感和行程规划。例如,用户可以复制一篇社交平台上的旅行笔记,由系统解析其中的景点、美食和住宿信息,再结合飞猪的相关供给组织行程。 “帮我订”主要处理传统筛选方式不容易覆盖的复杂需求。例如,寻找能够看到故宫金顶、允许携带宠物,或者适合老人且不需要爬楼梯的酒店。 “帮我办”则进入交易之后的服务环节,包括值机选座、酒店升房、开发票、退款,以及处理同一行程中的关联订单。 从产品团队的解释看,这三种能力分别对应旅行过程中的不同服务类型:灵感与规划、搜索与预订,以及交易后的履约服务。其中,值机等任务可能需要等待航司开放办理,持续时间从数小时到数周不等。V10因此增加了长程任务的状态和进度展示。 这意味着,产品面对的已不只是一次即时问答,还包括需要持续记录和更新状态的任务。产品经理在分享中强调了两条原则:第一,提供给用户的数据和商品要保证“真实可达”;第二,不为了AI而AI,优先处理原有GUI难以完成,或者原来需要多步操作、现在可以通过一句话完成的事情。 “真实可达”和“是否真正降低用户操作成本”,构成了V10当前选择AI场景的两条主要标准。 AgentLoop的核心不是更自由,而是“受约束的自主性” 与产品从独立问答走向跨场景服务同步,飞猪的算法架构也在发生变化。 飞猪早期的“问一问”采用了Multi-Agent架构,并在模型能力相对有限的阶段使用较强的Workflow编排,以保证结果稳定。 随着模型能力提高,团队开始向ReAct式的AgentLoop迁移,希望让能力更完整的Agent承担更多需求理解、自主决策和工具调用工作。 飞猪策略是:“架构上做减法,模型层面做加法。”但这并不意味着可以无限增加Agent的思考和反思轮次。如果一个杭州五日游规划需要经过多轮思考和反思,五分钟甚至十分钟后才能返回结果,用户很可能已经离开。 因此,飞猪在在线推理中采用较轻的验证方式,优先检查不可接受的错误;一些更复杂的路线和时空合理性问题,则通过离线建设的线路库、规则引擎和后续训练处理。 消费Agent的工程问题,不只是如何让模型思考得更多,还要判断哪些问题必须在线计算、哪些结果可以提前验证,以及哪些错误必须由规则和工具拦截。 从商品白名单到后训练,行业Know-how如何进入Agent 飞猪算法团队分享的一个具体机制,是商品短别名。 酒店、房型和机票等商品都有真实ID。尤其是机票,背后连接实时变化的系统,商品标识可能很长。如果直接让模型在推理或训练过程中处理这些ID,就可能出现字符生成错误。 飞猪的处理方式,是将工具返回的商品映射为A1、A2等较短的别名。模型在当前任务中引用这些别名,推理完成后,再由系统回填真实商品ID、标题、价格和库存。 模型能够选择工具实际返回的商品,但不能在白名单之外凭空产生一个商品。 这一做法体现出一个重要原则:能够由数据库、规则或者工具确定的信息,应尽量由确定性系统提供,而不是依赖模型自行生成。 模型负责理解需求和进行选择,工具与规则负责保证商品信息来自真实供给。 飞猪算法团队将Agent能力建设概括为三个阶段:Prompt、机制和训练。 第一阶段是Prompt。 早期Prompt往往采用命令式写法,例如要求模型先找目的地、再找交通、酒店和景点。随着任务和规则增加,Prompt会越来越长,模型对不同指令的注意力也可能变得不稳定。 团队正在尝试将命令式Prompt改为声明式Prompt:不再规定每一步必须怎样执行,而是告诉模型什么是一份好的行程规划、目标是什么、底线是什么,再让模型自主决定具体过程。 第二阶段是机制。 商品白名单、短别名、时空规则、数据沙箱和在线轻验证,都属于这一层。它们的主要作用,是限制模型在不能出错的地方自由发挥。 第三阶段是训练。 团队希望通过后训练,将更多领域知识和评价标准逐渐内化到模型中,使Prompt变短,并减少对人工规则的依赖。 其Reward Model主要覆盖四个维度:信息真实性、用户需求和偏好、时空合理性,以及结果的完整性和多样性。 在能够使用代码和规则评价的部分,团队会尽量采用相对确定的标准,降低纯模型评判过于主观、被模型寻找评分漏洞的可能。 如果用一句话概括这套方法,它更接近一种“受约束的自主性”:让模型在适合自主决策的空间中发挥能力
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱