首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!

摘要

新智元报道 什么?! GPT-5.6 Sol,竟是隐藏的「视觉大师」。 最近,第三方视觉评测机构Roboflow,把GPT-5.6 「全家桶」拖进自家VLM基准跑了一圈。 测试的内容,都是最实在的活儿:找东西、数东西、认字、抽信息。 仅在目标检测这项,上一代GPT-5.5只拿到13.8分。这个分数,在视觉模型圈里基本等于交白卷。 这次Sol冲到了46.2,三倍还多。 Roboflow项目负责人Sk...

GPT Sol 上一代GPT 5美分 https com 新智元报道 竟是隐藏的 视觉大师 第三方视觉评测机构Roboflow
2026-08-18 1 阅读 约6分钟阅读 新智元
分享:
字号:
新智元报道 什么?! GPT-5.6 Sol,竟是隐藏的「视觉大师」。 最近,第三方视觉评测机构Roboflow,把GPT-5.6 「全家桶」拖进自家VLM基准跑了一圈。 测试的内容,都是最实在的活儿:找东西、数东西、认字、抽信息。 仅在目标检测这项,上一代GPT-5.5只拿到13.8分。这个分数,在视觉模型圈里基本等于交白卷。 这次Sol冲到了46.2,三倍还多。 Roboflow项目负责人SkalskiP直言,「GPT-5.6 Sol是OpenAI有史以来最强的视觉模型」! GPT-5.6「超大杯」 OpenAI最强视觉AI 一直以来,目标检测是GPT系列的重灾区。任务很简单:就是让模型在图上把每个东西框出来。 上一代GPT-5.5的表现,基本等于「知道图里有东西,但框哪儿全靠蒙」。 GPT-5.6 Sol分数,直接飙涨至46.2,三倍多。 更有意思的是,Terra和Luna也紧跟在后面,44.7和43.3。 值得一提的是,Luna是这一代里最便宜的那档,它的检测分照样把上一代旗舰按在地上摩擦。 在计数方面,分数同样在涨。 Sol的准确率从GPT-5.5的64.9%升到73%,Terra和Luna分别是67.6%和66.2%。 那么,GPT-5.6具体强在哪? 文档版面识别最亮眼,标题、正文、表格、插图、签名,Sol都能干净地圈出来。 这件事对做合同、发票、报表处理的人来说不是小事:几乎所有文档流水线的第一步,都是先找到「该看哪一块」,再去认字。 就连密集场景,GPT-5.6也扛住了。 药片、鸡蛋这类几十个同款物体挤在一起的图,是VLM的传统翻车现场。 因为大模型画框,是一个坐标一个坐标地把数字打出来,东西越多,输出越长,漏掉、重复、坐标写飞的概率就越高。 甚至还有更刁的:一张靶纸,只让它数落在指定环数区域里的弹孔。 Sol直接做对了,它不仅知道要数什么,还知道规则管到哪儿为止。 不得不说,这一块的进步是实打实的。 全能?不存在的 最反常识的一段在这儿:Sol的认字能力,是退步的。 OCR整段转写,Sol拿90.7%,比GPT-5.5的91.2%低了半个点,差别不大。 但「定向提取」这一项,不要全文,只要那一条信息,比如把发票上的日期揪出来,Sol只拿下了82.5%,GPT-5.5 是87.6%,掉了5个点。 它不是不认字。手写笔记它能整段转写,也能准确挑出日期,脏轮胎弧面上印的尺寸编号它读得出来。 还有,冰球比赛直播画面里的实时比分,它能按你指定的格式吐出来。 翻车的是药板上那行有效期:字小、竖排、低对比度、还有反光。 左右滑动查看 一个能读懂比赛转播画面的模型,却读不出你手里那盒药什么时候过期。 OpenAI承认了 图一大框就飘 在部分图片上,Sol返回的检测框会飘到画面里毫不相干的地方。 跟真实物体几乎零重叠,而且这些框往往排得异常整齐:一条直线,或者均匀分布的一组。 Roboflow把这些样例发给了OpenAI。对方的回复很干脆:Sol在图片尺寸达到2000×2000像素左右或更大时,会变得不稳定,推理档位调得越低,越不稳定。 解法有两个。一是调高推理档位,稳是稳了,但Token用量、延迟、账单全跟着涨。 二是最土也最有效的那个:在发给API之前,先把图缩小或者裁一刀。 再来看整个账单,Roboflow实测下来的成本和速度: Sol:约2.5美分/张,约10秒;Terra:约1美分/张,约6秒;Luna:不到0.5美分/张,约5秒 而Gemini 3.5 Flash每张0.8美分,比Sol便宜三分之二,检测和计数在这套基准上还继续领先。 面对高频、大批量的检测计数任务,Gemini Flash仍是「性价比之王」。 所以,GPT-5.6 Sol这次真正让人意外的,是视觉能力正在从「看懂一张图」,跨进「真正干视觉的活」。 找目标、画框、计数、理解空间关系、拆文档版面。 这些过去更像是专用视觉模型的地盘,如今正在被大模型一点点吃掉。 视觉大模型的下半场,已经从「能不能看懂」卷向了「干活准不准」。 GPT-5.6亮出了肌肉,但性价比的战争,才刚刚开始。 参考资料: https://blog.roboflow.com/openai-gpt-5-6/ https://x.com/josephofiowa/status/2089430540864909719?s=20 编辑:桃子 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱