首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

开源国产8B模型,比肩闭源Image 2了!

摘要

开源国产8B模型,比肩闭源Image 2了! 十三 2026-08-25 14:53:26 来源: 量子位 金磊 发自 凹非寺 量子位 | 公众号 QbitAI 时隔仅仅 三周 ,国产生图模型,又进化了。 上回书到,这个生图模型是4K直出的,开源的,只有8B大小的。 这一次,它的 正式版本 来了!若是用三个词来概括,那就是—— 更完整,更准确,更稳定。 例如我们现在一口气把 九张 不同的食物照片丢...

SenseNova 量子位 Lite Image 接下来 开源国产8B模型 比肩闭源Image 2026 凹非寺 公众号
2026-08-25 1 阅读 约9分钟阅读 十三
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 开源国产8B模型,比肩闭源Image 2了! 十三 2026-08-25 14:53:26 来源: 量子位 金磊 发自 凹非寺 量子位 | 公众号 QbitAI 时隔仅仅 三周 ,国产生图模型,又进化了。 上回书到,这个生图模型是4K直出的,开源的,只有8B大小的。 这一次,它的 正式版本 来了!若是用三个词来概括,那就是—— 更完整,更准确,更稳定。 例如我们现在一口气把 九张 不同的食物照片丢给它: 并简单附上一句Prompt: 请将这九款美食拼成一张精美的食谱分享卡片。 原本各自拍摄、比例和背景都不一样的九张图片,一下子就被整整齐齐地设计到了一张图里;并且AI还精准识别出了每道菜品,同时还给它们适当加了美化处理,让图片整体变得更加养眼。 再来看一个 编辑图片 的例子。 我们在原图的基础上,用 “框选+标注” 的方式,把想要修改的图片局部细节给标了出来: AI在接到任务改完以后是这样: 可以明显看到,几个目标区域都按照要求发生了变化,但床、床头柜、玻璃杯、右侧柜体,包括整个卧室原来的空间关系都基本保留下来。 而这个AI,便是 商汤科技 这次正式开源的 SenseNova U1.5 Lite ,其亮点如下: 3-4k字符超长复杂指令遵循:能一次理解更长、更复杂的要求,同时处理主体、数量、位置、文字、布局和风格等多种约束,不容易漏细节。 更高质量的视觉生成:构图、色彩、材质、光影和细节更自然,整体完成度更高。 更可靠的原生图像编辑:改指定内容时更精准,同时更好地保持人物、结构、版式和其他区域不变。 更好的文字与复杂布局:中英文文字、海报、信息图和多文本排版更准确,也更擅长组织复杂画面。 更精细的视觉控制:支持框选、标记和多图参考等方式,更准确地指定“改哪里、改什么”。 Native 4K高分辨率输出:直接生成4K高清图,同时保住构图、纹理、小字和光影等细节。 而且啊,SenseNova U1.5 Lite依旧保持了 8B 的大小,还能在复杂排版与精准编辑等核心的场景上比肩闭源的GPT-Image-2: 如果说三周前的SenseNova U1.5 Lite Preview版本是验证一个统一模型能够把视觉能力扩展到哪里。 那么到了今天的正式版本,商汤科技则是进一步验证这些能力能否分别得到强化,再重新统一到一个轻量级模型中,并稳定进入真实创作流程。 效果怎么更强了?看细节 接下来,我们继续拿效果来说话。 第一个任务,先来一个考验信息组织能力的实测,主题是从可可豆到巧克力。 要在一张竖版信息图里,需要同时塞进Harvesting、Fermentation、Roasting、Grinding、Tempering到Finished Chocolate六个阶段。 每个阶段既有文字解释,也有对应的可可果、发酵箱、烘焙设备、研磨装置、巧克力浆等视觉元素,而且六层内容还得顺着版式一路往下走。 从最终的效果来看,SenseNova U1.5 Lite已经做到了可以 组织一整套视觉表达 ,包括长文本、多层级结构、插画、数字顺序和版式关系。 这种能力再落到更日常的内容生产里,就变成了类似做 社交媒体封面 这类任务。 比如下面这张图: 这类图看上去虽然元素不算多,但难点就在于要做到“封面感”这三个字。 标题要立得住,主体要足够抓眼,三只狗的造型、服饰和表情既要各有区分,又不能彼此打架;同时,整张图还得维持住统一的时尚调性,而不是变成几个可爱元素拼在一起。 从最后的结果来看,正式版在这类应用型视觉任务上,已经开始更接近一张能够直接拿来用的封面作品。 接下来,我们再来看下SenseNova U1.5 Lite的 局部编辑 能力。 Prompt是这样的: 仿照参考图的折纸拼贴视觉,生成一张社区共享厨房运营模式信息图。 乍一眼看过去,两张图片整体的结构和风格几乎是没有变化的,因为我们的要求就是“仿照参考图”。 仔细看细节,原来属于教育项目的元素被替换成厨师帽、砧板、菜谱等厨房相关视觉,左侧的信息也跟着变成Membership Fees、Commercial Rental、Cooking Classes、Market Sales和Event Hosting。 在这类任务中,模型得先分辨出一张图里哪些东西属于主题内容,哪些东西属于更底层的设计逻辑。然后保留后者,再让新内容沿着原来的视觉语言长出来。 不过若是 参考图从一张变成了多张 ,那任务难度就会更大了。 例如我们输入下面这三张参考图片: 然后附上这样的Prompt: Edit Image 1 using Images 2 and 3 as content references rather than pasted rectangular images. Replace the framed band silhouettes with all five Radiohead members from Image 2 , transformed into the poster’s distressed monochrome halftone style. Reflow the four lower feature blocks into a compact left column and add an ESSENTIAL LISTENING list on the right using Image 3 only for wording and hierarchy. Render the new list directly on the same continuous black distressed background with matching off -white type ; do not retain any white or cream card background. Preserve all original text and all other poster elements. 这次Prompt更细节的一点是,第三张参考图只允许参考内容和信息层级,原来的白色卡片背景不能一起搬过来,新歌单需要直接长在海报原来的黑色做旧背景上。 SenseNova U1.5 Lite给到的结果如下: 从结果来看,Radiohead五个人进入了原来的乐队区域,人物处理后的质感和整张海报基本接上了;左下方的信息重新压缩,ESSENTIAL LISTENING则直接融进右侧版面,没有留下一块突兀的白底。 而对于刚才给到的三张参考图来说,第一张负责版式和风格,第二张负责人物身份,第三张只负责文字内容和结构。模型必须先把这三件事分开理解,最后才能重新合成到一张图里。 但在真实设计工作里,还有一种需求没有前面这么复杂,却可能出现得更频繁—— 改几个字 。 这次我们在输入原始图片后,Prompt如下: 请将左下角深蓝色矩形信息栏内的展览时间与地址详情,从 “JUNE
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱