ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

商汤科技开源SenseNova U1.5-Lite-Preview:多模态能力升级,赋能创作新体验

时间:2026-08-03 22:36:57来源:互联网编辑:快讯

商汤科技近日宣布,面向全球用户开源轻量级统一多模态模型SenseNova U1.5-Lite-Preview。这一版本基于此前发布的SenseNova U1架构进行系统性升级,在保持8B-MoT模型规模的前提下,实现了4K分辨率图像生成、更精细的视觉质感、复杂文字排版及可持续迭代的图像编辑能力,标志着原生统一多模态技术向真实创作场景迈出关键一步。

与前代模型相比,U1.5-Lite-Preview在四大核心方向实现突破:原生支持4K分辨率图像生成,在自然风光、商业海报等超大画幅场景中可呈现真实光影与材质细节;通过优化局部纹理建模算法,显著提升画面中文字、图标等精细元素的清晰度与稳定性;强化中英文双语生成能力,支持复杂版式设计,在信息图、杂志排版等任务中实现文字与视觉元素的精准对齐;引入encoder-free视觉建模方式,减少信息压缩损失,使图像编辑过程更可控,避免非编辑区域意外改动。

在复杂创作场景中,该模型展现出独特的优势。例如,在生成"WAIC发展历程长卷"时,通过3880字的超长提示词,模型以中国传统山水画的散点透视手法,将上海城市景观、智能工厂、机器人等元素融合在10:3比例的4K画布中,放大后仍能清晰呈现建筑纹理与文字标注。在文字生成测试中,模型可准确处理中英双语混排、拉丁文标注等复杂需求,在杂志内页生成任务中实现字体风格、段落间距的自动化适配。

图像编辑能力的升级尤为显著。通过统一架构设计,模型将视觉理解、目标定位、约束推理与像素生成整合为单一流程,支持"哪里不对改哪里"的可持续迭代创作。开发者演示案例显示,用户可先生成基础画面,再通过自然语言指令逐步调整文案内容、元素位置或整体风格,无需重新采样。针对专业设计需求,模型支持多参考图元素提取、单图条件创作等高级功能,例如从不同图片中分别提取人物、场景与字体风格,融合生成新的营销海报。

为降低创作门槛,商汤同步推出实验性Prompt Enhance Skill工具,可将用户简短描述自动转化为包含主体、布局、风格等要素的完整创作方案。例如,用户输入"生成一张复古风格的产品解析图",工具会自动补充"五章结构、中英双语对照、博物学标本图鉴风格"等详细约束,帮助模型生成更符合预期的结果。

目前,SenseNova U1.5-Lite-Preview已通过GitHub、Hugging Face及魔搭社区开源,提供模型权重、推理代码及使用文档。商汤同时透露,面向专业用户的交付级创作模型U1 Pro正在邀测阶段,将在近期开放公众服务。该系列模型的持续迭代,体现了商汤在原生统一多模态架构上的技术积累,其通过单一模型实现视觉理解、推理与生成的能力,为AI创作工具开发提供了新的技术路径。

作为人工智能软件领域的领军企业,商汤科技长期致力于通用人工智能技术研究,业务覆盖生成式AI、视觉AI及创新业务领域。其自主研发的AI大装置SenseCore,整合了算力、算法与平台能力,支撑起"商汤日日新SenseNova"大模型体系的发展。此次开源的U1.5系列模型,进一步丰富了商汤在多模态内容生成领域的技术布局,为开发者与创作者提供了更高效的AI工具链。

更多热门内容
年薪最高340万仍难觅人才,AI安全研究:人才短缺成最大发展瓶颈
METR 在 AI 行业中扮演着重要角色,与 OpenAI、Anthropic、Google 和 Meta 等公司保持密切合作,独立评估最新AI 模型的能力,并研究其可能带来的风险,为外界提供相对客观的分…

2026-08-03

国产开源DeepSeek模型表现亮眼,单日8万亿Token,OpenAI降价难敌性价比优势
北京时间8月3日,海外开发者开源项目团队OpenCode发文称,其平台上DeepSeek V4Flash的调用量大幅飙升,单日处理达8T(万亿)Token。 在成本端,即使OpenAI已将GPT-5.6 …

2026-08-03

DeepSeek单日8万亿Token调用量登顶 中国AI大模型领跑全球引OpenAI降价应对
DeepSeek V4 Flash在代码开发这一垂直场景中单日消耗8万亿Token,意味着其已经成为大量开发者的默认编程助手。即便OpenAI将Luna价格下调80%,DeepSeek V4 Flash在其…

2026-08-03

汇川机器人服务商怎么选?祯通智能等优质伙伴助力制造业降本增效
总的来说,想要选到专业靠谱的汇川机器人服务商,大家可以按照我们上面说的选购指南,从授权资质、产品配套能力、技术服务能力、成本优势几个维度去筛选,而祯通智能科技(杭州)有限公司作为国内深耕汇川产品多年的专业服…

2026-08-03

自变量机器人开源HOST框架:观人类视频即可习得新技能,学习效率大提升
如此一来,机器人执行到每一步时,看到的永远都是和任务进度对齐的那一帧。在人机视频训练阶段,机器人进一步学习人类演示视频,将人类执行任务的过程转化为机器人视角下的任务结果,再根据目标结果推理完成任务所需的动作,…

2026-08-03