工具简介
商汤日日新(SenseNova)是商汤科技于 2023 年 4 月正式发布的多模态大模型平台,2025 年已迭代至 SenseNova V6 版本。与大多数从纯文本起步、再逐步增加视觉能力的通用大模型不同,日日新从设计之初就确立了"原生多模态融合"的技术路线——视觉和语言作为同等重要的两种模态进行联合建模。平台底层依托商汤自建的 SenseCore 大装置(拥有数万张 GPU 的亚洲最大 AI 算力中心之一),提供从模型训练到推理部署的全链路"大模型即服务"(MaaS)能力。日日新平台覆盖了约 30 个经过行业数据预训练的垂直模型,涉及金融、医疗、自动驾驶、遥感测绘、工业质检等领域。2025 年发布的 V6 版本引入了"全局记忆"能力,支持长达 10 分钟的视频全帧率解析和跨模态推理,并在空间理解与推理任务上取得突破。截至 2026 年,日日新已服务超过 3000 家企业客户。
核心功能
多模态对话与理解:日日新支持文本、图像、视频和音频的多模态输入。用户可以上传一张图表、一段监控视频或一份 PDF 文档,模型能对其中内容进行描述、分析和推理。V6 版本在多模态基准测试中表现突出,尤其在图表理解和空间关系推理方面达到行业领先水平。
视觉生成能力:平台内置文生图、图生图、信息图自动生成和图文交错排版等功能。与独立 AI 绘画工具不同的是,日日新的视觉生成与语言理解深度耦合——例如,用户提交一段产品参数文本,系统不仅能生成对应的信息图表,还能自动设计合理的版式和配色方案。
视频理解与生成:V6 版本支持最长 10 分钟视频的全帧率解析,模型能够识别视频中的物体、动作、场景切换和人物交互。在数字人视频生成方面,日日新可根据文本脚本和一张人物照片,自动生成带有口型同步和自然表情的数字人播报视频。
行业预训练模型:平台提供约 30 个行业垂直模型,覆盖遥感影像分析(自动识别建筑物类型、道路和植被)、工业视觉质检(PCB 板缺陷检测)、医疗影像辅助诊断、自动驾驶感知标注等场景。企业可直接在预训练模型基础上微调,大幅降低从零训练的算力和时间成本。
开发者工具与 API:日日新通过 SenseCore API 提供标准化的模型调用接口,支持 Python 和 RESTful 方式接入。开发者可自行选择模型规格、调整推理参数,并在商汤云端完成训练和部署,无需自建 GPU 集群。
上手体验
企业用户通过商汤官网申请 SenseNova 平台账号后,进入统一的控制台界面。控制台左侧为导航栏,列出对话、视觉、视频、训练等模块入口。首次使用时,系统会引导用户选择行业场景,推荐匹配的预训练模型。例如,选择"工业质检"场景后,平台自动加载 PCB 缺陷检测模型并提供示例图片和 API 调用代码。对话模块的操作体验类似 ChatGPT——输入文字或上传图片/文档后,模型在数秒内返回回答。模型训练环节稍微复杂:用户需上传标注数据集、选择基础模型和训练参数(学习率、epoch 数等),提交后在 SenseCore 后台异步训练,完成后通过邮件通知。对于非 AI 背景的企业用户来说,预训练模型的"开箱即用"体验流畅;但从零训练或深度微调的流程仍需要一定的机器学习工程经验。
价格方案
| 版本 | 适用客户 | 定价模式 | 核心功能 |
|---|---|---|---|
| 免费试用 | 开发者/小团队 | 有限调用次数 | 基础对话、文生图、API 测试 |
| 企业版 | 中大型企业 | 按调用量/模型规格/部署方式计费,官网未公开固定价格 | 全部功能、行业模型、专属训练、SLA 保障 |
| 定制版 | 大型机构/政府 | 项目制定价 | 私有化部署、定制模型训练、数据隔离、专属支持 |
日日新的定价因客户规模和使用量差异较大,计费维度涉及调用次数、图片像素量、模型规格和部署方式等,需联系商务获取报价。价格以官网实时信息为准。
优点与局限
优点:计算机视觉的工业级精度——商汤在 CV 领域十余年技术积累使日日新在视觉任务上拥有深厚的工程可靠性;原生多模态融合架构避免了"先加文本再加视觉"的拼接式方案带来的模态对齐损失;行业预训练模型丰富(约 30 个),覆盖了工业、医疗、遥感等真实商业场景;SenseCore 算力基础设施提供了硬性的训练和推理保障,避免了第三方云服务的不确定性。
局限:消费端品牌认知度低,普通用户几乎感受不到商汤 AI 的存在;通用纯文本对话和写作能力与 GPT-4o、Claude 等头部模型存在差距,不适合作为通用聊天助手;定价透明度不足,中小客户难以预估真实成本;生态开放度有限,第三方插件和社区贡献相比 OpenAI 和 HuggingFace 生态仍有较大差距;部分功能的文档和示例不够完善,开发者上手效率受影响。
适合人群
- 制造业企业的 AI 团队:需要高精度工业视觉质检方案,且希望基于预训练模型快速落地。
- 智慧城市和地理信息部门:利用遥感影像分析能力进行城市规划、农业监测和灾害评估。
- 自动驾驶公司的数据团队:使用日日新自动标注路测数据,大幅降低人工标注成本。
- 金融和医疗机构的技术部门:需要符合数据合规要求的多模态 AI 能力,且倾向国内厂商方案。
同类工具对比
| 维度 | 商汤日日新 | 通义千问(阿里) | GPT-4o |
|---|---|---|---|
| 视觉能力 | 工业级,多行业专精 | 通用视觉理解 | 通用视觉理解 |
| 行业模型 | ✅ 30+ 预训练模型 | 有限 | ❌ |
| 多模态融合 | 原生融合 | 逐步追加 | 逐步追加 |
| 文本对话 | 中等 | 优秀 | 顶级 |
| 私有化部署 | 支持 | 部分支持 | 企业版支持 |
| 算力保障 | 自建 SenseCore | 阿里云 | Azure |
| 适合场景 | 工业视觉/遥感/质检 | 电商/办公/通用 | 通用对话/内容创作 |
常见问题
Q: 日日新是一个聊天机器人吗?
A: 不完全是。日日新是一个多模态大模型平台,聊天对话只是其能力之一。它更核心的定位是面向 B 端企业的视觉 AI 能力底座,覆盖图像识别、视频分析、遥感解译等专业场景。
Q: 个人用户可以使用日日新吗?
A: 日日新主要面向企业客户。个人用户如需体验商汤的 AI 能力,可以尝试商汤秒画(AI 绘画)或商汤其他消费级产品。
Q: 日日新和 GPT-4o 相比如何?
A: 在通用文本对话和内容创作方面,GPT-4o 表现更优。但在工业视觉质检、遥感影像分析等专业视觉任务上,日日新的行业定制深度和工程精度更有优势。
Q: 日日新 V6 的"全局记忆"是什么?
A: 传统大模型处理长视频时通常采用抽帧方式,容易丢失细节。"全局记忆"指模型能对最长 10 分钟视频进行逐帧解析,并在时间维度上建立事件关联,从而回答复杂的跨时间推理问题。
Q: 日日新支持私有化部署吗?
A: 支持。对于有数据安全和合规要求的企业,商汤提供私有化部署方案,可将模型和能力部署在客户自有的数据中心内。