👁️

商汤日日新 深度评测

SenseNova多模态大模型平台,计算机视觉与自然语言深度融合,覆盖图像视频文本的全栈AI能力

🚀 访问官网 🔍 探索更多工具

工具简介

商汤日日新(SenseNova)是商汤科技于 2023 年 4 月发布的大模型平台,2024 年升级至 SenseNova 5.5 版本。商汤在计算机视觉领域深耕超过十年,拥有全球最大的 CV 专利组合之一(超过 8000 项),这赋予了日日新平台在视觉理解上的深厚底子。与其他大模型"先有语言、再加视觉"的叠罗汉式演进不同,SenseNova 从架构设计之初就将视觉和语言作为同等重要的两种模态进行联合建模——这使得它在看图说话这类任务中能达到更精确的视觉-语言对齐。

SenseNova 平台的定位是"大模型即服务"(MaaS),通过商汤大装置(SenseCore)提供从训练到推理的全链路支持。平台覆盖了约 30 个经过预训练的行业专属模型,囊括金融、医疗、自动驾驶、遥感测绘和工业质检等场景。特别值得一提的是日日新在遥感影像分析上的能力——它可以自动识别卫星图像中的建筑物类型、道路分布和植被覆盖率,在城市规划和灾害评估中已经有政府部门在试点使用。截至 2026 年,SenseNova 平台已服务超过 3000 家企业客户,日均处理超过 10 亿张图像推理请求。

✨ 优劣势分析

👍 优点

  • 计算机视觉的工业级精度和可靠性:商汤在人脸识别、物体检测和图像分割等 CV 核心任务上拥有十余年的工程积累,日日新在工业质检(如 PCB 板缺陷检测准确率 99.3%)和自动驾驶感知中能达到车规级甚至工规级的精度
  • 专业的遥感与地理空间分析能力:在地理信息、农业监测和城市管理领域,日日新的卫星图/无人机影像分析能力在国内大模型中几乎无竞品可比,可直接输出带有地理坐标的结构化分析结果
  • 大装置(SenseCore)的底层算力保障:商汤自建的 SenseCore 拥有超过 3 万张 GPU,是亚洲最大的 AI 算力中心之一,训练和推理的算力供给在物理层面有硬性保障

👎 不足

  • 消费端产品存在感薄弱:日日新平台主要面向 B 端客户,普通消费者几乎感受不到商汤 AI 的存在,品牌认知度在 C 端市场几乎为零
  • 通用文本对话能力与头部模型差距明显:虽然在视觉任务上表现优异,但日日新的纯文本对话、写作和推理能力与 GPT-4o 和 Claude 3.5 存在明显代差,不适合作为通用聊天助手
  • 定价策略透明度不足:企业客户之间的价格差异极大,且部分核心功能的计费规则复杂(按调用次数、按图片像素、按模型规格等多种维度叠加),中小客户难以理解真实成本

🎯 适用场景

💡 使用建议

🔄 同类替代推荐

如果你想了解商汤日日新的替代品,以下工具也值得关注:

工具简介

商汤日日新(SenseNova)是商汤科技于 2023 年 4 月正式发布的多模态大模型平台,2025 年已迭代至 SenseNova V6 版本。与大多数从纯文本起步、再逐步增加视觉能力的通用大模型不同,日日新从设计之初就确立了"原生多模态融合"的技术路线——视觉和语言作为同等重要的两种模态进行联合建模。平台底层依托商汤自建的 SenseCore 大装置(拥有数万张 GPU 的亚洲最大 AI 算力中心之一),提供从模型训练到推理部署的全链路"大模型即服务"(MaaS)能力。日日新平台覆盖了约 30 个经过行业数据预训练的垂直模型,涉及金融、医疗、自动驾驶、遥感测绘、工业质检等领域。2025 年发布的 V6 版本引入了"全局记忆"能力,支持长达 10 分钟的视频全帧率解析和跨模态推理,并在空间理解与推理任务上取得突破。截至 2026 年,日日新已服务超过 3000 家企业客户。

核心功能

多模态对话与理解:日日新支持文本、图像、视频和音频的多模态输入。用户可以上传一张图表、一段监控视频或一份 PDF 文档,模型能对其中内容进行描述、分析和推理。V6 版本在多模态基准测试中表现突出,尤其在图表理解和空间关系推理方面达到行业领先水平。

视觉生成能力:平台内置文生图、图生图、信息图自动生成和图文交错排版等功能。与独立 AI 绘画工具不同的是,日日新的视觉生成与语言理解深度耦合——例如,用户提交一段产品参数文本,系统不仅能生成对应的信息图表,还能自动设计合理的版式和配色方案。

视频理解与生成:V6 版本支持最长 10 分钟视频的全帧率解析,模型能够识别视频中的物体、动作、场景切换和人物交互。在数字人视频生成方面,日日新可根据文本脚本和一张人物照片,自动生成带有口型同步和自然表情的数字人播报视频。

行业预训练模型:平台提供约 30 个行业垂直模型,覆盖遥感影像分析(自动识别建筑物类型、道路和植被)、工业视觉质检(PCB 板缺陷检测)、医疗影像辅助诊断、自动驾驶感知标注等场景。企业可直接在预训练模型基础上微调,大幅降低从零训练的算力和时间成本。

开发者工具与 API:日日新通过 SenseCore API 提供标准化的模型调用接口,支持 Python 和 RESTful 方式接入。开发者可自行选择模型规格、调整推理参数,并在商汤云端完成训练和部署,无需自建 GPU 集群。

上手体验

企业用户通过商汤官网申请 SenseNova 平台账号后,进入统一的控制台界面。控制台左侧为导航栏,列出对话、视觉、视频、训练等模块入口。首次使用时,系统会引导用户选择行业场景,推荐匹配的预训练模型。例如,选择"工业质检"场景后,平台自动加载 PCB 缺陷检测模型并提供示例图片和 API 调用代码。对话模块的操作体验类似 ChatGPT——输入文字或上传图片/文档后,模型在数秒内返回回答。模型训练环节稍微复杂:用户需上传标注数据集、选择基础模型和训练参数(学习率、epoch 数等),提交后在 SenseCore 后台异步训练,完成后通过邮件通知。对于非 AI 背景的企业用户来说,预训练模型的"开箱即用"体验流畅;但从零训练或深度微调的流程仍需要一定的机器学习工程经验。

价格方案

版本适用客户定价模式核心功能
免费试用开发者/小团队有限调用次数基础对话、文生图、API 测试
企业版中大型企业按调用量/模型规格/部署方式计费,官网未公开固定价格全部功能、行业模型、专属训练、SLA 保障
定制版大型机构/政府项目制定价私有化部署、定制模型训练、数据隔离、专属支持

日日新的定价因客户规模和使用量差异较大,计费维度涉及调用次数、图片像素量、模型规格和部署方式等,需联系商务获取报价。价格以官网实时信息为准。

优点与局限

优点:计算机视觉的工业级精度——商汤在 CV 领域十余年技术积累使日日新在视觉任务上拥有深厚的工程可靠性;原生多模态融合架构避免了"先加文本再加视觉"的拼接式方案带来的模态对齐损失;行业预训练模型丰富(约 30 个),覆盖了工业、医疗、遥感等真实商业场景;SenseCore 算力基础设施提供了硬性的训练和推理保障,避免了第三方云服务的不确定性。

局限:消费端品牌认知度低,普通用户几乎感受不到商汤 AI 的存在;通用纯文本对话和写作能力与 GPT-4o、Claude 等头部模型存在差距,不适合作为通用聊天助手;定价透明度不足,中小客户难以预估真实成本;生态开放度有限,第三方插件和社区贡献相比 OpenAI 和 HuggingFace 生态仍有较大差距;部分功能的文档和示例不够完善,开发者上手效率受影响。

适合人群

  • 制造业企业的 AI 团队:需要高精度工业视觉质检方案,且希望基于预训练模型快速落地。
  • 智慧城市和地理信息部门:利用遥感影像分析能力进行城市规划、农业监测和灾害评估。
  • 自动驾驶公司的数据团队:使用日日新自动标注路测数据,大幅降低人工标注成本。
  • 金融和医疗机构的技术部门:需要符合数据合规要求的多模态 AI 能力,且倾向国内厂商方案。

同类工具对比

维度商汤日日新通义千问(阿里)GPT-4o
视觉能力工业级,多行业专精通用视觉理解通用视觉理解
行业模型✅ 30+ 预训练模型有限
多模态融合原生融合逐步追加逐步追加
文本对话中等优秀顶级
私有化部署支持部分支持企业版支持
算力保障自建 SenseCore阿里云Azure
适合场景工业视觉/遥感/质检电商/办公/通用通用对话/内容创作

常见问题

Q: 日日新是一个聊天机器人吗?
A: 不完全是。日日新是一个多模态大模型平台,聊天对话只是其能力之一。它更核心的定位是面向 B 端企业的视觉 AI 能力底座,覆盖图像识别、视频分析、遥感解译等专业场景。

Q: 个人用户可以使用日日新吗?
A: 日日新主要面向企业客户。个人用户如需体验商汤的 AI 能力,可以尝试商汤秒画(AI 绘画)或商汤其他消费级产品。

Q: 日日新和 GPT-4o 相比如何?
A: 在通用文本对话和内容创作方面,GPT-4o 表现更优。但在工业视觉质检、遥感影像分析等专业视觉任务上,日日新的行业定制深度和工程精度更有优势。

Q: 日日新 V6 的"全局记忆"是什么?
A: 传统大模型处理长视频时通常采用抽帧方式,容易丢失细节。"全局记忆"指模型能对最长 10 分钟视频进行逐帧解析,并在时间维度上建立事件关联,从而回答复杂的跨时间推理问题。

Q: 日日新支持私有化部署吗?
A: 支持。对于有数据安全和合规要求的企业,商汤提供私有化部署方案,可将模型和能力部署在客户自有的数据中心内。

本文基于公开资料整理,价格与功能以官网实时信息为准。