“视觉具身智能第一股”:半年营收增长58.7%,还没回到发行价
速腾聚创发布2025年中期业绩,上半年营收7.27亿元,同比增长58.7%,其中ADAS激光雷达收入5.71亿元,增长71.6%。公司净亏损收窄至2.16亿元,毛利率提升至17.9%。其机器人相关业务收入增长近三倍,已获多家车企定点。公司于2025年1月在港交所上市,发行价43港元,当前股价约34港元,仍低于发行价。市场关注其“视觉具身智能第一股”定位,但盈利压力与股价表现仍待观察。

每日 AI 快讯 · 实时追踪人工智能行业最新动态
速腾聚创发布2025年中期业绩,上半年营收7.27亿元,同比增长58.7%,其中ADAS激光雷达收入5.71亿元,增长71.6%。公司净亏损收窄至2.16亿元,毛利率提升至17.9%。其机器人相关业务收入增长近三倍,已获多家车企定点。公司于2025年1月在港交所上市,发行价43港元,当前股价约34港元,仍低于发行价。市场关注其“视觉具身智能第一股”定位,但盈利压力与股价表现仍待观察。
小鹏旗下机器人公司完成首轮融资,总额超9亿美元。该轮融资创下行业纪录,资金将用于人形机器人研发及量产推进。小鹏机器人主打家庭服务与工业场景,其技术路线强调具身智能与运动控制能力。市场分析认为,此次融资反映出资本对人形机器人赛道的高热度,同时该领域仍面临技术成熟度与商业化落地的双重挑战。
澜存科技于2025年成立,推出澜卡LC-1.7系列AI模组及配套智能平台,旨在降低AI硬件开发门槛。该模组基于ESP32-S3,集成主控、联网、语音及多种硬件接口,可外接屏幕、传感器、电机等。平台支持模型、音色、角色、记忆及Skill配置,用户无需编程背景,最快五分钟可创建线上智能体,半小时内让硬件实现语音对话及表情控制。目前客户已从AI玩具扩展至消费电子、智能家居、可穿戴设备和机器人领域。InfoQ实际测试显示,无软硬件开发经验者借助该模组、平台及AI编程工具,成功制作出可对话并带电子眼的AI毛绒玩具,以及能按指令动作的桌面机器人。测试也验证了平台对第三方硬件的兼容性,可通过Skill配置将云端Agent与本地物理动作连接。
LinkedIn工程师构建了一个多智能体AI代码审查平台,以解决大规模代码审查中依赖人工或现成工具效率低下的问题。该平台采用多个独立AI审查员,使用不同模型和推理方法,以交叉验证提升结论置信度,并过滤掉低价值建议。其架构基于Kubernetes,支持事件驱动管道、持久队列和水平扩展,可监控延迟、接受率等指标。评估显示,在1727个PR的5230条抽样评论中,63.9%的建议被采纳,其中并发缺陷采纳率达100%,逻辑错误为80%,缺陷修复为58.1%。该平台旨在生成基于事实、高信噪比且符合代码库特定约定的审查意见,并赶在人工审查前完成。其他公司如Cloudflare和Databricks也采用了不同方法解决类似问题。
8月26日,2026年“数据要素×”大赛浙江赛区决赛落幕。海亮科服凭借“智绘生涯成长蓝图 赋能智慧教育新发展”项目,从209支队伍中胜出,获人力资源与教育赛道唯一一等奖,晋级全国总决赛。该项目依托自主研发的数智生涯平台e生涯,打通学业、兴趣等多源数据,构建六位一体数据体系,结合生涯规划大模型与知识图谱,提供学科潜能评估、升学方案定制等服务。目前方案已落地全国14个省份、60余所学校,服务超10万名学生,核心功能深度使用率达60%。本届大赛由国家数据局等部委组织,蚂蚁科技、商汤科技等头部企业参赛,各赛道奖项均由行业领军企业项目获得。海亮科服将携项目参加9月全国总决赛。
商汤科技首席科学家林达华近日接受专访时表示,多模态大模型的“涌现时刻”预计将在一至两年内到来。他指出,当前技术正从单一文本模态加速向图像、视频、语音等多模态融合演进,模型能力将出现质的飞跃。林达华认为,多模态突破的关键在于统一表征与跨模态对齐,商汤在该领域已布局大算力训练平台及数据体系。他同时提到,行业竞争焦点正从参数规模转向落地效率,未来模型需在推理成本、实时性与场景适配间取得平衡。商汤近期发布的日日新大模型已支持多模态交互,并应用于教育、医疗等垂直行业。林达华预测,随着算力成本下降与算法优化,多模态技术将在两年内进入规模化商用阶段,推动AI从工具型应用向通用智能基础设施转变。
安努智能近期调整业务重心,从传统工单系统转向具身智能商业化落地。该公司推出新一代机器人调度平台,可自动计算客户投入产出比(ROI),帮助制造、物流企业评估机器人采购与运维成本。平台支持多品牌机器人统一接入,通过云端算法优化任务分配,将单台设备闲置率降低约30%。安努智能已与三家头部仓储企业签订试点合同,预计年内交付超200台适配机器人。公司负责人表示,此举旨在解决具身智能项目“演示多、量产少”的行业痛点,后续将开放API接口,吸引更多中小型集成商参与生态建设。目前该赛道竞争激烈,安努智能计划以数据服务作为差异化优势,逐步从硬件销售转向按效果付费的订阅模式。
莫德纳与默沙东联合研发的个性化mRNA癌症疫苗Intismeran Autogene,在黑色素瘤Ⅲ期临床试验中取得阳性结果,成为首个闯过Ⅲ期的个体化新抗原疗法。该疫苗与PD-1抑制剂K药联用,显著延长患者无复发生存期及无远处转移生存期。AI贯穿其新抗原筛选、mRNA设计至生产全流程。美国投行William Blair预测,该疫苗批发采购价或达每名患者47.5万美元,约合人民币318万元;叠加K药费用,整套联合治疗药费最高或近69.6万美元。该定价参考2017年CAR-T疗法Kymriah首期定价。疫苗需个性化定制,单人生产成本超10万美元,从取样到首针需6至9周。研发历时近十年,莫德纳2025年研发投入达31.32亿美元,公司净亏损28亿美元。
由奇点智能研究院与CSDN联合主办的2026奇点智能技术大会北京站,将于11月20日至21日举行。大会设两大核心会议:奇点智能技术大会聚焦大模型演进、AI原生软件研发等前沿方向;C++及系统软件技术大会探讨现代C++演进、AI算力优化等底层技术。OpenAI资深研究科学家、Transformer论文联合作者Łukasz Kaiser已确认发表主题演讲。大会将汇聚70余位技术专家,围绕18个专题展开交流,预计吸引超1000名行业精英参与。
世界人工智能开源大赛(GOAI)复赛作品提交于8月28日正式开启,截止时间为9月3日18:00。四个赛道中,“新智基座”“无界应用”“前沿探索”三个赛道的晋级团队需在截止日期前提交作品;“具身未来”赛道则分阶段进行线下调试,巡逻赛题调试期为8月28日至9月21日,双臂赛题为9月19日至21日。复赛要求较初赛全面升级:新智基座赛道要求基于AgentTeams框架构建不少于3个Agent并提交完整代码及演示视频;无界应用赛道须面向真实行业场景完成至少一条完整任务链路,并说明数据
Anthropic发布全新模型硬件标准MHS,旨在统一硬件设备控制接口,让Claude等AI Agent能直接操控物理设备。该标准可将不同厂商的摄像头、机械臂、显微镜等硬件控制方式转译为Agent可读取调用的标准接口,实现分布式具身智能。在演示中,Claude已能通过MHS控制低成本SO-ARM101机械臂,无需预先训练或遥操作。MHS
开源电子书管理器Calibre发布9.14版本更新,首次引入AI驱动封面生成功能。该版本支持用户直接在本地调用图像生成AI接口,为缺少官方封面的自制PDF、EPUB等文档自动生成高分辨率艺术封面。用户选中书籍后,通过“编辑元数据”中的新增“AI生成”按钮,系统可根据书名和简介等特征在数秒内渲染专属封面。同时,书籍编辑器新增文件浏览器悬浮预览功能,鼠标悬停内部图像文件即可显示浮动缩略图。标签编辑器搜索功能升级,支持忽略声调及变音符号,提升多语言文本管理体验。此次更新主要解决电子书库中无封面文档显示为空白或简陋文字块的问题,提升视觉完整性与管理效率。
微软等科技巨头近期加速推进不间断AI自动化体系,以应对人力成本与效率挑战。此前比尔·盖茨曾公开警告,AI普及将引发大规模岗位替代风险。多家企业已部署全天候运行的智能代理系统,替代传统轮班制人力岗位,覆盖客服、数据标注及基础编程等领域。技术参数显示,新一代AI工作流可将任务处理速度提升数倍,且无需休息,被业内视为“数字牛马”。此举引发市场对就业结构冲击的担忧,部分工会组织要求立法规范AI用工边界。目前,微软已联合多家云服务商推出电力保障与冗余算力方案,确保AI系统连续运转,进一步加剧了“机器换人”的竞争态势。分析人士指出,该趋势虽能降低企业运营成本,但需配套再就业培训机制以缓解社会震荡。
Meta公司近期公布内部数据显示,其部署AI智能体辅助编程已满一年,但效果不及预期。该公司工程师团队事故响应工作量同比增加约七成,生产环境故障率上升四成。此前Meta曾大规模推广AI编程助手,试图减少人工介入,但实际运行中AI生成的代码在复杂业务场景下频繁出错,导致工程师需投入更多时间修复。Meta内部评估认为,当前Agent技术尚无法完全替代人类员工,尤其在需要全局判断和跨系统协调的任务中,人工干预仍不可或缺。该公司已调整策略,将AI定位为辅助工具而非替代方案,并加强代码审查流程。该案例反映出行业对AI编程工具实际效能的重新审视。
阿里发布全新AI编程工具Qoder,面向开发者开放使用。该产品将大模型编程能力与云端开发环境整合,支持代码生成、自动补全、错误修复及多语言协作等功能。据官方介绍,Qoder可显著提升编码效率,降低上手门槛,使非专业开发者也能借助自然语言指令完成基础开发任务。此次上线被视为阿里将内部AI编程能力对外产品化的重要一步,或对现有开发者工具市场格局产生影响。目前该工具已开放注册,并提供免费试用额度。
英伟达CEO黄仁勋近日接受采访时回应内存涨价问题,称这是行业健康发展的积极信号。他认为,当前AI算力需求激增导致高带宽内存(HBM)供不应求,价格上行将刺激厂商扩大产能并推动技术迭代,长期利好产业链。黄仁勋同时透露,英伟达下一代AI芯片平台已获得主要云服务商订单,预计2025年出货量将显著增长。他否认内存涨价会抑制AI应用普及,反而强调高性能计算成本下降趋势未变,企业级AI部署仍将加速。市场分析认为,此番表态意在稳定投资者对供应链成本的担忧,但内存价格走势仍取决于三星、SK海力士等厂商的扩产节奏。
Cloudflare发布Kitesurf,一款面向AI智能体的轻量级浏览器引擎,运行于Workers平台的WebAssembly/Rust隔离环境中,支持Chrome DevTools协议,可由Playwright和Puppeteer驱动,资源开销低于完整Chromium。它专为截图和HTML提取设计,每个页面或跨进程iframe在长生命周期Dynamic Worker中独立运行,拥有独立JavaScript环境与DOM,采用Rust的Blitz渲染引擎和Firefox的Stylo CSS解析器。 Kitesurf目前不支持视频、WebGL、基于TLS的机器人验证及长时效认证会话。Cloudflare认为Chromium等引擎为人类用户设计,内存与计算消耗巨大,难以支撑每个智能体独立实例,而AI智能体应优先考量词元消耗、可扩展性、成本与结构化内容。其PageRenderer组件可将DOM和样式渲染为图片或PDF,通过Workers RPC回传数据。 社区反应方面,Hacker News用户质疑Cloudflare作为CDN服务商是否会允许这些浏览器实例绕过自家反机器人机制,或同样拦截。Reddit从业者谨慎乐观,指出代码尚未开源且未向上游合并。Blitz作者确认Kitesurf基于其开源引擎构建,计划将补丁开源并提交上游。项目仍处实验阶段,兼容性工作尚待完成。
具身智能产业正进入物理交互落地阶段,触觉感知被视为继视觉后的核心技术。视触觉传感器因视觉算法外溢和硬件易得而热度高,但其技术本质存在局限。 该技术依赖CMOS摄像头模组,底层硬件受制于国际供应链,国内厂商缺乏自主掌控能力。算法层面多直接复用视觉领域的ResNet、U-Net和光流法,未形成独立的触觉感知范式。硬件门槛低导致大量同质化企业涌入,产品性能难以拉开差距,缺乏具备市场统治力的头部企业,投资价值存疑。 在工业落地方面,视触觉传感器受最小焦距限制,厚度普遍超10毫米,难以适配灵巧手微型化需求。刚性结构无法实现柔性曲面贴合,仅能部署于指尖等局部区域。若扩展至双手多指场景,需近30个模组,多路视频流将带来算力需求激增至160+TOPS、功耗超百瓦及延迟问题,难以满足实时控制要求。整体来看,视触觉路线在技术自主性、规模化部署和长期可靠性方面均面临挑战。
Anthropic于8月27日以研究预览形式发布模型硬件标准(MHS),路透社、CNBC等外媒解读称,此举标志着该公司首次公开进军具身智能与物理AI领域。MHS旨在为AI模型与物理硬件交互提供统一规范,涉及传感器、执行器等组件的数据接口与通信协议,以支持机器人在真实环境中运行。该标准目前处于早期阶段,Anthropic未公布具体合作厂商或商用时间表,但业界认为其切入物理AI赛道,或与英伟达、特斯拉等布局形成竞争。此次发布被视为Anthropic从纯软件模型向软硬件协同方向拓展的重要信号,后续进展尚待观察。
安全研究机构Wiz近日发布报告,指出多家新云服务商的S3兼容对象存储存在安全能力缺口,与亚马逊AWS S3原生服务有显著差距。报告对比了Nebius、Crusoe、Vultr、Lambda Labs、Cloudflare R2及DigitalOcean六家服务,发现它们在公共访问控制、访问密钥管理和IAM权限模型上均与AWS存在差异。例如,Crusoe和Lambda不支持公开访问,而DigitalOcean允许公开列出对象;部分服务缺少AWS的结构化访问密钥格式,导致GitHub等工具难以检测相关凭据。Wiz首席研究员Scott Piper警告,S3兼容性可能造成“可移植性错觉”,组织不能直接套用AWS的安全假设。报告还指出,不同实现间的IAM语义差异曾引发MinIO和RustFS的漏洞事故。云经济学家Corey Quinn举例称,某服务在执行删除Bucket策略时竟删除了整个存储桶。Wiz建议用户在使用前仔细审查API实际行为与权限模型。该评估未涵盖Backblaze B2、Wasabi和谷歌云存储。
商汤大装置与智象未来合作,实现视频生成业务向国产算力无感迁移,跑通从适配到规模应用的完整链路。智象未来旗下产品覆盖全球100多个国家和地区,服务超5000万专业用户及4万家企业客户。双方围绕国产算力环境下的高清视频高效生成目标,商汤基于LightX2V进行多卡并行优化,通过步数蒸馏、CFG蒸馏及多层次并行策略,使多卡视频生成加速比达93%。针对多卡推理效果差异,团队优化通信过程并重注入Face特征,提升生成一致性,同时补齐推理帧数差异,改善长视频细节表现。商汤构建统一硬件抽象体系,支持10余种异构芯片零成本迁移,并完成ComfyUI等工具链适配。通过FDE专家服务深入业务,商汤协助智象未来完成模型迁移、算子优化及效果调优,其图像模型已支撑规模化线上流量及短视频创作,验证了国产算力从全栈适配到规模生产的可复用路径。
智谱于8月26日上线并开源GLM-5.3-Flash(320B-A18B),系GLM-5系列首个原生多模态模型,总参数320B,性能超越GLM-5.2。该模型在Artificial Analysis Intelligence Index中获57分,与Claude Opus 4.8持平,进入全球前沿模型区间。其架构专为低成本设计,结合30T Token多模态预训练语料,以更少算力实现更强性能。商汤大装置依托国产异构混推技术,为该模型提供大规模国产算力支持与Token服务。发布前,该模型以匿名身份在OpenCode和OpenRouter测试,Token调用量达62T,全部由国产芯片支撑,端到端服务性能较基线提升3倍,硬件效率及单Token成本已接近英伟达GPU水平。商汤大装置通过异构混合推理技术,使推理性价比达NVIDIA H系列1.25倍,同等成本下Token产能扩大约2.5倍。其Token Factory日均服务量已达2.42万亿,预计2026年底突破日均10万亿。
人形机器人赛道正从“炫技”转向“实用”,行业开始淘汰仅具备单一演示能力的“偏科生”。近期,多家头部厂商调整产品策略,强调机器人在真实场景中的综合操作能力,而非单纯展示行走或抓取动作。技术侧重点转向多模态感知、力控精度与长时间续航的协同优化,以适配工业巡检、物流分拣等落地需求。市场层面,资本更青睐具备完整软硬件闭环和量产计划的企业,纯概念性项目融资明显降温。业内预计,未来两年将出现首批通过规模化商用验证的整机产品,行业竞争焦点从参数比拼转向实际作业效率与稳定性。同时,供应链成本下探加速,核心零部件国产化率提升,为中小厂商参与细分市场提供窗口。整体来看,机器人产业正进入以场景落地论英雄的淘汰阶段,缺乏真实数据反馈与迭代能力的团队将加速出局。
AI行业近期出现一种新趋势:开发者将多达700个智能体(Agent)串联协作,模拟出一家完整的“地下公司”运作模式。该系统通过任务分解与层级调度,让不同Agent分别承担决策、执行、审核等职能,形成自动化的工作流闭环。该实验展示了多智能体系统在复杂业务流程中的潜力,但也引发对安全性与失控风险的讨论。目前,此类技术仍处于早期探索阶段,尚未有商业化落地的具体时间表。业内观察认为,这种“组织化”Agent集群或将成为未来企业自动化运营的雏形,但其稳定性与监管合规性仍需进一步验证。
Snowflake发布Cortex Agents新能力,旨在降低企业大规模构建、部署和运营AI智能体的操作复杂度。新增功能包括:Coding Agent基于CoCo运行时构建托管编码智能体,可部署至任意应用;Skills Package将精选技能打包为单一对象供引用;Agent Toolset允许直接引用其他智能体的工具;Tool Search按需发现工具;Async Agent API支持后台长任务执行;Code Execution Tool在沙箱Python环境处理数据;Interrupt and Resume支持中断后续跑;Partial Access用同一托管智能体服务不同权限用户;Versioning UI提供可视化配置对比与回滚。Cortex Agent可在Snowflake治理边界内推理数据、调用工具并执行代码,所有行为受统一访问控制约束。企业级部署面临工作流跨多智能体、工具库扩展、执行时间增长及治理需求等运营挑战,新功能旨在解决这些问题,而非依赖更优提示或更快模型。
8月28日,阿里巴巴旗下高德发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon。该模型无需长程记忆,仅凭连续12帧局部画面即可实时重建上万帧3D场景,实现“边拍边建”。在KITTI、Oxford Spires、VBR等基准测试中,其误差达SOTA水平。技术路径采用“局部位姿预测+残差优化”,摒弃传统记忆锚点,使计算复杂度与显存占用保持恒定。实测中,ABot-Recon平均轨迹误差较LingBot-Map降低40.6%,相对旋转误差低至0.12°,推理速度达24.45FPS,峰值显存约6.71GB,仅为同类模型三分之一,消费级显卡即可运行。该模型仅需单目RGB视频输入,无需额外传感器,可服务测绘、具身智能、自动驾驶及3D内容生产。目前,其推理与评测代码及权重已在GitHub开源,并上线魔搭社区体验专区。
日程安排SaaS公司Calendly近期公开了其内部Agentic Engineering实践。该公司将AI智能体嵌入研发全流程,使其承担需求审查、任务拆解、代码编写、测试及QA工作,人类工程师仅负责最终审查与合并。在IAM团队,Agent仅用一周半时间生成64个Pull Request,完成大型解耦项目约30%工作量。Calendly成立于2013年,核心产品为自动化会议协调工具。该公司表示,自动化闭环具备持久状态,运行于Jira、GitHub、CI等既有系统,并在关键节点保留人工检查点。随着代码执行自动化程度提升,工程瓶颈正从编码转向需求定义与判断力。Calendly强调,Agent并非取代工程师,所有AI辅助工作仍由署名工程师承担最终责任。目前多个团队已采用类似工作流,目标并非为自动化而自动化,而是消除重复性高、依赖上下文且易造成等待的环节,使人力集中于架构、产品思考与权衡决策。
智谱AI确认,近期在OpenRouter上匿名引发热议的模型Ox Alpha为其最新发布的GLM-5.3-Flash。该模型于8月20日匿名上线,凭借代码生成与复杂推理能力迅速登顶热门榜。GLM-5.3-Flash为混合专家模型,总参数3200亿,激活参数仅180亿,层数较前代减少,旨在降低推理计算量。其采用线性与稀疏混合注意力机制,将注意力计算量降至约三分之一,KV Cache降至约四分之一。该模型为GLM-5系列首款原生多模态模型,支持文本、图片、视频输入,上下文窗口约100万Token,预训练语料达30万亿Token。匿名测试期间,全部流量由国产AI芯片集群承载。在DeepSWE等基准测试中,其得分显著优于前代,代码与Agent任务能力突出。模型权重已在Hugging Face开放,采用MIT许可证。
雷鸟创新8月27日公布智能眼镜雷鸟iO首销战报。该产品在京东、天猫、抖音三大平台均获智能眼镜品类销量冠军,打破2026年新品首销纪录。产品重34克,采用经典皇冠框型与蓝湖光波导显示,支持最高1200度近视配镜,外观接近日常眼镜。功能上主打全天候主动式AI,支持全天智记、待办提醒、录音总结、实时翻译、AI提词及消息通知,无摄像头设计并具备清晰录音状态提示。首发到手价1996元起。IDC数据显示,2026年第一季度全球智能眼镜出货量达356.6万台,同比增长130.1%,其中轻量级显示眼镜成为增长主力。雷鸟创新称其为行业唯一具备核心光学方案全链路自研与量产能力的企业。9月起,该产品将通过OTA新增离线翻译、短信便捷回复等功能,并开放全国线下网点体验购买。
AI可解释性与对齐领域近期取得多项技术进展。研究者提出J-Space框架,通过数学空间映射模型内部表征,提升对AI决策逻辑的解析能力。思维链技术被用于增强模型推理透明度,使复杂决策过程可逐步追溯。针对AI人格一致性问题,新方法通过约束对话历史中的角色稳定性,减少行为漂移。在幻觉抑制方面,检索增强生成结合事实核验模块,显著降低模型生成虚假信息的概率。业界将上述技术统称为“对齐工具箱”,旨在确保AI行为符合人类意图。有观点以金门大桥为喻,强调可解释性如同桥体结构,需在安全性与功能性间取得平衡。目前,相关成果已在多个开源模型中应用,但大规模部署仍需解决计算成本与泛化能力问题。
OpenAI正将代码智能体Codex改造为可长期运行的自动化编程系统,其内部代码显示该工具不再强制休眠或停机,可连续执行复杂开发任务。这一设计旨在让AI在无人值守状态下持续处理代码编写、调试与仓库维护,相当于为开发者配备“永动”型数字员工。相关机制通过动态资源调度与任务队列管理实现,系统可在后台自主规划步骤并调用工具,仅在遇到关键错误时请求人工介入。此举有望显著提升软件迭代效率,但也引发对AI自主操作安全边界的讨论。目前该功能仍处于内部测试阶段,尚未向公众全面开放。
OpenAI发布新一代编程模型GPT-5.6,主打高性价比定价策略。该模型相较前代仅降价20%,但据官方测试数据,在特定编程任务中的实际账单支出可减少约80%。此举被视为直接对标Anthropic旗下Claude系列在编程领域的市场份额。GPT-5.6在代码生成、调试及多文件项目处理能力上进行了针对性优化,重点降低长会话与复杂任务场景下的token消耗。目前该模型已向部分开发者开放API测试,企业用户可申请接入。行业分析认为,此次定价调整将加剧AI编程工具赛道的价格竞争,并可能促使其他厂商跟进调整计费模式。
谷歌于8月26日发布语音转文本模型Gemini 3.5 Transcribe,CEO皮查伊在X平台官宣。该模型可自动清理语气词、口误并补充标点,支持85种以上语言及实时切换,针对嘈杂环境、多口音及专业词汇优化,并支持自定义词表(最多1000词)和最多8人说话人分离。据谷歌引用的测评数据,其流式转录词错误率为4.0%,非流式2.6%,延迟较上代Chirp 3缩短70%。提供实时与预录音频两个版本,价格分别为每分钟0.009美元和0.005美元。模型新增Smart Transcription功能,可将口语整理为成稿文本,但谷歌同时提供逐字记录模式以保留原始措辞。该技术已集成至Gboard和Gemini应用。部分用户批评谷歌在行业聚焦Agent与端到端交互时仍主推语音转写,认为其产品节奏与行业焦点错位。
Cloudflare近期披露,其已将内部工程标准从被动文档转化为AI主动执行的管控系统。自2026年初以来,该公司AI代码审查工具已识别近23万处不符合规范的问题,其中约1.6万处导致审批被驳回。该方法同样应用于技术设计与事故报告,以中央知识库Cloudflare Codex作为工程标准的单一事实来源。 该方案将工程知识改造为机器可读取、可强制校验的形态,通过结构化RFC文档定义标准,约束分为建议与强制两级,并赋予明确所有者与生命周期状态。新规范可先提供建议,再过渡至阻断代码变更的强制规则,形成“指引→观察→强制执行”的递进模式。AI在开发前审查技术规范,开发中检查代码,事后评估事故报告,形成反馈循环。 Cloudflare结合静态分析与Linter执行确定性要求,利用AI处理需上下文理解的规则。谷歌、Netflix、Uber等亦有类似实践,GitHub与微软正借助CodeQL等工具推进AI辅助治理。该方案预示工程治理未来方向:随AI智能体承担更多开发工作,工程原则需编码为机器可执行的系统规则。
8月27日,网易有道发布全球首款专为iPhone用户设计的Agent耳机OpenPods。该产品通过苹果MFi认证,配备独立智能耳机舱,集成录音、转写、翻译、总结、问答及知识管理功能,覆盖会议、跨语言沟通等场景。耳机端支持20余种语言及粤语、上海话等方言,单只重7克,综合续航最长32小时。用户按实体键即可在通话或会议中录音,耳机舱可录制线下多人对话并支持中英互译外放。录音自动生成结构化纪要和待办事项,AI问答可溯源音频。产品于8月27日开启预售,9月10日正式发售,有黑、白两色可选。此前该耳机在2026世界人工智能大会亮相并获得央视报道。
Cerebras在Hot Chips 2026活动上披露CS-6系统路线图,首次引入晶圆级3D堆叠设计。该方案将垂直集成DRAM,打破传统平面布局,实现存储与计算单元在晶圆尺度上的直接堆叠。此举旨在解决现有晶圆级芯片在内存带宽与功耗上的瓶颈,提升数据处理密度。CS-6作为新一代产品,延续了Cerebras在超大尺寸芯片上的技术路线,但3D结构标志着其从二维扩展转向垂直集成。目前官方未公布具体性能参数与上市时间,但该设计被视为晶圆级计算在架构上的关键演进,预计将对AI大模型训练等高性能计算场景产生直接影响。
AI长片在2025年夏天迎来密集上映期,一个月内三部作品接连登陆院线及流媒体,标志着该类型进入商业化拐点。这三部影片分别采用不同技术路线:一部全程由生成式AI制作画面,另两部则结合传统实拍与AI后期增强。技术层面,当前AI长片已能实现连贯叙事和稳定角色形象,但动作场景与复杂表情仍存在失真。市场反馈分化,部分观众认可其视觉创新,亦有影评人指出剧本深度不足。行业观察认为,AI电影制作成本较传统动画降低约40%,制作周期缩短至数月,吸引多家影视公司启动相关项目。同时,好莱坞工会正就AI使用规范展开谈判,涉及编剧、演员权益保护。业内预测,下半年将有超过20部AI参与制作的电影立项,技术迭代与版权争议将同步加速。
百度、阿里巴巴、腾讯近期对AI业务进行重大组织调整,核心方向为资源整合与人才换血。百度将智能云事业群与AI技术中台合并,由王海峰统一负责,强化云与AI协同。阿里则拆分原阿里云智能事业群,新设AI算法、AI基础设施及AI应用三大独立部门,直接向CEO张勇汇报,以提升决策效率。腾讯云与智慧产业事业群内部新成立AI实验室,并引入多位海外技术专家,同时将部分AI中台能力下沉至各业务线。三家公司均将大模型研发列为最高战略优先级,并加大自研芯片投入。市场分析认为,此举旨在应对国内大模型竞争白热化及算力成本压力,通过组织扁平化加速技术商业化落地。调整后,BAT的AI业务线均直接向集团最高层汇报,反映出其正从项目制转向平台化运营,以争夺下一代AI基础设施主导权。
群核科技发布业绩快报,其AI相关收入同比增长177%,带动整体业绩表现。该公司被称为“全球空间智能第一股”,主要业务聚焦空间智能领域,提供相关技术产品与服务。市场预期其股票有望于9月初被纳入港股通,从而吸引更多内地资金参与交易。此次AI收入的大幅增长,反映出公司在空间智能方向上的商业化能力持续增强。具体财务数据及纳入港股通的正式安排,尚待公司后续公告确认。
企业AI Agent应用正从概念验证加速走向实际业务落地,行业关注点由技术演示转向可量化的投资回报。近期市场动态显示,多家头部科技公司密集发布新一代企业级AI智能体产品,重点强化与现有ERP、CRM系统的深度集成能力,并突出在财务对账、供应链预测、客户服务等具体场景中的自动化处理效率。技术层面,新一代Agent普遍采用多模态交互与自主规划架构,能够拆解复杂任务并调用内部工具链完成闭环操作。与此同时,企业采购决策更趋务实,评估标准从单一模型参数转向端到端的流程优化效果与部署成本。分析指出,当前行业正经历“浅层繁荣”后的价值筛选阶段,具备明确业务场景、数据基础完善且能实现快速反馈迭代的落地项目获得更多资源倾斜,而缺乏实际效益支撑的试点项目则面临收缩。这一趋势预示着企业AI竞争将围绕真实业务价值创造展开,技术供应商需提供更精细的行业解决方案以赢得市场。
AI音频笔记应用推出“AI代听播客”功能,用户可将长播客交给AI自动收听并生成结构化摘要。该功能支持自定义摘要长度、重点提取时间戳及话题标签,并自动关联相关节目推荐。产品方称,其语音识别准确率达95%以上,摘要生成延迟低于3秒。目前该功能已向付费用户开放,免费用户每月可体验10次。市场分析认为,此举直击用户“播客收藏过多、没时间听”的痛点,或推动播客工具类应用从播放器向智能内容处理平台转型。
人工智能公司Anthropic发布硬件版MCP协议,使Claude模型可直接控制个人电脑、手机等终端设备,实现跨平台操作。该协议将AI从软件层延伸至物理设备层,支持文件管理、应用调用及系统设置调整等功能。首批合作方包括多家硬件厂商,开发者可通过统一接口接入设备控制能力。市场分析认为,此举将加速AI代理从对话工具向数字管家演进,但设备权限管理及隐私安全仍是落地难点。目前相关开发工具包已向开发者开放申请。
斯坦福大学近日宣布,用于构建经典图像数据集ImageNet的原始服务器集群已正式退役。该集群曾支撑李飞飞团队于2009年完成ImageNet的构建与标注,该数据集后续成为推动深度学习革命的关键基础设施。退役设备包含数百台普通商用服务器,其存储的约1400万张标注图片已迁移至现代云存储系统。斯坦福方面表示,硬件老化与维护成本过高是退役主因,但数据本身将永久保留并持续向学术界开放。此举标志着一个技术时代的结束,但ImageNet作为标准基准测试集,仍被全球AI研究社区广泛使用。
激光雷达厂商禾赛科技与速腾聚创正加速向机器人领域拓展。禾赛2024年第四季度及全年财报显示,其全年激光雷达总交付量达50.2万台,同比增长126%,其中第四季度ADAS(高级驾驶辅助系统)产品交付量首次单季突破20万台。公司预计2025年总交付量将达120万至150万台,其中机器人相关产品预计贡献约20万台。速腾聚创2024年全年销量约为54.4万台,其中用于机器人的激光雷达产品出货量突破6位数,其机器人相关业务已获得约10家全球头部人形机器人客户定点合作。两家公司均表示,机器人业务正成为继车载ADAS之后新的增长点,但当前该业务营收占比仍较低,整体盈利仍主要依赖汽车业务支撑。行业分析认为,机器人激光雷达市场尚处早期放量阶段,价格竞争与规模化交付能力将是决定其能否实现盈利的关键。
AI漫剧在暑期档迎来爆发式进化。制作端,单人创作者借助AI工具即可独立完成剧本、分镜、配音及成片,大幅降低产能门槛,实现“单人手搓爆款”。内容端,AI漫剧已从简单动态条漫升级为具备完整叙事、流畅运镜及稳定人设的“顶流艺人养成”模式,部分作品通过高频更新与角色IP化运营,在短视频平台积累千万级粉丝。市场层面,多部AI漫剧播放量破亿,商业化路径同步拓宽,涵盖广告植入、直播带货及虚拟偶像付费打赏。行业观察指出,AI技术正将漫剧生产周期从数月压缩至数天,但同质化叙事与角色版权归属问题亦随产能激增而凸显,下一阶段竞争将聚焦于差异化剧本与精细化运营能力。
AI芯片创业热潮再度升温。近期多家初创公司密集完成大额融资,聚焦推理端专用芯片与边缘计算场景。其中,某企业推出针对大语言模型优化的高能效比芯片,宣称较通用GPU功耗降低约70%,已获云服务商订单。另一团队发布面向自动驾驶的集成式AI处理器,算力达200TOPS,预计明年量产。市场分析指出,资本正从云端训练芯片转向推理与终端部署,以规避与英伟达的正面竞争。同时,国产替代政策与AI应用爆发推动需求,但供应链成熟度与软件生态仍是主要挑战。业内预计,本轮融资将加速产品落地,但行业洗牌或在2025年显现。
阿里巴巴旗下虾米音乐在关停五年后以AI形态回归。新版虾米APP主打AI音乐创作功能,用户可通过哼唱或输入文字生成完整歌曲,并支持AI音色合成与智能编曲。产品定位从播放工具转向音乐创作工具,内置AI作曲引擎、歌词生成器及多风格伴奏库。目前该应用已开放测试,但未公布正式上线时间。此举被视为阿里在AI音乐生成赛道的重要布局,与字节跳动、网易云音乐等平台的AI音乐功能形成竞争。市场分析认为,AI音乐工具将降低创作门槛,但版权归属和作品质量仍是待解问题。
优必选科技研发的人形机器人Walker在近期赛事中夺冠,其联合创始人熊友军随后就行业发展趋势发表观点。熊友军指出,当前人形机器人仍处于早期阶段,核心突破点在于运动控制与感知交互的深度融合。他透露,优必选正推进新一代机器人研发,重点提升复杂地形适应能力和任务自主决策水平。关于商业化路径,熊友军认为,工业制造、物流分拣及家庭服务将成为率先落地的应用场景,但大规模普及仍需解决成本与可靠性问题。他同时提到,行业竞争正从单一硬件比拼转向“硬件+算法+数据”的综合能力较量,未来三年将是技术迭代的关键窗口期。优必选计划通过开放平台合作,加速人形机器人在多行业的场景验证。
好莱坞制片公司Skydance Media与字节跳动达成合作,双方将基于字节旗下的即梦AI平台开发视频生成模型,用于电影和电视制作。据知情人士透露,该合作采用技术授权与收益分成模式,而非一次性买断。即梦AI此前已能生成最长10秒、分辨率达1080p的视频片段,新合作将针对影视级长镜头和角色一致性进行优化。Skydance曾出品《碟中谍》系列和《壮志凌云:独行侠》,其母公司派拉蒙正面临流媒体竞争压力。此次合作被视为传统影视工业对AI生成内容态度的转折,此前好莱坞编剧和演员公会曾就AI使用发起罢工。字节跳动未披露具体投资金额,但表示将提供算力支持。分析人士认为,该模式可能成为影视行业采用AI的参考样本,即通过分成绑定利益,而非对抗技术浪潮。
英伟达发布新一代旗舰GPU芯片B200,采用台积电4NP制程,集成2080亿个晶体管,AI训练性能较前代提升约2.5倍,推理性能提升5倍。该芯片计划于2024年晚些时候出货,单颗售价预计在3万至4万美元区间。市场分析认为,其高昂定价与供不应求状况推高了AI算力租赁价格,多家云服务商已宣布上调GPU云服务费率。受此影响,部分中小型AI创业公司面临算力成本压力,开始调整模型训练策略或转向性价比更高的替代芯片。业内预计,高端GPU供需紧张局面可能延续至2025年,并带动相关服务器、散热及电力配套产业投资增长。