AI  NEWS

AI 资讯

每日 AI 快讯 · 实时追踪人工智能行业最新动态

9月3日·星期四

重磅,奥特曼首次确认:OpenAI将自研人形机器人

OpenAI首席执行官奥特曼首次公开确认,公司正着手自研人形机器人。该项目被视为其从大模型向实体硬件延伸的关键一步,具体技术路线与落地时间表尚未披露。此举将直接对标特斯拉Optimus、Figure AI等现有玩家,并可能重塑具身智能领域的竞争格局。市场分析认为,OpenAI依托其多模态大模型能力,有望在机器人决策与交互层面形成差异化优势,但硬件制造与供应链管理仍是其面临的主要挑战。目前,OpenAI尚未公布机器人产品的原型参数或量产计划,相关研发仍处于早期阶段。

来源:36氪

Gemini 3.8 Flash深夜突袭,六周三更,谷歌到底在急什么?

谷歌于深夜发布Gemini 3.8 Flash模型,距离上一版本仅六周,更新节奏显著加快。该模型主打低延迟与高吞吐能力,面向大规模实时推理场景,在代码生成、数学推理及长上下文处理上较前代有性能提升。此次发布未伴随大型发布会,而是通过技术博客与开发者文档直接上线,并同步开放API接口供企业测试。分析认为,谷歌此举旨在应对OpenAI及Anthropic在轻量级模型市场的竞争压力,通过高频迭代抢占开发者生态。目前,Gemini 3.8 Flash已支持多模态输入,但输出仍以文本为主,部分高级功能需通过付费订阅使用。市场反应方面,该模型在第三方基准测试中多项指标与竞品持平,但在成本效率上具备优势。谷歌未透露下一步更新计划,但暗示将继续缩短版本间隔。

来源:36氪

OpenAI浏览器换壳杀回,高管改用ChatGPT上网,效率从未这么高

OpenAI于近期推出基于Chromium内核的浏览器产品,其高管团队已全面改用ChatGPT集成界面进行日常网络访问,并称工作效率显著提升。该浏览器深度整合GPT模型,支持对话式搜索、网页内容自动摘要及跨标签页信息聚合功能。产品定位为传统浏览器的AI替代方案,旨在通过自然语言交互减少多步骤操作。目前该浏览器已开放测试,市场分析认为其将对现有浏览器市场份额及搜索广告模式构成潜在冲击。OpenAI未公布具体用户数据及商业化时间表。

来源:36氪

智谱MiniMax,疯狂卖Token

智谱AI与MiniMax近期密集调整旗下大模型产品的商业化策略,核心动作是大幅下调API调用价格,以“卖Token”模式加速抢占企业级市场。两家公司均宣布对旗舰模型及入门级模型的输入输出价格进行阶梯式降价,部分轻量版模型价格降幅超过50%,并同步推出按量计费的灵活套餐。此举旨在降低开发者与企业的试错成本,推动大模型应用从概念验证走向规模化落地。业内分析认为,价格战背后反映的是国产大模型厂商在算力成本优化与开源生态竞争下的生存压力,短期将加速行业洗牌,但长期盈利模式仍依赖高价值场景的深度绑定。目前,智谱的GLM系列与MiniMax的abab系列均已更新定价页面,新价格即时生效。

来源:36氪

“大”模型向左,“Flash”向右:国内外开卷轻量化背后的商业清算

谷歌发布轻量化AI模型Gemini Flash,主打低延迟与高性价比,与OpenAI GPT-4o mini形成直接竞争。国内外厂商近期密集推出小参数模型,如字节跳动豆包大模型、智谱GLM-4-Flash及Mistral的Ministral系列,均聚焦端侧部署与API调用成本优化。轻量化模型参数规模多在10B以下,推理成本较旗舰模型降低超90%,瞄准高频、实时交互场景如智能客服、语音助手及移动端应用。行业分析认为,此举反映AI商业化重心从参数竞赛转向单位算力收益核算,中小开发者对千亿级大模型的调用门槛催生“够用且便宜”的中间层需求。市场影响方面,轻量化模型正加速渗透企业私有化部署市场,并推动AI应用从演示走向规模化落地,但部分厂商需平衡精度损失与场景适配风险。

来源:36氪

“没有Token的CS学生,应立即退学”

AI行业近期动态:有观点认为计算机专业学生若缺乏算力资源应退学,引发讨论。腾讯WorkBuddy发布联名硬件,已有超百家合作伙伴。AI重塑产业成为WAIC核心议题,从技术热潮转向实际应用。百度旗下AI产品“搭子”日均提问量增长20倍,宣布升级并推出企业版。北大、港中文及上海AI Lab联合推出VGGT-Edit,实现5秒完成3D场景编辑,速度提升120倍。一款获卡帕西、李飞飞、辛顿投资的Transformer专用芯片公司,签下10亿美元订单。麦肯锡报告显示,银行应用AI后每年可多赚1万亿美元。李飞飞团队发布空间智能新基准,用于评测具身智能。

来源:量子位

腾讯WorkBuddy联名硬件来了!首批100多家伙伴入场

腾讯于9月2日正式上线WorkBuddy开放平台,并发布9款联名智能硬件及30多个行业应用,首批生态伙伴超100家。联名硬件涵盖智能眼镜、录音卡、麦克风、耳机等品类,合作品牌包括Plaud、科大讯飞、安克等。该平台是国内AI Agent赛道首个打通硬件、应用与开发者三层生态的开放平台,支持任务与记忆在多设备间无缝流转。腾讯方面表示,硬件厂商接入后无需自研AI,设备即可成为Agent的交互入口。平台同步推出Buddy应用入口,通达信、广发证券等伙伴已接入数据与工具,首批应用覆盖金融、法律、医疗等20多个领域。WorkBuddy自今年3月上线以来,已迭代50多个版本,落地政务、教育、传媒等50多个行业。典型案例包括服务广东政务系统的湾擎·WorkBuddy、山东莱州6000多名教师的AI助教项目,以及参与央视达沃斯论坛报道。

来源:量子位

2000万月活的WorkBuddy,腾讯还是“嫌它瘦”

腾讯旗下AI编程工具WorkBuddy月活跃用户已达2000万,但腾讯方面仍认为其商业化进展未达预期。该产品定位为面向开发者的智能助手,提供代码补全、自动生成及项目级上下文理解等功能。尽管用户规模增长迅速,腾讯内部评估认为其付费转化率与客单价偏低,尚不足以支撑独立业务线。据悉,腾讯正考虑调整WorkBuddy的运营策略,探索与云业务及企业服务深度捆绑,以提升变现能力。目前,国内AI编程赛道竞争激烈,多家厂商已推出同类产品,市场格局尚未固化。腾讯此举反映出大厂对AI工具类产品从追求用户量转向注重实际营收的考核导向。

来源:36氪

火速吃瓜,OpenAI模型还没发又惹出争议了??

OpenAI近期因新模型发布前的安全审查流程引发外界讨论。该公司在正式推出产品前,需对模型进行一系列安全检测,以评估潜在风险并确保符合监管要求。这一流程导致部分新功能或模型的公开时间出现延迟,引发部分用户和开发者关注。目前OpenAI尚未公布具体模型的技术参数或发布日程,相关争议主要围绕审查周期对产品迭代速度的影响。市场方面,该事件暂未对OpenAI主要合作方或行业格局产生明显冲击,但外界持续关注其后续应对措施及官方回应。

来源:36氪

世界生成模型来了3D头部玩家,可进入生产管线的场景级生成时代来临!

影眸科技发布世界生成模型WorldGen,将3D生成从单一资产拓展至完整可交互场景。用户上传一张场景图,约2至3分钟即可生成由独立3D资产构成的虚拟环境,每个物体可单独移动、替换,并具备碰撞体、质量等物理属性,支持进入Blender、Unity等生产管线二次编辑。该技术基于其去年获SIGGRAPH 2025最佳论文的CAST方案,同期获奖商业公司仅谷歌与Meta。WorldGen已应用于具身智能仿真、游戏关卡设计及影视预演,与地瓜机器人、谋先飞等合作构建机器人训练闭环,并接入英伟达Isaac Sim生态。目前该模型已进入实际影视项目制作流程,灰度测试期间获多位游戏从业者关注。

来源:量子位

陈大年复出,入局大模型

陈大年复出创办StartLux(原点星辉),推出首款27B参数本地模型StartLux-V1.0-27B-Preview。该模型在信通院MCP专项测试中综合得分39.25%,排名第二,仅落后DeepSeek-V4-Pro(1.6万亿参数)1.3个百分点,并超越DeepSeek-V4-Flash和Step-3.7-Flash。在位置导航、金融分析、浏览器自动化等单项任务中位列第一。实测中,该模型处理金融计算和机票查询任务时,准确性和效率均优于Claude Sonnet 4.6。StartLux专注本地模型商业化,不依赖云端,可直接运行于消费级PC。模型基于Qwen3.6-27B训练,采用自主研发的Auto Research后训练方法,强化Agent工具调用与任务执行能力。陈大年认为,本地模型将在三年内与云端旗舰打平并占据80%市场,模型参数竞赛并非唯一路径。

来源:量子位

让Agent读懂业务,WPS要帮打工人手搓办公应用

金山办公旗下WPS推出面向企业用户的智能体开发平台,支持非技术人员通过自然语言描述需求,自动生成可对接内部数据的办公应用。该平台内置业务对象模型,能理解表格、文档中的字段含义,并调用WPS现有编辑、审批、流程等能力。企业可将常用操作封装为标准化组件,供不同部门组合使用。平台提供低代码调试界面,允许用户调整逻辑分支与数据权限。首批合作案例显示,某制造企业用其搭建了自动汇总多工厂日报并生成管理看板的工具,开发周期从两周缩短至半天。WPS表示,该服务旨在降低企业数字化门槛,后续将开放更多预置行业模板,并支持与钉钉、飞书等第三方系统的数据互通。目前该功能已开启定向邀测,商业化定价尚未公布。

来源:36氪

“你用AI取代我?我就用AI取代你,”被CEO用AI裁掉后,他们反手造了个“AI CEO”:已狂揽3.5k+Star

被裁员工用AI反击CEO,开发出名为“AI CEO”的开源项目,上线后迅速获得超3500个GitHub星标。该项目由一群因公司引入AI而被解雇的工程师发起,旨在模拟企业高管的决策逻辑,自动生成管理指令、绩效评估甚至裁员建议。开发者称,此举并非单纯报复,而是为了展示AI在管理岗位上的局限性,并讽刺企业盲目用算法替代人力。项目包含预设的“CEO人格模型”,可接入企业通讯工具,自动回复员工提问并输出战略备忘录。目前该工具已吸引大量科技从业者关注,部分网友评论称其“用魔法打败魔法”,也有专家提醒,此类工具可能加剧职场对立情绪。截至发稿,项目仍在持续迭代,开发者计划加入更多董事会场景模拟功能。

来源:36氪

从内部 Side Project 到 3.9 万开发者使用,Kiro Crew 创造者亲述开发幕后

亚马逊云科技三位工程师开发的AI开发工具Kiro Crew已正式开源。该工具基于Kiro CLI构建,定位为可持续运行的AI开发工作空间,旨在解决开发者需手动协调多个AI代理、跨会话维护上下文的问题。其核心功能包括跨会话保留状态与任务进度、将纠正和失败经验沉淀为可复用技能、支持Mac及本地容器和远程机器部署,并提供桌面端、网页端、CLI、Slack等入口。安全方面配置了七层防护,涵盖运行隔离、权限控制和操作审计。该项目从内部Side Project起步,目前已有超过3.9万名开发者使用,近500名贡献者参与开发。9月4日,核心创造者陈柏霖将进行线上直播,讲解设计思路并演示无人值守开发场景。

来源:InfoQ

奥特曼首次明确表态:OpenAI将自研人形机器人

OpenAI首席执行官萨姆·奥特曼近日首次公开确认,该公司将自主研发人形机器人。这一表态标志着OpenAI从原先仅投资外部机器人企业的策略,转向内部硬件研发。目前,OpenAI已组建专门团队,并计划利用其大模型技术为机器人提供智能决策支持。业内分析认为,此举将加剧与特斯拉Optimus、Figure AI等企业的竞争,并可能推动人形机器人成本下降与商业化进程。具体产品发布时间与原型机参数尚未披露。

来源:36氪

Claude后台接管电脑,真·赛博替身,人机并行时代来了

Anthropic推出Claude后台自动化功能,可让AI在后台接管电脑执行多步骤任务,实现人机并行操作。该功能基于Claude模型,支持用户设定目标后由AI自主完成文件处理、数据整理、软件操作等复杂工作流,期间用户可同时处理其他事务。官方称其具备任务分解、实时环境感知与错误修正能力,适用于报告生成、批量邮件处理等办公场景。目前该功能已向Pro和Max订阅用户开放测试,企业版将于近期上线。市场分析认为,此举标志着AI助手从对话交互向主动执行的关键跨越,或将对RPA(机器人流程自动化)行业形成直接竞争,但安全性与权限控制仍是其商用推广的主要挑战。

来源:36氪

Homer AI好马亮相2026中国国际福祉博览会,VLX空间理解能力赋能AI可穿戴设备

Homer AI携其VLX空间理解技术亮相2026中国国际福祉博览会,该技术可赋能AI可穿戴设备。VLX具备实时三维环境感知与语义理解能力,能帮助视障用户识别障碍物、读取文字信息并规划安全路径。展会现场展示了集成该技术的智能眼镜原型,其响应延迟低于50毫秒,定位精度达厘米级。Homer AI表示,该方案已与多家辅具厂商达成合作,预计年内有消费级产品上市。此次亮相标志着空间AI从实验室走向助残实用场景,为行动与视觉障碍人群的日常出行提供更智能的辅助支持。

来源:36氪

当Agent开始“吃数据”,传统湖仓不够用了:华为云重构数据基础设施

华为云近期在数博会上提出,随着AI模型与智能体成为新的数据消费主体,企业数据基础设施正从传统湖仓向多模态湖仓、AI数据湖及数据智能体方向演进。华为混合云总裁顾雪军指出,智能体时代数据需直接参与模型训练与推理,企业分散在云端、数据中心及生产系统的数据若无法统一接入,智能体将难以深入核心业务。为此,华为云基于混合云架构构建AI-Ready数据平台,将数据链路分为管数、供数、用数与流通四个环节,并推出AI DataLake多模智能数据湖以提升供给速度与规模。其DataArts工具可统一接入IT、OT、ET及企业知识数据,内置40余种算子。同时,华为云构建可信数据流通环境,解决数据主权与操作留痕问题,相关能力已应用于上海城市数据空间等项目。此外,数据价值出口正向模型调用与Token延伸,贵州数据宝等企业日均Token调用量超千亿次。

来源:InfoQ

阿里、智谱、MiniMax集体“补血”:AI赛道的窗口期,可能只剩这一两年了

阿里、智谱及MiniMax近期相继完成新一轮大额融资,引发市场关注。其中,阿里云获得来自国有资本与战略投资者的追加注资,资金将用于AI基础设施与云计算研发;智谱AI完成新一轮数十亿元融资,投后估值显著提升,重点投向基座大模型迭代及行业应用落地;MiniMax亦宣布获得新一轮融资,资金用于多模态模型与海外市场拓展。三家头部AI公司密集“补血”,反映出当前AI赛道竞争加剧,资本向头部项目集中。业内分析认为,大模型训练成本高企,商业化路径尚未完全跑通,企业需储备充足资金以应对算力、人才及研发的持续投入。有投资人判断,AI行业格局重塑的窗口期可能仅剩一至两年,届时具备资金与技术双重优势的企业将占据主导地位,而融资能力不足的中小玩家面临出清风险。

来源:36氪

“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价

美国AI初创公司Anthropic于近日发布其最新大语言模型Claude Opus 5,宣称在多项基准测试中性能对标OpenAI的GPT-5系列,但API调用价格仅为后者约15%。该模型主打推理与代码生成能力,上下文窗口扩展至200万token,支持更复杂的多步骤任务处理。Anthropic首席执行官姚顺宇在发布会上给予高度评价,称其为“当前性价比最优的旗舰模型”,并强调该产品将降低企业级AI应用门槛。市场分析指出,此举可能加剧高端AI模型的价格竞争,推动行业定价体系重构。目前,该模型已向开发者开放API,并同步登陆其消费级应用。

来源:36氪

3个月拿下 3000 star,只因我们比 MinerU 多做了这件事

开源项目Knowhere于5月发布完整技术栈,三个月内在GitHub收获近3000星标。该项目定位为复杂文档与AI Agent之间的记忆层,专注解决RAG与Agent落地中文档结构信息丢失的问题。与文档解析工具MinerU将PDF转为Markdown不同,Knowhere在解析后额外执行结构重建:通过树形算法恢复章节层级,为图片表格做OCR与摘要并关联

来源:InfoQ

杭州小团队做了台「AI对讲机」,3天众筹了1000%

杭州一支小型创业团队推出AI对讲机产品,上线众筹平台仅三天便达成超1000%的筹款目标。该设备集成语音识别与大模型交互功能,支持实时翻译、信息查询及语音助手服务,面向户外活动、团队协作及日常通讯场景。团队表示,产品采用轻量化设计,强调离线与弱网环境下的可用性,并计划根据众筹用户反馈优化功能后投入量产。此次众筹成绩反映出市场对AI硬件细分品类的兴趣,也为小团队切入智能穿戴赛道提供了参考案例。

来源:36氪

上头AI裁员的老板里,超过一半都后悔了

一项针对已实施AI裁员企业的调查显示,超过半数老板对此决定表示后悔。该调查覆盖了数百家采用自动化替代部分岗位的公司,主要涉及客服、数据录入及初级分析岗。后悔的主因包括:AI系统初期部署成本高企、维护复杂,且实际产出效率未达预期;同时,仓促裁员导致团队知识断层,客户投诉率上升,补救性招聘反而增加了人力开支。部分管理者指出,AI更适合辅助决策而非完全替代人工,尤其在需要情感沟通与灵活应变的场景中表现不佳。目前,约三成受访企业已重新招聘部分被裁岗位,或转向“人机协作”模式以平衡成本与服务质量。业内分析认为,这一现象反映出企业在技术转型中对人力价值评估的偏差,未来裁员决策将更趋谨慎,并优先考虑对员工进行技能重塑而非直接解雇。

来源:36氪

李飞飞首个多模态世界模型 Atlas 正式发布:从零开始预训练,几张图就能构建世界

李飞飞创办的World Labs于近日发布新一代多模态世界模型Atlas。该模型从零开始预训练,原生处理文本、图像、视频和3D数据,面向部分合作伙伴开放早期访问。Atlas具备四大能力:支持像素级相机控制,从单张或多张图像生成最长1分钟1440p视频;可根据一张或数十张图像重建真实3D场景,性能优于专用重建模型;能对输入视频进行时空建模,支持机器人真实到模拟的工作流程;还可根据文本生成图像及360度全景图。Atlas采用多模态自回归扩散Transformer架构,逐元素生成序列,并将相机位姿和深度作为处理数据类型。World Labs由李飞飞与Justin Johnson等人于2024年共同创立,团队背景集中于视觉、图形学和三维表示。公司此前已于2025年11月12日向所有用户开放其世界生成产品Marble,支持从文本、图像等生成、编辑和导出三维场景。

来源:InfoQ

Omdia最新市场研究报告:OceanBase位居亚太分布式数据库市场第一

Omdia发布《2026年亚太及大洋洲分布式数据库市场研究》显示,按2025年收入计算,OceanBase位居该区域市场第一。报告称,2025年亚太及大洋洲分布式数据库市场规模达9亿美元,预计2029年增至18亿美元,复合年增长率19.3%。中国处于领先位置,印度、日韩及东南亚市场增长迅速。OceanBase已服务全球超4000家客户,包括100多家金融科技企业和400多家金融机构,其中超60%金融机构将其部署于核心业务系统。2026年8月,老挝外贸大众银行与OceanBase签署合作,推动核心银行系统升级。OceanBase已在新加坡设立国际总部,业务覆盖超60个地理区域的240多个可用区,支持六大公有云。报告还指出,AI能力正被集成至分布式数据库,OceanBase于今年6月推出湖库一体AI数据库,以支持AI Agent工作负载。

来源:InfoQ

AI窗口期只剩3-4年,98%的企业却高估了自身的技术成熟度

麻省理工学院研究报告显示,企业级AI试点中仅约5%能进入生产环节并产生可量化回报,其余95%投资未见收益。任务型生成式AI工具渗透率从评估阶段的60%递减至试点的20%,最终成功实施率仅5%。IDC数据指出,超60%企业自认AI应用成熟,但经测算,全球49.6%、中国54%的企业仍处早期探索阶段,迈入高阶成熟度的不足3%。AI评测机构METR追踪发现,前沿AI智能体自主完成任务时长约每7个月翻一番,技术迭代加速与企业组织线性演进间的落差成为落地主要矛盾。深信服CEO何朝曦归纳五大困境:数据割裂导致建不动、算力账单失控致用不起、安全风险致不敢用等。业界提出重构路径,包括建立统一算力网关实现2至5倍成本压降、建设跨协议统一数据底座以提升检索准确率至95%以上,以及构建AI赋能的主动安全体系。

来源:InfoQ

亚马逊云科技推出规范驱动组合:数据工作流不再靠复制代码

亚马逊云科技推出规范驱动组合模式,用于构建灵活的数据转换工作流。该模式将工作流意图与处理逻辑分离,减少重复的流水线代码,并简化验证与治理。其无服务器实现基于AWS Lambda、Step Functions、S3和OpenSearch Service。 该模式面向数据流水线因数据集和工作流变体增多而难以维护的场景。传统脚本实现将编排、转换和验证逻辑绑定,引入新数据集需修改代码并重新部署,增加追踪难度。规范驱动组合将工作流分为意图层(含规范)、组合层(验证规范并组装流水线)和处理层(执行转换)。 规范以JSON或YAML描述源/目标数据集、字段映射及转换,不定义具体实现。组合器验证规范并生成可运行工作流,能力注册表保存可复用转换函数的元数据。示例中,S3事件触发Lambda组合器,查询OpenSearch能力元数据,创建并启动Step Functions状态机调用Lambda处理器,追踪信息发送至CloudWatch Logs。注册表支持能力发现和版本化引用,规范可包含数据分类标签以验证最终分类并生成脱敏产物。 该模式适用于受监管报告、多数据源集成和可复用ETL场景,但简单环境可能引入不必要复杂性。

来源:InfoQ

Meta新模型逼平Fable 5,小扎:开源且便宜到你懒得算账

Meta于近日发布新一代开源大模型,官方宣称其性能已与闭源标杆Fable 5持平。公司CEO扎克伯格强调,该模型不仅完全开源,且推理成本极低,低至“无需精细核算”的程度。此次发布的模型在多项基准测试中表现出色,覆盖文本生成、复杂推理及代码任务等场景。Meta此举旨在通过开源策略与低价推理吸引开发者,进一步扩大其在AI生态中的影响力。业内分析认为,该模型的推出将加剧大模型市场的价格竞争,并对闭源商业模型形成直接压力。目前,该模型已向研究社区及企业用户开放下载与商用授权。

来源:36氪

花费万元定制PPT的老师,困在AI课堂的表演里

AI行业资讯:近期,教育领域出现一种现象,部分教师花费上万元定制精美PPT课件,用于课堂教学展示。然而,这种过度依赖AI工具制作课件的做法,被指使教师陷入“表演式”教学的困境。报道指出,教师将大量精力投入课件视觉呈现与流程设计,反而削弱了课堂互动与教学实质。该现象引发对AI技术在教育应用中边界的讨论,即技术辅助应服务于教学核心,而非成为形式化负担。目前,相关教育从业者呼吁回归教学本质,合理利用AI工具,避免本末倒置。

来源:36氪

AI巨头又开始“互卷”,Google、Meta同时出手:Gemini 3.8、Muse Spark 1.3重磅发布

谷歌与Meta于同日发布新AI模型。谷歌推出Gemini 3.8,Meta发布Muse Spark 1.3。Gemini 3.8在多模态推理和代码生成能力上有所提升,支持更长的上下文窗口,并优化了响应速度。Muse Spark 1.3侧重图像生成效率,改进了高分辨率输出和风格一致性,同时降低推理成本。两家公司选择同期发布,被视作在生成式AI市场中的直接竞争。目前,两款模型均已在各自云平台开放API供开发者测试。此次更新未公布具体参数规模,但均强调在特定基准测试中的性能提升。市场分析认为,此举将加剧AI模型服务在价格与功能上的比拼。

来源:36氪

三个关键词,说透爆火的“机器鸭”

机器鸭近期走红,其核心特征可归纳为三点:仿生设计、低成本交互与场景适配。该产品以鸭子形态搭载基础运动模块,售价低于同类玩具,主打儿童陪伴与情绪解压市场。技术层面,其采用简易传感器实现避障与跟随功能,未涉及复杂AI算法。市场反馈显示,产品上线两周内销量突破五万件,主要依托短视频平台传播。业内分析认为,其爆火

来源:36氪

量产元年,2026年人形机器人开始“上班”了

2026年被业界视为人形机器人量产元年,多家厂商宣布产品进入实际工作场景。技术层面,新一代机器人采用高扭矩密度关节电机与端到端神经网络控制算法,行走速度提升至每小时7公里,并能完成搬运、分拣等基础操作。供应链方面,核心零部件如谐波减速器与力传感器成本较2024年下降约四成,推动整机售价降至20万元人民币区间。市场应用集中在制造业装配、物流分拣及商用接待领域,已有数家工厂部署超百台规模的机器人产线。行业预测全年全球出货量将突破五万台,其中中国市场占比过半。资本层面,头部企业完成新一轮数十亿元融资,资金主要用于扩建年产万台级别的智能工厂。不过,复杂环境下的自主决策能力与长时间运行稳定性仍是制约规模化落地的关键瓶颈。

来源:36氪

中国 AI 产业版图:千亿 AI 公司与互联网大厂的实力坐标

中国人工智能产业呈现双梯队竞争格局。第一梯队为估值超千亿元的AI独角兽,如商汤科技、旷视科技、云从科技等,聚焦计算机视觉、语音识别等垂直领域,技术积累深厚但盈利压力较大。第二梯队为百度、阿里、腾讯等互联网巨头,依托云计算、大数据及庞大用户场景,将AI嵌入搜索、电商、社交等核心业务,商业化路径更清晰。当前市场呈现“技术公司求变现、平台公司抢入口”的态势,AI企业需在算法研发与商业落地间寻求平衡。行业整体仍处于高速投入期,头部企业估值与研发投入持续攀升,但同质化竞争加剧,细分赛道洗牌加速。未来竞争焦点将从单一技术指标转向产业数字化解决方案的综合能力,跨行业合作与生态构建成为关键变量。

来源:36氪

美国司法部力挺OpenAI:AI训练可以不付版权费?

美国司法部近期在一份法庭文件中表态,支持OpenAI等AI企业在未经授权情况下使用受版权保护材料进行模型训练。该意见针对作家与艺术家起诉AI公司侵权案件提出,认为现行合理使用原则可涵盖AI训练行为,但强调需评估具体使用目的与市场影响。司法部同时建议法院审慎处理,避免直接否定AI训练合法性,并指出若过度限制可能阻碍技术创新。此举被业界视为对生成式AI行业的重要法律利好,或影响后续相关版权诉讼走向。OpenAI未就此事公开回应,案件仍在审理中。

来源:36氪

全球首个通用决策大模型,AI推演现实世界的技术揭秘

全球首个通用决策大模型已发布,其核心功能在于对现实世界进行AI推演。该模型突破了传统AI仅处理文本或图像的局限,能够模拟复杂系统的动态演变过程。技术层面,模型通过整合多源数据与强化学习机制,构建出可预测现实事件走向的决策框架。市场分析认为,这一技术将显著提升企业在战略规划、风险管控等领域的预判能力,并可能推动智慧城市、金融风控等行业的智能化升级。目前,该模型的具体参数与开放平台细节尚未完全公开,但研发方表示其已在小规模实测中展现出优于传统算法的推演精度。业内专家指出,通用决策大模型的落地仍需解决算力消耗与数据隐私等挑战,但其标志着AI从“感知理解”向“主动推演”的关键跨越。

来源:36氪

微软 VS Code 纪录片明日开播,聚焦 10 年演变与 AI 适配

微软宣布将于太平洋时间9月4日早8时(北京时间当晚23时)在官方YouTube频道播出纪录片《The Story of VS Code》,回顾该代码编辑器自2016年4月发布1.0版本以来的十年发展历程。影片由Stefan Kingham执导,通过原始开发团队成员及全球社区参与者的叙述,呈现VS Code从瑞士苏黎世一个初创项目成长为跨平台核心开发工具的过程,内容涵盖早期开发背景及社区对其演进的影响。近期VS Code版本更新中大量引入AI相关功能,纪录片将重点展示这一技术转型。微软希望通过创作者的第一手讲述,还原产品的设计与迭代逻辑。

来源:IT之家

MiniMax、阿里同时布局视频Agent,拼完模型开始拼工作流?

MiniMax与阿里云近期相继发布视频智能体产品,标志国内大模型竞争从基础模型转向工作流落地。MiniMax推出视频生成与编辑智能体,支持多镜头脚本规划、素材自动剪辑及口型同步,可一键生成完整短视频;阿里则发布“通义”系列视频Agent,聚焦电商直播与营销场景,能根据商品信息自动生成解说词并匹配画面。两家厂商均强调从“单点生成”转向“任务闭环”,即模型需理解用户意图并自主调用工具完成拍摄、剪辑、配音等全流程。业内分析认为,视频Agent比拼重点已从模型参数与画质,转向对复杂指令的拆解能力及多工具协同效率。目前该赛道仍处早期,商业化路径尚待验证,但头部厂商加速布局或推动视频生产从辅助工具向自动化工作流演进。

来源:36氪

谷歌发新模型全网又高潮?

谷歌发布新一代人工智能模型,引发行业关注。该模型在多项技术基准测试中表现突出,尤其在复杂推理与多模态任务处理能力上实现显著提升。据官方披露,新模型采用更高效的架构设计,在保持低延迟响应的同时降低了计算资源消耗。目前该模型已向部分开发者和企业用户开放测试接口,预计后续将逐步集成至搜索、云服务等核心产品线。市场分析认为,此举将加剧大模型领域的竞争格局,并可能推动下游应用成本进一步下降。谷歌方面表示,新模型旨在解决此前版本在长文本理解与逻辑一致性方面的短板,未来将根据反馈持续迭代。

来源:36氪

马斯克:AI巨浪已至,吸干全球救命钱

马斯克近日公开警示人工智能产业的资金虹吸效应,称AI浪潮正吸干全球范围内的关键投资资源。他指出现阶段大量资本、电力及算力被集中投入AI基础设施建设,导致其他科技领域与基础民生项目面临资金短缺。此番言论聚焦于AI发展对传统产业和公共资源的挤出影响,并担忧过度集中的投入可能引发系统性风险。马斯克未透露具体数据,但强调当前投资节奏不可持续,呼吁行业重新评估资源配置的平衡性。该表态引发市场对AI泡沫化及后续监管讨论的进一步关注。

来源:36氪

颜水成团队新作:Scaling Harness Intelligence

颜水成团队发布最新研究成果,聚焦“Scaling Harness Intelligence”方向。该研究提出一种新的技术路径,旨在解决大模型规模扩展过程中智能增长与效率平衡的问题。团队通过优化模型架构与训练策略,在保持推理性能的同时降低计算开销,相关技术参数与实验数据尚未完全公开。该成果被视为对当前大模型“堆参数”路线的补充,或为行业提供更高效的规模化方案。目前论文尚未正式上线,具体应用场景与落地计划待后续披露。

来源:36氪

智谱上半年亏20亿,跑天猫卖Token能解盈利困境么?

智谱AI发布上半年财务数据,净亏损达20亿元人民币。为拓宽营收渠道,该公司已入驻天猫平台,开始面向个人及中小企业销售Token(人工智能模型调用量)。此举被视为其探索商业化变现、缓解盈利压力的尝试。Token销售按使用量计费,用户可直接购买不同规格的模型服务包。目前,智谱AI尚未公布该业务线的具体销售额预期。业内分析认为,此举反映出大模型厂商正从单纯技术竞赛转向更务实的市场落地阶段,但能否借此扭转亏损局面仍待观察。该公司同时表示,将持续投入底层模型研发,以维持技术竞争力。

来源:36氪

跑赢人类之后,人形机器人盯上了挥拍运动

人形机器人领域近期出现新动向,继攻克跑步、跳跃等基础动作后,研发重点转向羽毛球、乒乓球等挥拍类运动。相关技术团队通过优化动态平衡算法与实时轨迹预测系统,使机器人能够完成高速移动中的精准回球,反应速度与落点控制已接近业余选手水平。业内分析认为,此类运动场景对瞬时决策和全身协调要求极高,其技术突破可迁移至工业巡检、医疗康复等复杂操作领域。目前已有初创公司启动专项融资,计划将运动控制模块成本降至万元级以下,以推动商用落地。市场观察人士指出,挥拍运动或成为人形机器人从实验室走向实际应用的关键测试场,但距离成熟产品化仍需解决续航与极端环境适应性等问题。

来源:36氪

“AI浏览器”的最大问题,可能是不够安全

AI浏览器在快速发展的同时暴露出安全隐患。多家安全机构测试发现,当前主流AI浏览器存在提示词注入漏洞,恶意网页可窃取用户对话数据或操控浏览器执行非授权操作。此外,AI浏览器的自动摘要与网页交互功能扩大了攻击面,其权限管理机制尚不完善,难以有效隔离不可信内容。业内专家指出,安全设计滞后于功能创新是根本原因,建议厂商在模型层引入内容过滤,并在浏览器架构中增加细粒度权限控制。目前,部分企业已着手修复已知漏洞,但行业尚未形成统一安全标准,用户需警惕使用风险。

来源:36氪

新国标落地,AI客服给出的承诺企业都得认

新国标正式实施后,AI客服作出的服务承诺将被视为企业有效合同内容,企业须履行相应责任。该标准明确了AI客服在售前咨询、售后处理等场景中的法律效力,规定其答复与人工客服具有同等约束力。同时,标准要求企业建立AI客服内容审核与追溯机制,确保承诺可查证、可执行。业内认为,此举将倒逼企业优化AI客服话术准确性,减少推诿现象,并推动客服行业建立统一服务规范。新规还鼓励企业为AI客服设置权限边界,对超出能力范围的诉求须及时转接人工。该标准落地预计将提升消费维权效率,降低因AI答复不一致引发的纠纷。

来源:36氪

阿里花1000亿搞AI,美图花不到5个亿

阿里巴巴宣布未来三年将投入超过1000亿元用于人工智能基础设施建设,重点覆盖云计算、大模型研发及算力网络。美图公司同期披露,其AI相关投入累计不足5亿元,主要聚焦于图像处理垂直场景的轻量级模型应用。两家企业投入规模相差逾200倍,反映出国内AI赛道正出现明显的分层:头部平台押注通用大模型与底层算力,中小厂商则选择细分领域低成本落地。市场分析认为,巨额资本开支将加剧算力资源集中,而轻量级玩家的盈利路径依赖场景化产品快速变现。目前,阿里云已启动多个智算中心建设,美图则宣布将AI功能嵌入旗下修图软件会员体系。行业观察指出,投入差距可能影响未来技术迭代速度,但垂直应用仍存在差异化竞争空间。

来源:36氪

Diagrid Catalyst 2.0 发布,为 AI 智能体新增持久化、可验证的执行能力

Diagrid于7月28日发布Catalyst 2.0,为基于LangGraph、Microsoft Agent Framework、Google ADK及Dapr Agents等框架构建的AI智能体新增故障恢复与加密验证功能。该版本提供十个框架集成,开发者仅需在现有应用中添加一个Diagrid包,即可将模型及工具调用表示为持久化工作流活动,使中断任务能从中断处恢复,避免重复已完成工作。 Catalyst可运行于云端、本地及隔离网络,持久化智能体通过Python SDK构建,工作流SDK支持.NET、Go、Java、JavaScript和Python。验证模型源自Dapr 1.18,其对工作流历史事件进行批量哈希并链接签名,通过SPIFFE身份验证历史完整性,可检测删除、重排或修改的记录。签名功能默认禁用,依赖mTLS,且无法追溯签名。 Diagrid称Catalyst性能可达开源Dapr的十倍,支持数百万并发工作流,但未披露具体测试条件。商业层面提供免费云端套餐及按并发规模计费的专属云方案。蔡司集团为早期用户。分析师指出,加密证明不保证决策正确性,团队需评估非幂等工具重试及存储开销。

来源:InfoQ

OpenAI 首席科学家回应“AI 推理不透明”争议:复杂度未跳跃增长

OpenAI首席科学家雅库布·帕乔基9月2日在X平台发文,回应外界关于AI模型Astra“推理不透明”的争议。帕乔基表示,包括Astra在内的前沿模型,其计算图深度与GPT-4相差不到两倍,架构并未出现跳跃式复杂度增长。他称OpenAI自推出推理模型以来,一直重视并维护思维链监控技术,该技术目前仍较脆弱,但可通过措施加强,这也是当前研究核心目标之一。 此前有媒体报道称,OpenAI正测试“深度循环”技术,该技术让模型重复调用同一组网络层,可能使推理更多停留在难以直接阅读的内部状态,增加外部监控难度。帕乔基的回应旨在澄清,避免因混乱报道引发AI冲向不可监控状态的竞赛。计算图深度是衡量神经网络架构复杂度的核心指标,数值越大表示结构越复杂。

来源:IT之家

刚刚,OpenAI新Transformer火了,Astra架构首次曝光

OpenAI最新Transformer模型引发关注,其Astra架构细节首次公开。该架构在技术层面实现多项突破,包括更高效的计算资源利用与推理速度提升,并针对长序列处理能力进行优化。目前该模型已进入安全测试阶段,重点评估潜在风险与可控性。业内认为,Astra架构的亮相可能推动大模型训练效率与部署成本的结构性变化,或对现有AI竞争格局产生影响。相关技术论文与基准测试数据尚未完全披露,后续进展有待观察。

来源:36氪

超越偏移量延迟:PB 级规模下 Hudi 数据湖流水线的队列等待时间计算

Twilio公司数据湖管道基于Apache Hudi Delta Streamer从Kafka摄取数据,2025年第四季度月处理超五万亿条记录,峰值每秒1290万条消息。传统消费者延迟指标显示正常,但下游分析团队仍报告数据滞后数小时。原因是Hudi管理自身检查点并存储于S3,与Kafka消费者组偏移量追踪分离,标准监控工具无法感知实际提交状态。为此,Twilio开发了外部指标报告器,每15分钟运行一次,通过读取Hudi时间线获取最新提交的检查点偏移量,定位各Kafka分区中尚未写入数据湖的首条消息,提取其时间戳,以当前时间减去该时间戳计算真实数据新鲜度。若延迟超过阈值则上限设为7天,无有效检查点则不输出指标。该方法无需修改管道或增加埋点,仅利用已有元数据即可精确定义和执行自定义数据新鲜度SLA。

来源:InfoQ

GuanceDB 3.1:从 Bloom 过滤走向全字段倒排,重塑千亿级可观测性数据秒级查询体验

可观测性数据平台GuanceDB发布3.1版本,核心变化是将倒排索引与全文检索引入全字段查询路径,替代传统Bloom过滤器方案。该版本支持指标标签、资源属性、链路及RUM维度等结构化数据的倒排索引,同时为日志正文等长文本提供分词全文索引,实现行级候选定位而非块级“可能命中”。 Bloom过滤器作为概率型结构,仅能判断值是否存在,无法定位具体记录,在多条件、低命中率及负查询场景下会产生大量候选块,需后置扫描确认。GuanceDB 3.1通过posting list记录词项对应的行号集合,执行器可优先处理选择性最高的条件,通过有序归并或位图运算快速求交,空交集时无需读取完整记录即可终止查询。 架构上,写入、查询与compaction节点分离,索引生成及段合并由独立资源池承担,支持按峰值弹性扩容,并可利用Spot实例降低后台任务成本。高频词、纯负查询及大返回量场景仍受边界约束,但行级集合与选择顺序显著改善了千亿级数据下的组合条件查询效率。

来源:InfoQ