535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺
人工智能领域知名学者吴恩达公开支持一项开源大模型训练直播项目。该项目将规模达5350亿参数的大模型训练过程全程公开,包括代码、数据及损失函数变化,直播持续三个月。此举旨在提升AI训练的透明度与可复现性,引发业界广泛关注。项目方通过实时展示训练细节,为研究人员提供难得的实践参考,有助于推动大模型技术的开放研究与交流。吴恩达的力挺进一步提升了该项目的行业影响力。

每日 AI 快讯 · 实时追踪人工智能行业最新动态
人工智能领域知名学者吴恩达公开支持一项开源大模型训练直播项目。该项目将规模达5350亿参数的大模型训练过程全程公开,包括代码、数据及损失函数变化,直播持续三个月。此举旨在提升AI训练的透明度与可复现性,引发业界广泛关注。项目方通过实时展示训练细节,为研究人员提供难得的实践参考,有助于推动大模型技术的开放研究与交流。吴恩达的力挺进一步提升了该项目的行业影响力。
英伟达宣布将投入400亿美元布局开源生态,同时推进自研芯片与算力基础设施业务。该公司计划在保持GPU硬件销售主业的同时,深度参与大模型与AI应用开发,形成“卖铲子”与“自己挖矿”并行的双轨模式。此举旨在降低对单一芯片销售收入的依赖,并直接获取AI应用层增长红利。市场分析认为,该战略将加剧其与云服务商及开源社区既有合作方的竞争关系,但有望通过扩大AI整体市场容量反哺核心硬件需求。英伟达未披露具体技术路线图,但表示相关投资将覆盖模型训练框架、推理优化工具及行业解决方案。
AI智能体正逐步取代人类成为大模型API的主要调用方。据相关统计,当前AI智能体产生的token调用量已达人类用户的5.2倍,标志着AI自主调用AI的“机机交互”模式正成为主流。这一趋势反映出,随着智能体在编程、办公、客服等场景中的深度应用,其自主决策和连续执行任务的能力显著提升,进而带动底层模型算力消耗的指数级增长。业内分析认为,该变化将重塑AI产业链的商业模式,模型服务商的重心或从服务终端用户转向优化智能体调用效率。同时,这也对算力基础设施、API定价策略及模型响应速度提出更高要求。目前,多家头部科技公司已开始调整产品架构,以适配智能体主导的流量结构。
AI行业近期出现两笔巨额并购交易,合计金额约1500亿元人民币,引发市场关注。两起交易均围绕AI算力与模型竞争展开,收购方为科技巨头,标的分别为AI基础设施与模型服务领域的初创公司。业内分析认为,此举旨在争夺AI应用入口与底层技术话语权,通过整合算力资源与算法团队,强化自身在生成式AI赛道的生态闭环。交易完成后,收购方将获得更完整的模型训练与推理能力,并有望降低长期运营成本。市场反应显示,投资者对AI领域高溢价并购持谨慎乐观态度,认为资源向头部集中将加速行业洗牌,但短期内或推高相关领域估值泡沫风险。目前,两起交易尚待监管审批,后续进展及整合效果仍需观察。
商汤科技正式开源8B参数生图模型SenseNova U1.5 Lite。该模型支持3-4K字符超长指令遵循、原生图像编辑、中英文复杂排版及框选标记等精细视觉控制,可直接输出4K高清图。官方称其在复杂排版与精准编辑场景比肩闭源GPT-Image-2。模型沿用NEO-unify统一多模态架构,训练阶段先分别训练文字渲染、美学、编辑等专项专家,再通过多教师在线策略蒸馏技术MOPD融合回单一8B模型,部署时无需路由切换。实测中,该模型可完成九图拼接食谱卡片、多参考图融合海报、局部信息替换等任务,并保持原图空间关系与风格一致。
字节跳动已入股未来不远机器人最新一轮融资。该公司半年内完成三轮融资,累计超10亿元,投资方包括汇川产投、国方创投、德宁资本、纳爱斯等近10家机构。未来不远机器人定位家用通用机器人,已进入全国500多个家庭商用,覆盖家务、陪伴、陪护等场景。其第二代机器人F2在WRC上完成7步骤肉酱意面端到端烹饪。公司创始人张翼曾创办掌门教育,坚持全栈自研路线,构建数据-模型-体验-用户正向飞轮。公司2022年成立,前期用三年时间深度访谈上千户家庭并免费投放样机,2025年推出首代产品F1。目前已完成从轻家务到重家务的场景跨越,并实现同等配置下全行业最低成本。
Grafana Labs正式发布gcx CLI和Grafana MCP服务器两款工具,使AI编码代理能在开发过程中实时查询可观测性数据,从Grafana Cloud或自建技术栈提取指标、日志、追踪、SLO及合成监控结果。两款工具于4月在GrafanaCon 2026大会亮相,旨在弥合智能代理生成代码速度与工程师理解代码功能之间的差距。 架构上,Grafana MCP服务器提供针对常见用例的固定工具集,支持自托管及Grafana Cloud托管端点;gcx则为灵活的命令行工具,允许代理创建自定义工作流,兼容Grafana Cloud、开源版及企业版实例,并提供可安装技能包及Claude Code插件。 实际应用中,代理可基于观察到的系统行为制定实施决策,而非依赖训练数据假设。例如,添加新支付服务商时,代理检查现有RED指标,利用p95延迟数据设置测试模拟,并读取修改仪表盘、追溯代码及推送更新。Grafana Labs还推出实验性Agentic Testing功能,通过自然语言检查Web应用UI流程,弥补后端遥测无法捕获前端回归的问题。
AI行业正面临首个“失去的夏天”。多家头部大模型公司近期融资遇冷,风险投资对AI项目的审核周期显著拉长,部分原定于夏季完成的B轮及C轮融资被推迟或缩减规模。同时,企业级客户对AI采购预算收紧,更倾向于观望而非大规模部署。技术层面,基础大模型训练成本居高不下,但性能提升速度放缓,导致商业化回报周期超出预期。市场数据显示,二季度AI初创公司新增注册量环比下降约三成,裁员潮从中小团队蔓延至头部平台。分析师指出,资本退潮叠加落地场景不足,行业正从狂热扩张转向理性收缩,预计未来半年将出现明显的市场出清,部分缺乏核心竞争力的项目将被淘汰。
国内机器人产业近期呈现高速发展态势,多家企业密集发布新品并完成大额融资。技术层面,具身智能机器人从单一操作向复杂场景作业突破,部分产品已具备自主规划与多任务切换能力,核心零部件国产化率显著提升。市场方面,工业机器人装机量保持全球领先,服务机器人加速渗透至餐饮、医疗及物流领域,带动上下游产业链投资升温。资本端,数家头部创业公司完成新一轮数亿元级融资,资金主要投向大模型与运动控制算法的融合研发。行业分析认为,当前竞争焦点正从硬件参数转向数据采集规模与场景落地效率,但高精度传感器、减速器仍依赖进口,规模化商用尚需突破成本与安全验证瓶颈。整体来看,产业正处于从实验室原型向量产交付过渡的关键阶段,预计未来两年将出现多款面向垂直行业的标杆应用产品。
AI行业为应对算力激增带来的散热难题,正探索多种创新降温方案。目前主要路径包括:一是采用液冷技术,通过为服务器加装“水管”直接冷却芯片,相较传统风冷效率更高,已逐步成为数据中心主流选择;二是将服务器浸入特殊冷却液中“泡澡”,实现全浸没式散热,能大幅降低能耗并提升设备稳定性;三是尝试将数据中心沉入海底,利用海水自然降温,同时靠近用户减少延迟。这些方案均旨在解决AI大模型训练与推理过程中产生的巨大热量,降低运营成本,并提升算力部署的可持续性。业内认为,随着AI算力需求持续攀升,高效散热技术将成为基础设施的关键竞争点,目前相关技术已进入小规模试点或商业化应用初期阶段。
AI for Science正从工具级迈向系统级,行业进入项目时代。中科紫东太初旗下科研智能体ScienceClaw升级推出AutoProject引擎,旨在让AI承接完整科研项目,而非孤立任务。该系统由三层架构组成:Project2Task负责将模糊目标拆解为任务网络,TaskExecutor实现长程自主执行与动态反馈修复,EviGraph构建证据驱动的可信闭环。在带钢缺陷识别、YOLO建模等案例中,AI可自主完成规划、实验、校验全流程。公开评测显示,其综合得分0.865,证据可追溯率较最优基线提升40.74%。科研人员仍可随时介入纠偏,人机协同推进探索。此举标志着AI4S从单点能力走向系统级自主科研,工作单位正从Task转向Project。
OpenAI Codex负责人Tibo近期接受播客访谈,透露多项核心信息。他介绍,为方便重置用户使用额度,已专门设置实体按钮。Tibo认为,ChatGPT与Codex最终将融合为同一高度个人化的AGI产品,而非分立的编程或聊天工具。下一代Agent的关键不在于增加技能或记忆,而在于让这些机制隐形,用户无需管理复杂配置。他指出,笔记本电脑将成为AI Agent性能瓶颈,未来计算将更多依赖云端大规模资源。OpenAI正推进“Ultra Fast”极速模式,旨在将响应速度压缩至接近人类思考水平,以支持实时交互。他透露,OpenAI已在内部应用递归式自我改进,利用最强模型优化CUDA内核和推理栈,形成算力与性能提升的飞轮。Tibo还强调,OpenAI的差异化优势在于广泛分发和降低使用门槛,而非单纯模型参数竞争。
科学探索奖2026年度获奖名单公布,50位青年科学家入选,覆盖数学物理、化学新材料、天文地学、生命科学、医学、信息电子、前沿交叉、能源环境、先进制造、交通建筑等10个领域。获奖者来自13个城市的30家高校、医院及科研机构,其中北京大学肿瘤医院、上海科技大学等7家机构及郑州、泰安等城市系首次出现获奖人。本届出现多项纪录:首位“95后”获奖者周天贶来自北京理工大学,主攻智能光电计算;女性获奖者达10位,为设立八年来首次达到两位数。南开大学讲席教授Joshua Norbert Zahl因与菲尔兹奖得主王虹合作解决三维挂谷猜想而获奖。该奖由新基石科学基金会运营,每年资助最多50人,每人五年共300万元自由支配资金,并设“新星名额”优先支持年轻科学家。自2019年至今,已累计资助347位青年科研人员。
微软首席执行官萨蒂亚·纳德拉近日警告,企业若过度依赖单一人工智能模型,可能将自身知识与决策能力外包给模型供应商,削弱独立竞争力。他建议企业应掌控“Token资本”,即管理自身数据与模型交互的资产,避免被单一技术路线锁定。纳德拉强调,采用多模型策略、构建灵活AI基础设施,是保障长期自主性的关键。此番表态
Cloudflare发布CI SDK,允许开发者用TypeScript而非YAML定义持续集成管道,每个步骤作为持久化Workflow运行。该包面向Workers运行时,支持Wrangler等工具,初始集成从私有测试阶段的Artifacts读取代码库,代码库于2026年8月初以Apache 2.0许可发布。管道集成工作流、沙箱、容器、持久化对象及R2缓存,命令在隔离沙箱中执行,依赖缓存以文件系统快照形式存储。每阶段对应工作流步骤,失败步骤保留状态重试,步骤独立并发执行,开发者可用Promise.all()确保检查、测试、构建在部署前完成。Wrangler新增events字段,在代码推送事件时直接触发工作流。该SDK规定命令必须幂等,且返回未经机密屏蔽的原始输出。“自愈”功能作为单独示例发布,封装管道于try/catch中,失败时调用AI代理提出补丁,但未包含在包内。Cloudflare非首个此类方案,Dagger提供多语言SDK并支持OCI容器,但Cloudflare将执行绑定到工作流和沙箱以换取状态可恢复。
人民教育音像数字出版社与小猿达成合作,共同研发的“中小学课本学习智能体”于8月21日正式上线小猿AI学习机,成为首个落地该产品的智能硬件渠道。该智能体基于教材内容与猿力大模型,采用“AI伴学+AI导学”双模式,提供动态课本、点读跟读、背诵测评及1V1互动讲解等功能,覆盖语文、英语等学科。试点数据显示,持续使用学生语文学科知识点掌握量提升33.6%,英语提升24%,家长日均陪读时长减少20分钟。双方已签署合作协议,未来将推动该智能体在智能硬件生态中规模化应用。
2026年9月7日至8日,WAIC CONNECT MALAYSIA活动将在吉隆坡举办,旨在帮助中国AI企业对接马来西亚真实采购需求。活动聚焦政府智慧城市、通信运营商、金融科技、智慧教育四大核心赛道,并覆盖能源工业与交通物流等高潜力场景。主办方联合华为搭建对接通道,邀请马来西亚通讯与多媒体委员会、中国驻马大使馆代表及本地银行、高校、运营商决策者现场参与。活动设置3分钟企业亮相环节和1V1产业对接会,由专业对接专家陪同,围绕真实项目促进高效合作。参会规模限50至60家中国AI企业。
字节跳动旗下AI助手豆包完成与飞书的深度集成,升级为可执行复杂任务的智能体(Agent)。实测显示,用户可通过自然语言指令,让豆包在飞书内自动完成日程协调、文档处理、消息回复及审批流程等多项工作。该功能支持跨应用操作,例如根据会议纪要自动生成待办事项,或依据项目进度主动提醒相关人员。豆包此次更新重点强化了任务拆解与多步骤执行能力,能自主调用飞书API完成数据查询、信息同步等操作。目前该功能已向企业用户开放,旨在提升办公自动化效率,减少人工重复劳动。市场分析认为,此举标志着AI助手从单一对话工具向深度参与工作流程的协作型Agent转型,或将对现有办公软件生态产生重要影响。
风险投资行业正引入AI预测工具辅助决策。多家机构开始使用大语言模型分析技术趋势、评估创业项目潜力,并模拟市场演化路径。该工具能处理海量非结构化数据,包括论文、专利和商业计划书,生成早期投资信号。部分基金已将其用于尽职调查,自动生成风险清单和财务预测对比。业内反馈显示,AI在识别跨学科技术交叉机会和冷门领域突破方面表现突出,但尚无法替代合伙人对创始人团队的直觉判断。目前,该技术主要作为信息筛选和初步排序的辅助手段,最终投资仍由人工决策。有机构正尝试将AI预测结果与内部专家评分系统结合,形成混合评估模型。市场观察者认为,这一趋势可能改变传统风投依赖人脉和经验的模式,但短期内技术局限性和数据偏差仍是主要挑战。
三星芯片验证流程中引入Claude AI辅助处理报错,但AI在三次独立测试中均未正确执行指令:首次将红灯状态误改为黄灯,后续两次亦出现类似操作偏差。该事件暴露当前AI在硬件调试场景下的可靠性短板,尽管Claude能识别报错信息,但在执行物理状态变更时缺乏对安全语义的准确理解。三星内部评估认为,此类偏差
最新AI编码调查报告显示,Claude Code已超越GitHub Copilot,登顶开发者首选AI编码工具榜首。报告指出,约90%的受访程序员已在实际工作中使用AI编程助手,该比例较去年同期显著提升。Claude Code凭借更优的代码生成准确率与多文件编辑能力获得开发者青睐,而GitHub Copilot在代码补全速度上仍具优势。调查还发现,AI编码工具正从辅助片段生成向自主执行复杂任务演进,超过六成开发者将AI Agent用于测试编写与重构。市场格局方面,新兴工具如Cursor、Windsurf等正快速抢占份额,传统IDE内置助手面临转型压力。报告预计,随着模型推理成本下降,AI编码工具将进一步渗透至软件开发生命周期全流程,但数据安全与代码审查机制仍是企业采用时的主要顾虑。
Anthropic正筹备其史上最大规模IPO,目前处于安全检测阶段。该公司近期动作频频,旨在补齐上市前的关键短板。据悉,Anthropic重点强化了企业治理架构,并引入多位具有大型科技公司高管经验的独立董事,以应对监管审查。同时,其旗舰模型Claude系列持续迭代,最新版本在代码生成与长文本处理能力上实现突破,企业客户续费率保持高位。市场分析认为,Anthropic此次IPO估值有望突破千亿美元,将成AI领域里程碑事件。为支撑上市后扩张,公司正扩大云计算基础设施投入,并与多家芯片厂商深化合作以保障算力供应。此外,其合规团队规模较年初翻倍,重点应对欧盟《人工智能法案》等全球监管要求。业内观察人士指出,Anthropic正通过技术、治理、资本三线并进,为公开市场亮相做最后准备。
英特尔在Hot Chips 2026活动上披露了其AI推理加速卡Crescent Island的详细规格。该产品采用Xe3P架构,额定功耗为350W,最高可配置480GB内存,主要面向AI推理与智能体工作负载。官方未公布具体性能数据,但强调其内存容量与功耗设计旨在适配大规模模型推理场景。该加速卡预计将补充英特尔数据中心AI产品线,与现有Gaudi系列形成差异化定位。
实时购物平台Whatnot在Snowflake Summit 2026上分享了其数据架构实践。该公司2025年全球直播GMV达80亿美元,新增账户超2000万,每周直播超55万小时,2026年曾承载58.3万并发观众的直播活动。其后台每天产生数十亿条数据点,用于驱动实时推荐等体验。 初期Whatnot依赖集中式数据团队,后转向模块化数据栈,各业务单元可自建专属Snowflake仓库。为降低数据使用门槛,其分析工具历经三个阶段:2024年构建AI Slack机器人自动生成SQL;2025年接入Sigma等工具,text-to-SQL准确率超90%;2026年推出由Snowflake Cortex Agents驱动的Hex Threads对话式数据助手。该助手上线90天内,1000多名员工中超80%积极使用,17个部门实现100%活跃使用率。
中消协发布消费提示,提醒消费者谨慎使用人工智能服务。AI生成内容仅供日常参考,涉及价格、合同、售后等关键信息,必须通过官方渠道核实。经营者不得以“AI自动生成”为由推卸责任。理性看待AI,才能有效规避消费陷阱。
原力灵机发布具身智能模型DM0.5,登顶由港大、UC伯克利、清华等近20所机构联合推出的RoboDojo评测榜,平均成功率19.34%,显著高于榜单头部均值。该模型在Memory维度得分领先47.74分,三次随机测试的Cover Blocks任务均达100%成功率。其他评测中,LIBERO综合成功率99.0%,RoboTwin 2.0简单/复杂场景成功率93.6%/93.3%,VLA-Arena三档难度成功率89.0%/53.6%/44.1%。模型已全开源,支持60秒长记忆,可跨语言理解人类演示视频。团队采用分层双系统架构,结合5万小时真机、10万小时Ego及100万平仿真数据训练,实现毫米级精细操作与抗干扰能力,在积木拼装、削黄瓜、快递分拣等场景中展示泛化性。
七月,DigClaw公司的预测框架Rhizome v1在FutureX评测平台获得第1、第3、第7名,三个席位分别基于Kimi-K3、DeepSeek-V4-Pro等不同基础模型,是唯一让同一套框架下三个模型均进入Top 7的参赛方。评测涵盖59道政治、经济、科技领域真实事件预测题,不存在训练数据泄露。DigClaw认为,预测能力可沉淀于基座模型之外,系统通过预测轨迹、结算反馈和校准经验持续积累能力。该框架将搜索、因果推理和概率推断解耦为三个独立系统:搜索agent优化信息相关性,推理层基于证据结构化推理;每次预测保留完整轨迹,结算后结合Brier Score和Platt缩放校准概率;系统感知因果链,新证据与旧记录冲突时保留修正过程。这一结果验证了跨基座迁移的预测能力,机构可按需选择基座,在推理能力、成本与响应速度间取舍。
智谱AI近期对违规使用其大模型API的会员账号进行封禁处理,引发部分用户申诉称遭误封。据官方说明,封号主要针对利用API进行批量生成、转售或违反服务协议的行为,系统通过检测调用频率、内容模式及IP异常等维度判定风险。目前,智谱已开通人工复核通道,用户可提交申诉材料。但争议焦点在于,部分正常高频调用或涉及敏感词过滤的账号可能被算法误判,导致封禁范围扩大。智谱方面表示,将优化检测规则,减少误伤,并对确认误封的账号恢复权限。此次事件反映出国内大模型服务商在商业化运营中,对API滥用治理与用户体验平衡的挑战。截至发稿,智谱未公布具体封号数量及误封比例。
全球首个具备第五等级自主能力的AI工程师正式发布,标志着芯片设计进入高度自动化阶段。该AI系统可独立完成从架构规划到物理实现的完整设计流程,无需人工干预关键决策节点。其核心突破在于能处理复杂多目标优化,并在数小时内完成传统团队需数周的设计任务。据披露,该工具已在多个先进制程项目中验证,显著缩短流片周期并降低人力成本。业内认为,此举将重塑芯片行业研发模式,推动设计工具从辅助角色向主导角色转变,同时引发对高阶设计岗位需求的重新评估。目前,相关技术细节与商用时间表尚未完全公开,但已有多家头部半导体企业表达合作意向。
英伟达近日完成新一代AI加速平台Vera Rubin的首轮性能测试。测试数据显示,该平台在运行DeepSeek模型时,推理吞吐量较上一代产品提升达30倍。Vera Rubin采用全新架构设计,重点优化了大规模模型部署场景下的计算效率与内存带宽。英伟达方面表示,该平台旨在满足日益增长的生成式AI负载需求,预计将于明年正式上市。此次测试结果标志着英伟达在AI算力领域的又一次技术迭代,或将对现有AI芯片市场竞争格局产生直接影响。目前,英伟达尚未公布Vera Rubin的具体定价及量产时间表。
截至2025年,已有12家车企布局机器人赛道。小米机器人已公开亮相,小鹏旗下机器人进入试产阶段,特斯拉相关产线已开始装配。各车企产品主要聚焦人形机器人,应用于工厂搬运、家庭服务等场景。融资方面,多家企业获得数亿元级投资,用于技术研发与量产准备。行业普遍预计,2026年将迎来小批量交付,但成本控制与场景落地仍是主要挑战。
生数科技创始人朱军在2026世界机器人大会上提出通用世界模型五级发展路线。该模型需具备理解世界、预测未来、采取行动三项耦合能力,构成闭环反馈系统。构建要素包括数据、架构与算力:数据需多层金字塔结构,MoT架构统一处理多模态信息,算力支撑实时部署。五级路线为:L1世界生成(Vidu实现)、L2与世界交互(Vidu S1实现)、L3在世界中行动(Motus和Motubrain实现,后者推理速度提升约10倍,RoboTwin 2.0基准测试96.1分居首)、L4自主世界智能体、L5世界组织者。迈向L4、L5需突破联合评测体系、物理规律学习、持久记忆、在线学习、高效闭环部署、安全性六项挑战。
微软内部员工主动分享薪酬与AI使用数据,显示过去28天AI使用金额中位数约300美元。但商业内幕网分析发现,各部门AI使用量差异悬殊,且更高的使用量并未带来更高加薪或晋升机会。数据表明,AI使用与薪资、晋升无明显关联,员工对AI的采用更多取决于部门工作性质而非个人绩效。此次数据披露由员工自发完成,反映了微软内部对AI工具的实际应用现状,但未改变公司整体薪酬与晋升体系。分析同时指出,AI使用量高企的部门可能更依赖自动化流程,而传统岗位则相对滞后,但两者在职业发展回报上并无显著区别。
高盛合伙人Chris Churchman警告,AI在华尔街的快速普及可能削弱金融从业者的思考能力。他担心,将推理外包给模型会导致认知能力萎缩,使从业者无法从第一性原理出发思考。Churchman以现代科技削弱导航和记忆能力作比,指出算法承担分析工作后,银行家可能丧失分析能力。华尔街正推动AI深度融入交易和银行业务,短期可提升盈利能力,但长期或侵蚀专业人才基础。初级员工原本通过日常工作学习决策,若训练机会被AI取代,金融机构可能牺牲培养资深人才的职业文化,甚至降低对初级银行家的需求。Churchman强调,银行需在AI使用与“师徒式”培养体系间取得平衡,并确保员工在风险决策中保留最终控制权。他透露,高盛Marquee平台的AI目前仅限内部使用,技术挑战在于保证答案100%准确且可审计。该AI在测试中承认,自己更擅长显得全面而非真正全面。
一项涉及10万名人类参与者与AI的对比测试显示,在开放性创造力任务中,AI生成的方案在数量与多样性上超过人类,但在原创性与实用性结合上仍逊于人类顶尖表现。该测试要求双方针对同一问题提出解决方案,人类组来自不同职业与教育背景,AI组则使用多款主流大模型。结果显示,AI平均产出方案数量为人类的3倍,且涵盖更多非常规角度,但人类专家评审团对“最具突破性且可落地”的方案评分中,前1%的人类方案得分显著高于AI最佳结果。研究还发现,人类在需要跨领域知识迁移和情感共鸣的任务上优势明显,而AI在组合已知概念方面效率更高。该实验为评估人机协作中的角色分工提供了新数据,提示未来创造性工作可能更依赖人类定义问题、AI扩展选项的协作模式。
SpaceXAI发布Grok Bot系统,由运行于专用云计算机上的持久型AI智能代理组成,可端到端执行多步骤任务,与网站、应用及收件箱等工具交互,并在需决策时询问用户。该平台面向跨业务工作流,区别于侧重编程的代理,每个智能代理能保持对话上下文并记忆用户偏好,用户可让代理观察任务执行以学习并保存工作流。系统支持并行运行多个Bot,通过共享线程交换信息、分配工作,并可加入群聊协调任务。SpaceXAI称其最初为内部原型,用于销售、营销、运营及软件开发,示例中工程Bot可重现UI错误并转交其他Bot调试。与Claude Code、OpenAI Codex等终端型工具不同,Grok Bot更接近通用代理平台,拥有持久化计算环境,能交互未暴露API或MCP接口的服务。社区讨论聚焦于“委托整项任务”理念,并关注部署灵活性、定价及用户控制权。该发布紧随SpaceX完成对Cursor编程平台的收购,双方此前已在模型训练上合作。Grok Bot现处于测试阶段,SuperGrok Heavy、Cursor Ultra及Cursor Teams Premium订阅用户可用。
ResNet作者、蔚来汽车智能驾驶负责人任少卿已正式成立公司,投身具身智能机器人创业。蔚来CEO李斌在内部会议中确认此事,并表示蔚来将进行战略投资及业务合作。据悉,该公司已完成注册,估值超10亿美元,达到独角兽级别,但具体名称和融资细节尚未公开。任少卿仍继续担任蔚来职务。蔚来方面表示,智能驾驶与具身智能在底层能力上存在连续性,此次布局旨在支持创新企业发展。任少卿曾主导蔚来世界模型研发,该技术被视为机器人技术基础。蔚来此前已明确倾向于机器人而非Robotaxi作为AI业务下一阶段方向。任少卿为中科大与微软亚洲研究院联合培养博士,是ResNet核心作者之一,论文引用超49万次,曾获未来科学大奖等奖项。
世界机器人大会(WRC)2026年展会观察显示,本届大会呈现“明暗双线”格局。“明线”聚焦机器人技术商业化落地,多家厂商展示工业制造、物流配送及家庭服务等场景的成熟应用,强调产品实际交付能力与产线适配性。“暗线”则指向数据价值挖掘,参展企业普遍将数据采集、训练与迭代作为核心卖点,通过部署机器人积累场景数据,反哺算法优化并构建行业壁垒。展会反映出行业竞争焦点正从单一硬件参数转向“硬件+数据闭环”的生态能力,数据资产规模与处理效率成为衡量企业长期竞争力的新指标。分析人士指出,这种趋势将加速机器人行业从项目制交付向数据驱动型服务模式转型。
苹果自研AI服务器内部结构首次曝光。消息源昨日在社交平台发布四张图片,展示该设备采用定制2U机架,内部设4列硬件,每列含8个计算单元,整机或搭载32颗处理器。服务器基于M5系列芯片打造,由Mac Studio负责软件控制。该设计延续苹果自研芯片路线,用于支撑其AI算力需求。目前官方未公布具体参数及上市时间。
腾讯互动娱乐事业群(IEG)近日被传重组AI游戏部门,涉及整合旗下ARC Lab与游戏AI引擎部,并计划扩编至400至500人,以探索AI原生游戏。针对该传闻,腾讯相关人士回应称报道内容大量失实,所谓“成立新部门”系误读。该人士解释,游戏技术公线原本就设有游戏AI引擎部,长期对外招募AI专业人才,该部门聚焦游戏研运管线的AI提效与玩法创新,旨在为游戏项目提供可复用的技术能力和解决方案。
OpenAI的Codex产品近期在商业增速上超越Anthropic,成为AI编程赛道的新领跑者。该工具凭借代码生成与自动化修复能力,企业客户采用率显著提升,带动OpenAI整体开发者服务收入增长。与此同时,具身智能领域被业界视为迎来“GPT-2时刻”,即技术从实验室原型向规模化商用过渡的关键节点。多家机器人初创公司发布新一代人形机器人,其运动控制与任务规划能力较上一代提升明显,但硬件成本与场景泛化仍是落地主要障碍。此外,本周多家AI基础设施厂商宣布新一轮融资,资金主要投向推理优化与边缘部署。市场分析认为,编程与物理世界交互正成为大模型商业化最活跃的两大方向,而头部玩家间的竞争已从模型参数转向工程效率与客户留存。
具身智能机器人赛道正从资本热捧走向分化。除头部明星企业外,大量草根创业团队正以低成本、场景化方式切入市场,形成“蚂蚁雄兵”格局。这些团队多由高校实验室或大厂离职工程师组成,避开通用人形机器人主战场,聚焦工业巡检、餐饮配送、养老陪护等垂直场景,采用轮式或半人形结构以降低硬件成本与落地难度。报道指出,该群体普遍面临融资难、数据积累薄弱、商业化周期长等挑战,但凭借灵活定制与快速迭代能力,已在部分细分领域实现小批量出货。行业观察认为,具身智能的规模化应用或将由这些草根力量率先突破,而非单纯依赖高举高打的头部企业。
内存价格持续飙升,已超出英伟达等芯片厂商的掌控范围,AI服务器成本随之水涨船高,涨幅已超过15%。本轮涨价由HBM(高带宽内存)及DDR5等AI相关内存需求爆发驱动,供应端产能扩张速度远不及需求增速,导致供需缺口持续扩大。受此影响,服务器整机厂商已陆续上调产品报价,下游云服务商及大模型训练方的采购成本显著增加。市场分析认为,短期内内存供不应求的局面难以缓解,AI硬件成本压力或将进一步向终端传导。
Visa大中华区总裁张文翊撰文指出,AI正在重塑商业运行逻辑,其影响已超越单纯的技术范畴,深入至客户决策、商业连接与信任机制的重构。她提出三个关键转变:从“人找服务”到“服务理解人”、从“人操作交易”到“智能体协同决策”、从“完成支付”到“经营客户关系”。她强调,未来商业规模化发展的前提是信任,需解决身份识别、授权边界与生态协同三大问题。中国市场因服务数字化程度高、平台生态丰富、消费者接受度强,或成AI商业规模化发展的前沿。Visa正通过智能商务方案,将风控与网络能力延伸至智能体交易场景,以建立多方可信的交换机制。
一篇论文为AI科研评价体系确立新标准。8月19日,中国AI4S企业深度原理联合微软研究院、斯坦福大学、伯克利等机构发布论文《Measuring AI Scientists: From Exams to Discovery》,首次提出“发现回合”评估体系,全程记录AI在科研周期中的决策轨迹,从假说、执行到结果解读进行综合评分,并强调失败数据对训练和评估的核心价值。该体系旨在替代仅看最终答案的旧有考试模式。深度原理的MIRA平台是该体系的产业样本,其采用多智能体协作、干湿实验室联动的三层架构,在Research Claw Benchmark和Science Agent Arena两项评测中均位列第一,且单项任务平均成本最低。目前,深度原理已依托该平台在锂电、新能源材料等领域布局多条自研管线,由AI主导全周期科研。
OpenAI首席执行官山姆·奥特曼在最新采访中表示,当前AI发展尚未迎来“iPhone时刻”,行业瓶颈不在技术本身,而在于人机交互方式的革新。他指出,现有AI能力已具备较大潜力,但缺乏足够直观、自然的交互界面来释放其价值。奥特曼认为,未来突破将集中在交互设计领域,而非单纯提升模型参数或算力。此番言论呼应其此前关于AI应用落地难的观点,暗示行业重心正从技术竞赛转向用户体验优化。市场分析人士称,该表态可能影响投资者对AI初创企业估值逻辑的重新评估,交互设计团队或成下一阶段人才争夺焦点。
数学界一项持续78年的未解难题被AI攻克。Anthropic公司旗下模型Claude在近期研究中成功解决该问题,相关成果被视为AI在数学领域最重要的突破之一。此前,多位菲尔兹奖得主曾尝试解决此问题但未果。Claude通过创新性的推理方法完成了证明,其过程已通过专家验证。该成果标志着大语言模型在高级数学推理能力上取得显著进展,或将对理论数学研究和AI应用产生深远影响。目前,完整证明细节已公开,供学界进一步审查与讨论。
AI初创企业Covariant宣布完成新一轮融资,估值达120亿美元。该公司将大语言模型与仓储机器人结合,开发出能自主分拣、搬运货物的智能系统,其核心产品为“机器人基础模型”,可让不同品牌的机械臂快速适应新任务。目前,Covariant已与亚马逊、沃尔玛等物流巨头签约,部署超5000台机器人,处理订单量突破10亿件。本轮融资由英伟达、微软参投,资金将用于扩大模型训练规模和拓展欧洲市场。业内分析认为,传统仓储自动化市场长期被四大家族垄断,而AI驱动的柔性机器人正以更低改造成本切入该领域,预计到2030年全球仓储机器人市场规模将达千亿美元。Covariant创始人表示,公司目标并非替代人工,而是通过AI优化人机协作效率,其技术已使仓库拣选速度提升30%以上。
斯坦福大学李飞飞团队近日公开直播训练规模达5350亿参数的大模型,全程展示数据清洗、超参数调整及训练中途的损失曲线波动。该项目旨在打破大模型训练流程的封闭性,通过实时公开训练日志、代码及阶段性评估结果,降低外界对模型开发过程的认知门槛。直播中披露了训练算力消耗、数据配比策略及针对灾难性遗忘的干预措施,并演示了模型在推理任务上的阶段性表现。此举被视为推动AI训练透明化的实验性尝试,或为行业建立可复现的训练基准提供参考。目前该模型尚未完全收敛,团队计划后续发布技术报告及开源部分工具链。
中国AI算力需求激增,当前日均Token调用量已达140万亿次,背后基础设施压力凸显。业内观点认为,未来中国或将涌现新一代“算力运营商”,承担类似传统电信运营商的基础服务角色。目前,阿里、腾讯、华为等云厂商及三大运营商均在加速布局智算中心,但市场格局未定。新进入者需解决算力调度、能耗控制及成本问题,同时应对大模型训练与推理需求的爆发式增长。分析指出,具备大规模集群管理能力、网络互联技术及稳定能源供应的企业,有望在竞争中胜出,成为支撑AI产业底层资源的新巨头。该趋势将重塑云计算与通信产业链,并可能催生新的商业模式,例如按Token计费的算力零售服务。不过,行业仍面临标准不统一、区域算力失衡等挑战,未来格局尚待观察。