腾讯研究院AI速递 20260911
腾讯研究院·2026-09-11 00:02

生成式AI - DeepSeek发布552B参数MoE模型V4.1 Flash,采用全新Causal-Encoder-Decoder非对称结构,输入激活8B、输出激活16B,具备原生多模态视觉理解能力 [1] - 新模型大幅压缩KV Cache,对HBM需求降至上一代四分之一、SSD需求降至八分之一,显著降低Agent类任务的缓存命中成本 [1] - 模型已上线API并同步开源,腾讯WorkBuddy、CodeBuddy等作为官方合作伙伴全量接入,9月14日后V4 Pro请求将路由至V4.1 Flash [1] - 京东开源视听世界模型EchoWM,可在同一框架内生成视频与环境音、音乐、语音,并实时响应用户操作 [1] - 模型采用统一“相机意图”表示,把键盘操作映射为连续6-DoF轨迹,第一人称与第三人称视角共用一套控制接口 [1] - 在158个WBench Navigation案例评测中取得81.7的最高平均分,一致性89.8、交互性87.2,但尚无显式持久三维记忆,长时生成仍可能漂移 [1] - 高德推出3D原生城市世界模型ABot-Earth 0.7,从一张卫星图或一段文字出发,单块消费级GPU约10分钟生成公里级3D城市场景,效率提升千倍 [2] - 模型采用3D原生架构端到端生成3DGS格式场景,覆盖从星球、城市到街景地标的连续尺度,已覆盖196个以上国家和地区 [2] - 能力落地飞行街景2.0、导航Live与避雷指南,支持购票前预览座位视野、摄像头实时环境识别与15个维度的行程风险推演 [2] - 蚂蚁灵波科技继7月开源LingBot-World 2.0 14B后,再开放Small(1.3B)、Bidirectional与Causal Pretrain三款模型 [2] - 1.3B小模型面向消费级单卡GPU设计,可在本地实现实时世界生成,让个人开发者与高校实验室能够复现、改造并搭建应用原型 [2] - 双向Teacher模型提供高质量蒸馏源,因果预训练底座支持相机位姿与文本双输入,配合MoBA注意力掩码兼顾自回归生成与画质 [2] 前沿科技 - 宇树公开60亿参数具身智能模型UnifoLM-WLA-1.0,用约2500小时高质量真机数据训练,一套模型完成10项全身操作与54项桌面操作任务 [3] - 模型建立统一动作空间,把末端执行器位姿、关节与下半身动作经残差向量量化转为离散Token,可适配平行夹爪与两类灵巧手 [3] - 引入以交互为中心的动态区域预测,先判断动作会让画面哪些区域改变再生成动作,其推理模型在7项开源评测中位列第一 [3] - 苹果发布首款2nm手机芯片A20 Pro,集成6核CPU、7核GPU与双16核神经网络引擎,AI算力翻倍,内存带宽较A19 Pro提升50% [3] - 芯片借鉴M系列采用裸片与内存并排的定制封装,配合散热面积三倍的新一代均热板,持续性能较iPhone 17 Pro最高提升40% [4] - 同步搭载C2调制解调器与N1无线芯片,C2上传速度较C1X最高提升50%、能耗降低15%,iPhone 18 Pro售价9999元起 [4] - 生数科技CEO骆怡航在外滩大会阐释通用世界模型第一性原理,认为关键在于形成理解、想象与行动的持续闭环 [4] - 公司提出L1至L5发展路线,依次为生成世界、与世界交互、在世界中行动、自主世界智能体与世界组织者 [4] - 同步发布面向机器人灵巧操作的自进化世界模型Motus2,把策略、世界模拟与价值评估纳入同一闭环,呈现递归自我改进的初步特征 [4] 报告观点 - SemiAnalysis发布第七代TPU Ironwood首份第三方推理测算,同等负载下每美元性能最高领先B200达50%、领先B300达96% [4] - 每百万Token成本TPU为0.181美元,B200为0.222美元,B300为0.276美元,优势主要来自极低的每小时租赁成本而非物理吞吐 [4] - TorchTPU用PyTorch的PrivateUse1后端让TPU成为原生Torch设备,取代此前的TorchAX翻译层,正在填平CUDA的生态壁垒 [4] - Anthropic发布经济预测模型与交互工具,不问AI是否取代职业,而是把每份工作拆成具体任务,测算就业、增长与资源分配的走向 [5] - 模型给出2030年三种情景:温和升级接近互联网普及节奏,深度变革下AI承担约一半知识工作、经济增速翻倍,极致颠覆下年增速达15% [5] - 三种情景平均薪资均上涨,但涨幅集中于非知识类岗位,资本分配占比从40%升至最高54.8%,劳动者份额相应下降 [5]

腾讯研究院AI速递 20260911 - Reportify