重庆上线渝小健AI就医智能体,覆盖233家公立医院
2026年7月17日 18:00
重庆上线渝小健AI就医智能体,覆盖233家公立医院AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 2026207月17日,重庆市卫生健康委员会正式上线便捷就医智能体渝小健,面向全市居民提供AI辅助就医服务。市民可通过支付宝App或阿福App搜索渝小健,使用智能导诊、云陪诊、检查报告查询与AI解读等功能。渝小健由重庆市卫生健康委员会联合重庆市大数据局、蚂蚁集团打造,依托数字重庆基础设施、医疗机构数据能力和蚂蚁AI大模型技术构建。该智能体于2025年10月在重庆市妇幼保健院启动内测,随后在32家三级医院开展试点,累计服务用户超过200万人次。此次正式上线后,渝小健已接入233家医疗机构,实现全市区县二级及以上公立医院覆盖。其中,重医附一院、重医附二院、重庆市中医院等32家三级医院上线云陪诊、检查检验报告实时查询及AI报告解读等功能,实现诊前、诊中、诊后全流程辅助服务。在报告查询方面,用户授权后即可在线查看检查检验结果,新报告生成后可实时提醒。针对血常规、生化等专业医学指标,渝小健可通过AI技术进行通俗化解释,帮助用户理解重点异常项和健康建议。在就诊流程方面,云陪诊服务覆盖签到、候诊、检查、缴费、取药等环节,用户可在线查看叫号进度、科室位置及支付信息,减少排队和信息查询成本。同时,AI导诊支持用户通过文字或语音描述症状,帮助匹配科室和医生,并提供院内服务指引等信息。随着人工智能技术加速融入医疗场景,渝小健的上线标志着重庆进一步探索AI驱动的智慧医疗服务模式,推动医疗服务从线下流程优化向智能化、个性化方向发展。渝小健AI辅助就医蚂蚁集团智能体本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29693银河通用机器人创始人王鹤: 2028 年,具身智能的 ChatGPT 时刻 即将来临!
2026年7月17日 18:00
银河通用机器人创始人王鹤: 2028 年,具身智能的 ChatGPT 时刻 即将来临!AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 202618在 2026 世界人工智能大会上,银河通用机器人的创始人兼首席技术官王鹤分享了他的未来预测。他认为,具身智能技术将在 2028 年前迎来重大突破,届时,这种智能系统的表现将达到与当前的对话式人工智能如 ChatGPT 相媲美的水平。王鹤指出,未来的具身智能基础模型,经过海量数据的综合训练,有望在未经过专门训练的任务中实现 70%-80% 的成功率。这一成绩将与早期的数字模型在对话能力上的表现相当,标志着该领域的一个重要里程碑。为了实现这一目标,强大的预训练模型和高效的后训练范式被认为是关键。在过去的两年中,具身智能的大模型技术经历了快速的演变。王鹤的预测不仅引发了与会者的热烈讨论,也激发了人们对未来智能科技的期待。他强调,随着数据积累速度和模型收敛趋势的不断加快,行业的进步将是迅猛的。而在这一背景下,具身智能的发展也为许多行业的变革铺平了道路。王鹤指出,具身智能将为人类的生产、生活带来全新的体验和可能性。例如,未来的智能机器人不仅可以在家中完成简单的家务,还能参与更复杂的决策与分析工作,进一步提升我们的生活质量和工作效率。总的来说,王鹤对具身智能的前景充满信心,他的预测不仅为人工智能的发展指明了方向,也为科研和工业界的从业者提供了宝贵的思路与启示。展望未来,科技的迅速发展将推动社会进步,而具身智能将在这一过程中扮演至关重要的角色。具身智能银河通用AI新词预训练模型本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29692超低延迟 AI 对话神器!Wan-Streamer v0.2 让你与 AI 零距离沟通
2026年7月17日 18:00
超低延迟 AI 对话神器!Wan-Streamer v0.2 让你与 AI 零距离沟通AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 202619在现代科技的快速发展中,AI 与人类的互动日益频繁,但传统的视频通话往往伴随着卡顿、延迟和声画不同步的问题。然而,通义实验室最新推出的 Wan-Streamer v0.2,将这些困扰彻底击破,以550毫秒的响应延迟实现了真正 面对面 的自然交流。Wan-Streamer v0.2是一款全新的端到端全模态理解与生成模型。它将 听、看、说、演 功能整合在一个 Transformer 模型中,使得 AI 能够像人类一样实时感知并回应对话。这意味着,无论是语音、文本还是视频,AI 都可以在瞬间理解并生成相应的反馈。与市场上其他实时交互系统相比,Wan-Streamer 在响应速度上表现卓越,整体延迟仅为0.55秒(包含网络传输),显著快于大多数现有语音对话模型。此外,其画质也得到了显著提升,分辨率从之前的192×336提高到640×368,场景细节更加清晰可见。这一技术的突破源于其独特的架构设计。传统的实时交互系统通常采用级联流水线模式,导致信息传递缓慢,且容易出现不同步的问题。而 Wan-Streamer 通过引入流式单元的概念,能够在每160毫秒内完成用户输入的感知、状态更新、生成响应等操作,从而实现流畅的互动。在此版本中,AI 不仅仅是一个 悬浮的头部,更是一个能够自然表达情感与动作的全身数字人。你可以看到 AI 的视线、姿态和手势,甚至它周围的环境。这样的设计,使得用户在与 AI 互动时感受到更多的真实感和亲切感。此外,Wan-Streamer v0.2的应用场景非常广泛,包括口语陪练、心理咨询、教育辅导、游戏 NPC 互动等,几乎涵盖了所有需要 在场感 的领域。总的来说,Wan-Streamer v0.2通过原生流式架构与分布式推理的结合,让 AI 的沟通方式更接近于人类之间的真实交流。这一技术将如何进一步发展,值得我们持续关注。AI新词通义实验室Wan-Streamerv0.2Transformer模型本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29691影视飓风49元AI课程上线首日售出10万份,单日营收超490万元
2026年7月17日 18:00
影视飓风49元AI课程上线首日售出10万份,单日营收超490万元AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 202631千万粉科技内容创作者影视飓风近日推出49元AI实战课程,上线首日销量突破10万份,单日销售额超过490万元,再次展现头部内容IP在AI教育市场的商业转化能力。据了解,该课程原价99元,用户领取优惠券后可49元购买。课程共16节,分为五大教学单元,内容覆盖AI图片生成、视频生成、提示词编写等基础应用,同时包含模拟机械臂运镜、子弹时间特效制作、AI分镜生成等影视创作进阶玩法。该课程由影视飓风联合第三方AI视觉创作平台TapNow共同推出,并非完全自主研发。这也是影视飓风继49元视频剪辑课程后,再次进入低价知识付费领域。此前,其视频剪辑课程同样实现单日销量超10万份,销售额突破500万元。不过,高销量同时伴随用户评价分化。抖音商品页数据显示,该课程累计获得1600余条好评,同时出现80余条差评,部分用户认为课程存在内容模板化、实操灵活性不足,以及实际生成效果与宣传存在差距等问题。资料显示,影视飓风由潘天鸿(网名Tim)于2014年创立,目前全平台粉丝规模超过4000万,其中B站粉丝约1600万、抖音粉丝约1400万。经过多年发展,公司已从个人创作团队成长为百余人的专业内容机构,2024年整体营业额突破1亿元。随着生成式AI工具快速普及,AI技能培训正在成为内容创作者和科技企业探索的新商业方向,但课程质量、实际应用价值和用户体验仍将成为长期竞争关键。AI实战课程影视飓风TapNow49元本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29689文远知行推出物理 AI 大模型 WITT
2026年7月17日 18:00
文远知行推出物理 AI 大模型 WITTAIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 20262在自动驾驶领域,技术的不断进步让人眼花缭乱。7 月 17 日,自动驾驶科技公司文远知行(WeRide)正式发布了他们自研的物理 AI 认知基础大模型 WeRide WITT。这一新模型的亮相,标志着 AI 在理解和处理复杂信息方面迈出了重要一步。WeRide WITT 的核心亮点在于其引入了 最小物理事实单元 的概念。这个概念的目的在于帮助 AI 更好地理解多模态信息,包括视频、图像和文本等。通过拆解连续变化的真实场景,WITT 能够识别和验证这些信息中的核心事实单元,从而构建出一种以物理事实为核心的全新 AI 理解框架。这种创新的 AI 理解框架,不仅提升了 AI 对环境的感知能力,也为自动驾驶技术的发展提供了更为坚实的基础。通过 WITT,文远知行希望能够让自动驾驶车辆在复杂环境中做出更智能的决策。例如,在识别交通信号、行人及其他车辆时,WITT 能够精准地分析和判断,从而提高行车安全性和效率。此外,文远知行的 WITT 模型在提升 AI 的理解力的同时,还推动了自动驾驶技术的商业化进程。随着物理 AI 大模型的应用范围不断扩大,未来或将实现更加安全、智能和便捷的出行方式。在如今竞争激烈的科技市场中,文远知行凭借 WITT 的发布,进一步巩固了其在自动驾驶行业的领导地位。随着技术的不断成熟,我们有理由相信,未来的交通将会变得更加智能化和人性化。AI新词文远知行WeRideWITT物理AI认知基础大模型本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29688文远知行发布物理AI认知基础大模型WIIT,构建真实世界理解框架
2026年7月17日 15:00
文远知行发布物理AI认知基础大模型WIIT,构建真实世界理解框架AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 202629.7k在2026世界人工智能大会(WAIC)现场,文远知行发布物理AI认知基础大模型 WIIT,探索人工智能从数据理解向真实世界认知演进的新方向。据介绍,WIIT基于真实世界场景提出最小物理事实单元(Physical Fact)理念,将连续变化的现实环境拆解为可识别、可验证的基础事实单元,并以此构建面向物理世界的AI理解框架。围绕物理事实,WIIT打造了事实提取、事实推理、事实验证、事实编排四项核心能力。其中,事实提取用于从复杂环境中识别关键要素;事实推理帮助模型理解不同事实之间的关系;事实验证提升AI对现实信息准确性的判断能力;事实编排则支持模型基于事实进行任务组织和决策生成。文远知行表示,物理AI的核心挑战在于让模型不仅能够处理信息,还能够理解现实世界中的空间关系、行为逻辑和动态变化。通过构建以物理事实为基础的认知体系,WIIT旨在提升AI在自动驾驶、机器人等具身智能场景中的环境理解和决策能力。WIIT物理AI文远知行人工智能本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29687阶跃星辰发布STEPX Neo样机,全球首款大模型原生智能体手机亮相
2026年7月17日 15:00
阶跃星辰发布STEPX Neo样机,全球首款大模型原生智能体手机亮相AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 202647月17日,阶跃星辰在上海2026世界人工智能大会(WAIC2026)展台首次展示全球首款大模型原生智能体手机 STEPX Neo 样机,探索AI Agent与移动终端深度融合的新形态。现场展示的STEPX Neo采用橙色外观,区别于传统智能手机,其系统界面包含水产市场修理室灵魂设定用户身份AI智能体安全等模块。工作人员表示,水产市场将通过外部合作引入优质Agent产品,为用户提供更多智能服务,具体手机绑定方式将在后续公布;灵魂设定则用于记录用户个性、偏好和使用习惯,让智能体形成更具个人化的交互体验。据介绍,STEPX Neo搭载智能体原生系统Step AOS,内置阶跃智能体Amoo,可覆盖办公效率、生活服务、影音娱乐等场景,并持续学习用户的记忆、关系和偏好。现场演示显示,Amoo能够根据用户需求自主完成任务,例如查询演唱会门票信息,并直接跳转携程完成酒店预订,实现从需求理解到服务执行的智能化流程。阶跃星辰方面强调,目前展示的产品仍为样机版本,完整产品形态和更多功能将在后续公布。随着大模型能力逐步进入终端设备,AI手机正从简单的语音助手向具备任务规划、工具调用和长期记忆能力的智能体平台演进。STEPXNeo阶跃星辰AIAgentStepAOS本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29686百度沈抖:每位员工每月发 1000 元额度自由体验主流大模型,强制推行AI办公难见效
2026年7月17日 15:00
百度沈抖:每位员工每月发 1000 元额度自由体验主流大模型,强制推行AI办公难见效AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 2026217 月 17 日,据虎嗅报道,百度集团执行副总裁、百度智能云事业群总裁沈抖在接受采访时,系统谈到了他对AI落地的判断与百度的内部实践。沈抖预测,通用智能体、行业垂类智能体的规模化落地速度会大幅提升, 2026 年下半年就能明显看到批量落地案例涌现,未来90%的工作都会有智能深度参与、协助完成,但不是完全替代人。沈抖认为,未来三年是一个关键窗口期。三年内,AI赛道的厂商和独角兽们会不断意识到全栈的优势,而百度智能云的友商也在有意识地补全全栈能力,这对百度智能云来说,既是拥有优势的机会点,也是面对更大竞争的挑战点。在内部推行AI使用上,沈抖明确表示,强制推行AI办公很难落地见效,百度始终以正向引导、福利牵引为主,不设置硬性使用规定。百度推出了一项常态化的员工福利政策且目前依旧正常执行:为每位在职员工每月发放一千元使用额度,可自由体验市面各类主流大模型产品,不限用途,纯粹是为了降低员工试用门槛,不绑定任何工作考核。他的逻辑是,员工亲身感受到AI工具的提效价值后,自然会养成常态化使用习惯。财务数据印证了AI业务在百度体系内的分量。IT之家注意到, 2026 年第一季度,百度AI收入同比增幅达到49%,收入占比达到52%,这是百度历史上首次AI收入占比过半。关于AI时代的度量标准,沈抖并未展开,但百度创始人李彦宏在今年 5 月的Create2026 百度AI开发者大会上已给出明确方向。李彦宏提出,AI时代的度量衡可能是日活智能体数(Daily Active Agents,简称DAA),与移动互联网最通用的度量衡日活用户数(DAU)相对应。他指出,目前较接近业界共识的度量衡是Token消耗,但Token不一定代表终局,它代表成本、不代表收益,衡量的是投入而非产出;当人类进入智能体时代,衡量一个平台和生态的繁荣,更应该关注DAA这个指标,关注有多少Agents在给人类干活并交付结果,这比无谓的Token消耗更接近价值、也更接近本质。AI新词百度智能云通用智能体行业垂类智能体本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29685天工短剧工作台上线Agent智能分镜与无限画布,昆仑万维要把AI短剧从随机抽卡拉向可控生产
2026年7月17日 12:01
天工短剧工作台上线Agent智能分镜与无限画布,昆仑万维要把AI短剧从随机抽卡拉向可控生产AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 20268AI短剧行业已经翻过野蛮生长的一页,正式迈入精品化、规模化的新阶段。但昆仑万维在7月16日发布的天工短剧工作台(SkyProduction)指出,当大多数创作者还在用AI盲盒式地抽卡生成时,三个残酷现状早已浮现:创作过程不可控,依赖AI随机生成容易出现角色变脸、站位漂移、前后镜头缺少叙事逻辑;质感与产能难平衡,全自动生成容易带着AI机械感,手动精修又撑不起规模化交付;团队管理难统筹,多人创作缺少标准化工具,项目进度、算力成本和复盘数据难以统一管理。精品AI短剧真正的门槛,从不是抽出一两个好镜头,而是把角色站位和人物表演稳定地延续到整部作品里。为应对这套难题,天工短剧工作台推出了Agent智能分镜加无限画布的双轨创作模式,试图重新定义精品AI短剧的创作流水线。它的核心判断是:AI短剧创作最怕的不是单个镜头不好看,而是拼在一起缺少叙事关系和成片质感;角色变脸、站位漂移本质上不是单一模型能力问题,而是创作流程里缺少一个能统筹全局的导演角色。一套AI短剧工具是否真正可用,关键在于能否在连续镜头中维持角色、场景、站位、镜头语言和叙事节奏的一致性。天工短剧工作台用三部由它创作的精品AI短剧来验证这套能力。这三部作品上线DramaWave仅7天,均已实现百万美元级营收,剧名分别为The Sacrificed Son Rises to God、The loser ex-husband is the great savior和Golden Dragon: Yield to None。平台方强调,这些短剧成为爆款的关键因素不是抽中了几个好画面,而是通过导演思维进行了合理的故事编排。在工作台里,导演思维被拆解为六个可视化、可干预的标准环节,让创作者从剧本解析、资产生成到分镜调度都能逐步审视、及时干预,把随机生成变成可控生产,背后依托的是Seedance2.0智能分镜模式。站位与角色一致性是这套工具最先啃下的硬骨头。上传剧本后,导演Agent会解析关键资产,并支持一键生成带多视细节的数字资产。平台方指出,角色变脸的问题往往不是模型不行,而是参考资产信息不全,因此工作台提供了多视细节图生成能力,可一键产出细节更丰富、表现更自然的数字资产,而不只是传统三视图。更关键的是先排站位、再生成视频的流程:在视频生成前,导演Agent会根据剧情关系规划人物站位与机位,并参考上一镜的构图生成下一镜站位图,让视频片段生成过程拥有更多关键帧信息参考,本质上是让下一镜记得上一镜。电影质感方面,工作台内置了影视级导演思维提示词模板,也支持导入自定义模板。这些模板不只是描述画面,而是帮助AI理解镜头,提高成片的连续性和质感,从中景到特写都能用专业导演思维补齐镜头语言,让没有经验的小白也能拍出更有电影感的画面。出海能力上,系统原生支持英语文本识别,可从剧本解析到音视频生成进行全流程的英文思维处理,英文精品短剧一键开拍,直接服务海外内容场景。第二轨是无限画布,给创作者一张可持续展开的创意画卷。在无限画布中,参考素材与生成结果都能围绕同一项目铺开、一目了然,让灵感不必在多个工具之间反复跳转。针对图像节点,工作台提供了720度全景图能力,可由一张固定角度的图像补全整个场景空间,推理出一个可以取景的环绕空间。多角度编辑器帮助创作者在不打断角色和场景一致性的前提下寻找更合适的构图;打光编辑器则可调整光线方向、明暗和氛围,让同一套人物与场景根据剧情需要呈现不同情绪。面对双人对话、群像调度或复杂动作场景,工作台还提供了3D导演台,让创作者可以在空间里摆放人物,确认角色距离、朝向、视线关系和镜头角度,再进入后续的画面与视频生成,意味着创作者不再只是描述一个画面,而是能像导演一样先完成场面调度。面向企业级用户,工作台把重点放在可控属性上,深度优化了B端人员协同体系。它支持主账号与子工作室账号体系,可按不同角色设置权限,让任务推进与数据资产管理更加清晰;同时全新上线了数据中心,支持从项目、剧集、成员、时间等多个维度查看算力消耗与产出情况,帮助工作室复盘成本与效率,让每一笔流水都能清晰溯源。昆仑万维判断,AI短剧行业进入下半场,竞争重点已从单一生成效率,转向创作流程的可控度、作品稳定性与精品率。面向Skyreels、Seedance2.5、Kling等新一代视频生成模型,天工短剧工作台将第一时间完成模型接入,驱动Agent智能分镜的全新迭代与升级。平台方表示,希望未来的AI不只是提高产能的效率工具,更能成为理解剧本、执行镜头意图、协助创作者稳定完成精品作品的生产伙伴。官网地址:https://www.skyproduction.cn/AI短剧天工短剧工作台Agent智能分镜无限画布本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29684首token延迟砍掉3. 25 倍:小红书联手北大、上交提出HYPIC,给混合注意力大模型装上"位置无关缓存"
2026年7月17日 12:01
首token延迟砍掉3. 25 倍:小红书联手北大、上交提出HYPIC,给混合注意力大模型装上"位置无关缓存"AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 202613大模型服务的主战场,正在从单轮聊天转移到检索增强问答、多文档摘要和长程Agent。这类新负载有一个共同特征:一条请求的prompt往往由几十到上百个语义独立的片段拼接而成,检索到的文档、技能说明、记忆文件、历史轮次被一股脑组装成数万乃至数十万token的超长上下文。在这个长度下,预填充(prefill)阶段主导了单请求的算力开销,成为服务商最显眼的成本来源;更棘手的是,一旦发生缓存未命中,尾部首token延迟(TTFT)能冲到数十秒,直接砸坏交互体验。业界为此发展出两条降本路线。一条是位置无关缓存(PIC),它放开严格的前缀约束,让每个语义独立的片段只缓存一次、并能拼接到任意前缀之后,刚好贴合RAG与Agent的prompt组装方式,其本质可归结为沿token轴直接拼接的splice、以及重算少量token恢复跨段上下文的correction两个原语。另一条是混合注意力模型,用线性注意力替换大部分全注意力层,把注意力的二次复杂度压到线性,并将无界的历史压缩成固定大小的循环状态。近来的生产模型如MiniMax-M1、Ring-2.5、Qwen3.5、Kimi-Linear,普遍把75%以上的层线性化、保留少量全注意力层,形成混合注意力的主流设计,以Qwen3.5-35B-A3B为例,40层里有30层是线性层。矛盾恰恰出在这里:现有PIC操作的是逐token的KV缓存,而线性注意力层只向外暴露一个per-request的循环状态,没有任何逐token的抓手可供splice或correction。结果是,混合模型里的大部分层都落在了现有PIC的能力范围之外。在此之前,没有任何系统能为混合注意力大模型提供位置无关缓存。小红书大模型推理团队联合北京大学、上海交通大学提出的HYPIC,是首个在混合注意力大模型上实现PIC的服务系统。它在4个生产级混合注意力模型、5个工作负载上的测试显示:首token延迟平均降低3.25倍,同SLO下可持续QPS提升1.66倍,而任务质量与完全重算仅相差1.71分。这套系统的核心思想,是对混合注意力模型里的线性层和全注意力层分而治之,再用一层系统级并行把冷请求也一并加速,由三个环环相扣的机制构成。对线性层,HYPIC缓存的是"转移算子",实现常数时间的状态组合。最直接的PIC稻草人方案,是把两段各自的零初值末状态直接相加这在朴素线性注意力下恰好成立,但在带衰减、门控、delta擦除的进阶线性注意力(RetNet、Mamba2、GLA、DeltaNet、GDN、KDA等)下会失效。真正被漏掉的关键量是一个段累积转移算子T_C,即一段内所有token转移矩阵的连乘;真实的末状态应为S(C1·C2)=T(C2)·S(C1)+S(C2),朴素相加恰恰丢掉了T(C2)这一项,造成结构性误差,实测RetNet慢衰减头在256token时误差已达状态范数的22%。HYPIC的关键洞察是,T_C和零初值末状态S(C|0)都只由片段内部的token决定、与前缀无关,因此它在片段首次prefill时把二元组(T_C, S(C|0))一并缓存,复用时按组合律左乘T_C再相加,即可在常数时间内近乎精确地还原任意前缀下的末状态,且天然覆盖全部线性注意力家族。实测在Qwen3.5-35B-A3B上,组合后的状态在第0层与完全重算仅相差6×10,落在FP16噪声之内。针对带因果卷积、带RoPE的变体,HYPIC分别用卷积状态热身和状态重旋转两个补丁做了严格对齐。对全注意力层,HYPIC用"缝合窗口"修复跨段注意力。混合模型中少数的全注意力层仍需要PIC,但以往的选择性重算无法直接迁移,因为下方的线性层只保留末状态,非末尾token无法向上穿过全注意力层。两种退路逐token存循环状态、或从零重新递推在存储或算力上都不可接受。团队的观察是,KV拼接后的偏差高度集中在每个复用片段的开头,其余部分几乎不受影响,这与全注意力模型里的attention sink现象一致,在混合注意力模型里同样成立。据此,HYPIC为每个内部片段开头w个token构造一个缝合窗口,缓存时这几个token不入缓存,复用时在完整前缀下重算以修复跨段注意力,默认w=8;由于实际片段长度通常大于512token,缝合窗口只占极小一部分,重算开销可控。为了支持段首KV重算,线性注意力层在复用时需即时算出缝合窗口自身的T和S,一边推进running state,一边把每个seam token的逐层输出前传给上层的全注意力层。第三块拼图是段并行,它把"长冷请求"也变成了可加速的负载。缓存未命中不可避免语料持续更新、低频文档被淘汰,而长冷请求正是尾延迟的主因。现有系统仍把整条prompt当作一个整体、在单实例上串行prefill所有冷片段,TTFT随O(n·|C|)增长;张量并行等实例内并行虽能加速单次前向,但扩展性有限,一条100k token请求在TP-8下仍需17.7秒。但PIC已经让每个片段自包含其prefill结果只由内部token决定。HYPIC顺势提出实例间的段并行:Router探测每段命中状态,把冷片段并行分发给多个scatter worker,再由一个combine worker把各段结果组装成完整运行状态,把冷prefill从O(n·|C|)降到O(n/m·|C|+c)。为了把这条路径跑满,HYPIC用LPT(最长处理时间优先)贪心策略均衡各worker负载,并把每段的计算与传输流水线重叠,避免combine worker被同步的传输突发拖住;段并行与实例内并行(TP/DP/SP)作用在正交的轴上,可无缝叠加。这套系统已在SGLang上实现,约14k行Python与Triton代码,在8×H20节点上,选取4个生产级混合注意力模型(Ring-mini/flash-linear-2.0、Qwen3.5-35B-A3B/122B-A10B)、4个公开数据集(HotpotQA、TriviaQA、MultiNews、GovReport)与1条生产RAG trace完成评测。全量预热后,HYPIC相比Prefix Cache将p50TTFT平均降低3.25倍(各模型2.77×至4.05×),而质量几乎无损16个"模型×数据集"单元平均只落后完全重算1.71分,在Qwen3.5-35B上甚至反超0.47分;作为对照,不缓存转移算子的朴素相加直接损失了66.9%的分数,印证了T_C的必要性。在生产RAG trace上,同1秒TTFT SLO下,HYPIC把可持续QPS相比Prefix Cache提升1.66倍(1.49×至1.85×),峰值单卡吞吐提升约1.3至1.5倍。在纯冷未命中路径上,一条32k token请求的TTFT从单worker的2.83秒降到8worker的0.49秒,达到5.7倍加速,且几乎全部收益来自可近线性扩展的scatter阶段;面对不均匀分片,LPT相比Round-Robin把TTFT从1.26秒压到0.84秒(3.6×对2.4×)。开销同样可控:构造(T_C, S(C|0))的一次性开销,在最重的稠密转移模型上也仅为主前向的5.2%至6.7%,一次构造、多次复用即可摊薄。HYPIC首次把位置无关缓存带到了混合注意力大模型上:用缓存的段累积转移算子实现线性层的常数时间状态组合,用小小的缝合窗口修复全注意力层的跨段对齐,再用段并行把长冷请求变成可加速的负载。它让RAG与Agent这类长上下文服务,在拥抱高效混合架构的同时,也能享受到片段级缓存复用的红利。团队表示,未来将进一步探索分布式的PIC管理与调度、多级缓存分层管理,推动大模型推理向更快、更省、更可扩展持续演进。大模型服务检索增强问答位置无关缓存TTFT本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29683Soul亮相WAIC2026,发布SoulX多模态交互大模型与AI硬件B Soul
2026年7月17日 12:01
Soul亮相WAIC2026,发布SoulX多模态交互大模型与AI硬件B SoulAIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 2026132026世界人工智能大会暨人工智能全球治理高级别会议(WAIC2026)期间,上海任意门科技有限公司(Soul)展示了基于实时多模态交互技术的AI生态布局,并发布旗下AI硬件产品B Soul,进一步探索情绪感知与智能交互应用。Soul CTO陶明表示,自2016年推出Soul App以来,Soul已从社交应用平台发展为聚焦情绪感知、交互技术和AI模型融合的生态型公司。区别于通用大模型路线,Soul以自研交互大模型SoulX为核心,围绕自有应用+产业生态构建AI应用体系。据了解,Soul自2020年前后启动AIGC技术研发,重点布局情绪理解、语音交互和多模态能力,并推出SoulX作为下一代人机交互技术底座。在WAIC现场,Soul展示了基于SoulX打造的实时数字人能力,可实现用户理解、自然语言对话,以及声音、口型、表情和动作同步生成,提升AI交互的实时性和自然度。此外,Soul还首次公开展示AI硬件B Soul。该设备融合SoulX语音交互、情感表达和角色养成能力,将AI陪伴从移动端延伸至物理空间,支持随时唤醒、自然交流和个性化语音互动。Soul方面表示,B Soul预计将于2026年8月开始逐步量产销售。随着AI从文本交互向语音、视觉、情感等多模态方向发展,情绪感知与实时交互能力正成为下一阶段智能应用竞争的重要领域。AI新词SoulXBSoul情绪感知本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29682OpenAI承认GPT-5.6Codex存在误删文件问题,建议用户关闭高权限模式
2026年7月17日 12:01
OpenAI承认GPT-5.6Codex存在误删文件问题,建议用户关闭高权限模式AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 202615OpenAI确认,由GPT-5.6模型驱动的Codex代码生成系统在特定使用条件下可能出现误删用户本地文件的问题。OpenAI核心产品负责人Tibo Sottiaux在X平台回应称,公司已收到并调查少量关于Codex删除用户主目录(home directory)文件的报告。据初步调查,问题主要发生在用户开启完全访问模式(full access mode)、未启用沙箱保护机制的情况下。由于模型执行任务时尝试通过覆盖环境变量$HOME设置临时工作目录,但操作异常导致系统误将整个$HOME目录删除。对于macOS和Linux用户而言,该目录包含大量个人文件,存在数据丢失风险。此外,在关闭自动审核功能时,该问题更容易触发。OpenAI表示,此次事件属于AI系统运行中的意外失误,目前正在采取多项修复措施,包括更新完全访问模式下的提示说明,提醒用户相关权限风险,并加强系统防护机制,避免类似错误再次发生。虽然OpenAI称受影响案例数量较少,但公司计划在未来几天发布详细事故分析报告,披露技术原因及后续改进方案。针对正在使用Codex并开启系统级权限的用户,OpenAI建议立即关闭高权限模式,改用带安全限制的运行环境。与此同时,OpenAI近期推出的Codex Micro硬件控制面板已售罄,该产品被视为未来开发者生态和AI硬件探索的一部分。CodexGPT-5.6OpenAI沙箱保护本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29681