阿里云百炼上线HappyOyster1.0:支持实时交互的开放世界模型开启灰测
2026年7月20日 12:00
阿里云百炼上线HappyOyster1.0:支持实时交互的开放世界模型开启灰测AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 20, 202623今日,阿里云百炼正式上线开放式世界模型产品HappyOyster1.0(快乐生蚝1.0),该模型支持实时构建、探索和交互式生成AI数字世界,目前已开放Android、iOS及Web三端SDK,并在阿里云百炼启动灰度测试。据介绍,HappyOyster1.0区别于传统文生视频模型的单向生成模式,其核心训练目标是学习当前状态/动作到下一状态/动作的世界状态转移规律。模型通过分析海量自然视频,学习人物、物体与环境的演变过程,能够推演动作产生的反馈关系,并维持数字世界中人物、场景以及音视频内容的长期一致性。该模型提供世界探索(Adventure)和实时导演(Directing)两种模式。世界探索模式下,用户输入文字或上传图片即可生成可互动数字世界,并通过移动、跳跃、攻击、驾驶载具等操作改变场景发展,支持最长1分钟连续实时位移与镜头控制,生成内容可导出原片。实时导演模式则支持用户在剧情任意节点暂停、回溯,并通过新的提示词调整故事发展方向。该模式可生成3分钟以上的480p或720p实时画面,并支持视频导出。阿里云表示,HappyOyster1.0正在探索下一代多模态互动内容形态,可应用于开放世界游戏原型、互动短剧、虚拟陪伴以及沉浸式文旅体验等场景。开发者可通过Open API管理世界状态,通过客户端SDK完成实时通信、视频渲染和交互控制,快速构建可玩的AI世界应用。业内认为,世界模型正在成为生成式AI发展的新方向,其核心能力从生成内容进一步转向理解和模拟世界。HappyOyster1.0的推出,代表国内企业开始探索实时交互式AI环境构建的新路径。HappyOyster1.0AI数字世界阿里云百炼开放式世界模型本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29712阿里发布Token Plan个人版,Qwen3.8-Max-Preview同步上线
2026年7月20日 12:00
阿里发布Token Plan个人版,Qwen3.8-Max-Preview同步上线AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 20, 2026437月19日,阿里正式发布Token Plan个人版,并同步开放Qwen3.8-Max-Preview体验。该模型参数规模达到2.4万亿,在代码工程、专业办公等场景中展现出较强能力,正式版本预计将于近期发布并开源。据了解,Qwen3.8-Max-Preview目前可通过Token Plan抢先体验。为降低用户使用门槛,阿里推出限时优惠方案,其中个人版Lite套餐售价39元/月,Standard套餐139元/月,Pro套餐499元/月;团队版则提供标准、高级和尊享三类席位,价格分别为150元、550元和1398元/席位/月。针对Qwen3.8-Max-Preview,阿里同步推出限时体验活动,白天Credits消耗降至1折,个人版Token Plan用户夜间使用还可在此基础上享受进一步折扣。除Token Plan外,阿里旗下AI编程产品Qoder和QoderWork也已首发支持Qwen3.8-Max-Preview,千问PC端用户可免费体验该模型能力。随着大模型竞争从单纯性能比拼转向模型能力、成本控制和生态建设的综合竞争,阿里通过Token Plan、开发工具及开源策略进一步扩大Qwen系列模型应用范围,加速大模型在开发、办公等生产力场景中的落地。TokenPlanQwen3.8-Max-Preview阿里Qoder本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29711谷歌升级Gemini Enterprise:优化界面并推进Workspace连接器重构
2026年7月20日 12:00
谷歌升级Gemini Enterprise:优化界面并推进Workspace连接器重构AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 20, 202620谷歌正在推进企业级AI助手Gemini Enterprise的新一轮更新,平台主提示栏已采用与消费者版Gemini应用一致的炫彩视觉设计,进一步统一企业与个人用户的产品体验。这一变化也体现出谷歌希望让企业AI助手与数亿用户使用的Gemini生态保持一致的发展方向。此次更新中,更受关注的是Google Workspace连接器升级。部分用户收到通知称,连接器更新后可能需要重新授权才能继续使用。虽然谷歌尚未公布具体技术细节,但这一调整可能涉及权限扩展或底层架构优化。近年来,Gemini Enterprise持续扩展企业数据连接能力,目前已支持Slack、Microsoft Teams、Notion、Linear、Jira、ServiceNow等多种办公工具,并逐步增加创建页面、更新工单等操作能力。连接器架构的优化,将直接影响AI助手读取企业数据、执行任务以及调用外部服务的稳定性。此外,谷歌在5月I/O大会期间公布的智能代理功能Gemini Spark,目前已出现在Gemini Enterprise功能设置中,但仍处于隐藏状态。谷歌表示,Spark未来将向企业客户开放,并可通过SharePoint、OneDrive和ServiceNow等连接器执行后台任务。业内认为,此次Gemini Enterprise更新并非简单的界面调整,而是谷歌为企业级AI代理能力扩展进行的基础设施建设。随着企业AI助手逐渐从信息查询走向任务执行,数据连接、安全权限和系统兼容能力将成为决定产品落地效果的关键因素。GeminiEnterpriseGoogleWorkspaceAI助手企业数据连接本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29710腾讯混元Hy3限免活动延期至8月5日,WorkBuddy和CodeBuddy用户继续免费使用
2026年7月20日 12:00
腾讯混元Hy3限免活动延期至8月5日,WorkBuddy和CodeBuddy用户继续免费使用AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 20, 202639腾讯混元大模型Hy3限时免费活动迎来延期。腾讯表示,原定为期两周的Hy3免费体验活动临近结束后,收到大量用户希望继续使用的反馈,因此决定面向WorkBuddy和CodeBuddy用户延长限免期限,活动将持续至8月5日。此次延期主要覆盖腾讯旗下AI办公与编程相关产品用户,开发者和企业用户可继续体验基于混元Hy3模型提供的智能辅助能力。此前,Hy3通过限免活动吸引用户测试其在代码生成、开发辅助以及工作流场景中的应用效果。随着AI大模型逐渐从通用问答向专业生产力工具演进,代码生成、智能办公等场景成为模型竞争的重要方向。通过延长免费体验周期,腾讯希望进一步扩大Hy3在真实业务环境中的使用规模,并收集用户反馈优化模型能力。业内来看,大模型厂商正在通过免费试用、开发者计划等方式降低用户体验门槛,加速模型在办公、编程等高频场景中的落地。随着竞争加剧,模型性能、使用成本以及生态整合能力将成为影响用户选择的重要因素。腾讯混元大模型Hy3AI办公CodeBuddy本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29709BrowseComp被刷到90%后,美团LongCat甩出LoHoSearch:前沿模型集体跌回三成出头
2026年7月20日 12:00
BrowseComp被刷到90%后,美团LongCat甩出LoHoSearch:前沿模型集体跌回三成出头AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 20, 202625搜索智能体到底有多强,过去一年基本是BrowseComp说了算。但这个标尺正在失灵它在10个月内就把模型成绩从30%一路推到了90%,基准测试本身的意义正快速被刷没。7月17日,美团LongCat抛出了一块更硬的试金石LoHoSearch,意图把搜索智能体重新逼回爬坡区。LoHoSearch的难题不是人写的,而是从一个囊括762万个实体的维基百科知识图谱里自动生成的。正因为这种机器生成的出身,它在搜索空间和结构复杂度上,抵达了人类标注者根本无法稳定设计出的难度上限。换句话说,过去的基准靠人脑出题,题目再难也有天花板;LoHoSearch把出题权交给图谱,难度天花板被彻底掀开。结果相当刺眼。在11个前沿模型的测试中,最佳成绩只有34.74%,紧随其后的三个模型集中在15%到16%左右;而同一批顶尖模型在BrowseComp上眼下能拿到约90%的分数。差距之大,直观说明LoHoSearch把搜索智能体真正的短板暴露了出来。更有意思的是上下文策略的边际效用:在LoHoSearch上,最好的上下文策略只带来6.8个百分点的提升,而同样的操作在BrowseComp上能换回14个百分点这意味着靠提示和上下文工程去补能力的老办法,在这套新基准里几乎失灵。这套基准本身有544道问题,覆盖11个领域,问题采用树状与图结构组织,且已经开源。当老基准被刷到顶、搜索agent的真正挑战才刚开始,LoHoSearch很可能成为下一个绕不开的必测项。搜索智能体LoHoSearch知识图谱AI新词本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29708杨植麟在GTC2026 摊牌:月之暗面把Adam、全注意力和残差连接全换了,而且全部开源
2026年7月20日 12:00
杨植麟在GTC2026 摊牌:月之暗面把Adam、全注意力和残差连接全换了,而且全部开源AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 20, 202635大模型训练的地基,正在被一家中国公司悄悄撬动。在GTC2026的演讲How We Scaled Kimi K2.5中,月之暗面CEO杨植麟没有只讲K2.5这一个产品,而是把过去一年多公司想清楚的一件事摊开了:当开源模型要逼近闭源前沿,除了继续堆参数和算力,还有另一条路把Transformer时代沿用了近十年的三个基础组件,各自重新做一遍。优化器Adam(2014年提出)、注意力机制(2017年)、残差连接(2015年),月之暗面给这三个地基组件各递上了一个替代方案,而且全部开源。杨植麟把整条技术路线拆成三个方向:让每个Token更值钱、让更长的上下文真正有用、让多个Agent同时协作。除此之外,他还抛出了两个重要进展:视觉训练如何反哺文本能力,以及月之暗面刚公布的下一代架构Attention Residue。先说最现实的一道墙:高质量数据快不够用了。互联网上有价值的文本本就有限,模型越做越大、要的数据越来越多,大家迟早撞上数据墙。既然数据很难翻倍,月之暗面的思路是让模型从同样的数据里学到更多,给出的答案是MuonClip,用来替代已经用了十多年的Adam优化器。它基于Muon优化器,在更新参数时尽量让不同方向的信息保持独立,减少重复和浪费,从而提高训练数据的利用效率。实验结果是:用同样数量的数据,MuonClip的训练效果接近把数据量增加一倍,既压低了训练成本,也推高了模型能力上限。杨植麟打了个比方:手里若有50万亿个高质量Token,效率提高一倍,就等于又多出50万亿Token,在优质数据越来越稀缺的当下,这种效率提升比单纯加算力更关键。不过Muon有个麻烦:模型扩展到万亿参数后,注意力层里的数值容易失控,最大logit会突然飙升到1000以上,而正常范围通常只有50到100,数值继续膨胀训练曲线就会发散、整个训练可能直接崩掉。月之暗面为此设计了QK-Clip,在模型前向计算时实时检查每个注意力头的最大logit,一旦超过安全范围就同步缩放Q和K的投影把数值压回来,它不改变收敛效果,只负责维持数值稳定。靠着QK-Clip,Muon被成功扩展到万亿参数规模,训练了超过15万亿Token,整个过程没出现过一次loss spike。第二个方向是让长上下文真正发挥作用。杨植麟引用了Scaling Law论文作者Jared Kaplan等人的实验:LSTM读到一定长度后效果就难再提升,而Transformer上下文越长、预测通常越准,且难见明显饱和点。这个特性在Agent时代尤为要紧复杂任务可能持续几天甚至几周,模型得记住之前做了什么、得到过哪些结果、哪些方向已经失败,长上下文若不能持续提供有效信息,任务链条很容易断掉。麻烦在于标准全注意力的计算量随上下文长度平方增长,扩大十倍计算量可能增加一百倍,到百万Token级别训练和推理成本都高得吓人。月之暗面的解法是Kimi Linear,核心是名为KDA(Kimi Delta Attention)的线性注意力机制,它让模型学会哪些信息长期保留、哪些快速忘掉。传统线性注意力只有一个全局衰减系数,像所有内容共用同一个遗忘按钮;KDA把一个衰减系数拆成多个,不同信息通道可用不同遗忘速度,慢衰减的通道保留长距离信息,快衰减的通道及时腾出空间吸收新内容。实际使用中,Kimi Linear按3比1的比例把线性注意力层和全注意力层混合,杨植麟称这是第一个在短上下文、长输入和长输出任务上都能全面超过全注意力的架构,上下文扩展到百万Token甚至更长时,效率优势更明显。第三个方向是从一个Agent变成一支Agent团队,月之暗面称之为Agent Swarm。它的组织方式像一家公司:一个主Agent充当CEO,负责理解目标、拆解任务并分配给多个子Agent,子Agent可以分别扮演研究员、程序员、数据分析师和事实核查员,完成后由主Agent汇总。最大价值是把串行任务改成并行,过去一个Agent要依次搜索、阅读、分析、编码、核查,现在几十甚至几百个Agent可以同时开工。训练这种协作并不容易,月之暗面设计了三种奖励:实例化奖励鼓励主Agent创建更多可并行子任务、避免退化回串行;完成奖励要求子任务真正做完、防止为刷奖励批量开空任务;最终结果奖励判断任务是否真正解决。三种奖励的权重随训练动态变化,前期重任务拆解与并行化,后期转向最终结果。从演示看,Agent Swarm能同时下载阅读几百个信息源完成研究、并行撰写上百页文献综述的不同章节、同时分析十个数据集。Kimi K2.5发布时它已支持最多100个Agent并行、任务最多执行1500个步骤,而今年4月发布的K2.6把并行上限提高到了300个。一个意外收获出现在视觉与文本的融合上。K2.5与前代K2的关键区别是改用早期融合训练:过去很多开源多模态模型走后期融合,先用约20万亿文本Token训出语言模型,再用约2万亿多模态Token把视觉能力贴上去;K2.5则从训练一开始就把视觉和文本数据混在一起,在K2文本基座上又训练了约15万亿混合Token。这带来了两个让杨植麟兴奋的结果。其一是只训练视觉任务也能提升文本推理:研究团队只让模型数数、识图、做视觉问答,没加数学或编程训练,文本推理能力却也变强了,换言之模型在练看的同时,想的能力也提升了。其二是反向的,如果文本基座足够强,模型甚至不一定需要专门的视觉SFT数据K2.5采用零视觉SFT方案,所有监督微调数据都是纯文本,再通过文本与视觉联合的强化学习获得视觉能力,最终在视觉任务上仍接近最先进水平。杨植麟认为,这种双向迁移来自早期融合:当文本和视觉进入同一表征空间,一种模态学到的能力才有机会迁移到另一种,这也是K2.5能看图写代码的根基。演讲末尾,杨植麟介绍了月之暗面刚发布的新研究Attention Residue(注意力残差),论文发表于3月15日,距离演讲仅两天。残差连接是2015年由何恺明等人提出的深度网络基础技术,如今是Transformer的标准组件,它让每一层既处理上层结果、又保留一条直接传递信息的通道,使深层模型能稳定训练。杨植麟援引Ilya Sutskever的说法,把残差连接理解为旋转了90度的LSTMLSTM在时间维度上传信息,残差连接在深度维度上传信息。既然Transformer已经用注意力替代了LSTM在时间维度上的循环,那么深度维度是否也能同样替换?Attention Residue就是这个思路的产物:标准残差主要用上一层输出,而它允许当前层查看所有前序层输出,再通过注意力决定哪些历史信息保留、哪些忽略,让模型从被动接收上层结果,变成主动从整个计算历史中挑选信息。为控成本,实际采用分块版Block Attention Residual,每16层组成一个块,块内仍是标准残差,块间才用注意力残差,实验显示约8个块就能拿到大部分收益。它带来了约24%的Token效率提升,按杨植麟的算法,50万亿Token效率提高24%等于额外增加12万亿Token,在GPQA、MATH、HumanEval等推理、数学与编程测试上提升尤其明显。把三件套摆在一起看,月之暗面的替代清单清晰得近乎挑衅:Adam换成MuonClip、全注意力换成Kimi Linear、残差连接换成Attention Residue,分别对应怎么从有限数据学更多、怎么更高效用超长上下文、怎么让深层网络更灵活传信息。三者都能相对独立地替换现有组件,且都已开源。这些技术能否直接叠加、增益能否简单相乘,目前还没经过完整验证,但它们至少说明了一件事:很多被认为已经足够好的基础组件,可能远没有到达终点。在优质数据越来越少、训练成本越来越高的当下,重新设计优化器、注意力机制和残差连接,同样可能带来可观的提升。这也正是杨植麟整场演讲想表达的核心开源模型不能只是开放,还必须足够强。大模型训练月之暗面Transformer开源模型本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29707嫌whisper.cpp和ONNX不够用?Handy作者开源transcribe.cpp:60+转录模型、GPU加速、即插即用替代
2026年7月20日 12:00
嫌whisper.cpp和ONNX不够用?Handy作者开源transcribe.cpp:60+转录模型、GPU加速、即插即用替代AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 20, 20268本地语音转录这块,开发者长期被困在一个尴尬的夹缝里:要么用whisper.cpp,要么用ONNX,想上苹果设备还得再塞一个MLX,等于同时维护两套引擎、为每个引擎各移植一遍模型。7月19日,知名语音转文字应用Handy的作者和维护者sebjones,把他在分发跨平台应用时踩过的坑,直接炼成了一个新库transcribe.cpp,并发布v0.1.0版本。这是一个基于ggml的语音转录库,支持当下所有最新的转录模型,且handy-computer这个Hugging Face组织下发布的每一个模型,都经过了数值验证和词错率(WER)测试,确保与官方参考实现一致。作者也坦承,这是0.1.0版本,难免有他一个人发现不了的粗糙之处,欢迎社区报告一起修。催生transcribe.cpp的,是一连串憋屈的现实。sebjones直言,用现有的ASR推理栈去分发跨平台应用,体验非常糟糕。市面上虽有一些零散库声称支持大量模型,但作者不明、测试不清,留给他的是一连串疑问:这个库什么时候会停更?作者有没有考虑过官方绑定,让你能在真正的桌面或移动应用里用?它本质上是不是只是演示代码?做过基准测试吗?比ONNX快吗?作为一个需要把语音功能塞进Handy的人,他想要的是一个能下载模型文件就直接跑推理、且推理结果能和参考实现对得上的库;推理要跑在GPU上拿最佳性能,要能轻松嵌进Handy,而不是背上一个庞大的PyTorch;必须同时兼容Mac、Windows和Linux。几经比较,ggml成了他眼中最好的前进方向,既有强大社区,分发能力也出色。落到具体能力上,transcribe.cpp给开发者交付的是一个又快又准的推理引擎,外加极其广泛的模型覆盖。它支持16个ASR模型族、合计60多个模型,更多模型还在路上。加速方面,它通过Vulkan、Metal、CUDA和TinyBLAS四条路径把推理搬到GPU上,作者尤其把Vulkan当成任何本地推理应用的底线,并为每个支持的模型在Fedora系统的Ryzen4750U(CPU加Vulkan)以及自己的M4Max上做了基准测试。每个模型都经过数值验证与完整的WER扫描,意味着它们被数千条语音片段反复打磨,输出与参考实现非常接近甚至完全一致,这些验证结果同时公开在transcribe.cpp仓库和Hugging Face对应模型页面里。功能层面,它支持流式转录与批量转录,并且基本可以作为whisper.cpp的即插即用替代方案Handy原本就跑在whisper.cpp上,作者正是要用transcribe.cpp发一个更新把它换掉,为此他特意保持了对whisper.cpp随Handy发布的流行.bin文件的兼容,transcribe.cpp能直接运行这些文件;虽然部分标志和功能尚未对齐,但绝大多数用例下其whisper实现足够可靠,性能也大致相当。真正让这个库有望走进真实产品的,是它从第一天起就把语言绑定当成了重点。库本身用C/C++写成,作者不仅需要Rust绑定,也清楚要让本地语音转录被广泛分发,至少得有像样的官方绑定撑场面。他挑了四种覆盖度最具代表性的语言:Python、JavaScript与TypeScript、Rust,以及Objective-C与Swift。他也欢迎社区在愿意承担维护的前提下贡献更多绑定。这些决策很大程度上由Handy的诉求驱动,而Handy本身的高人气,也让作者有了持续维护这个库的动力。在作者看来,transcribe.cpp的终极目标是让本地ASR变得更易用。语音转录在绝大多数设备上都能跑出极高准确率,根本没必要把声音传到云端。他举了一个硬核例子:RK3566这块性能羸弱的芯片,用transcribe.cpp在CPU上就能以快于实时的速度跑模型,而用上最先进模型做快于实时的转录,功耗也只有几瓦。他判断,未来出于各种原因,会有更多推理发生在本地,分发问题因此变得至关重要;transcribe.cpp虽然远没从整体上解决它,但希望是向前的一小步。在致谢里,作者点名了多位助力者:Mozilla AI及其BiR项目与工程师Davide在该项目还只是个模糊念头时就决定支持他;ggml及其贡献者是整个项目的地基;Modal提供了用于WER测试和CUDA验证的算力积分;Blacksmith扛起了部分CI/CD;Hugging Face则既是本地AI社区的支柱,也为handy-computer组织提供了模型存放的私有空间。至于是否有AI辅助开发,作者回答得很干脆:当然有,一个人靠ggml在几个月内从零写出这种规模的引擎是不可能的,但眼前这些文字没有一行是AI写的,全部出自他自己的口和手。原文链接:workshop.cjpais.com/projects/transcribe-cpptranscribe.cppwhisper.cppONNXggml本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29706Kimi因算力紧缺暂停C端新用户订阅,全速推进集群扩容
2026年7月20日 09:00
Kimi因算力紧缺暂停C端新用户订阅,全速推进集群扩容AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 20, 202629.7k7月19日深夜,Kimi发布公告称,由于近期用户请求量快速增长,现有算力集群承载压力接近极限,团队决定暂停C端新用户订阅,并启动算力扩容计划。Kimi表示,过去48小时内,用户请求量大幅超出此前预估,当前算力资源已接近集群最大承载能力。为保障已有订阅用户的服务体验,Kimi将优先调配现有算力资源,确保已订阅用户权益不受影响。同时,团队正在全速推进算力扩容,待新增算力陆续到位后,将逐步开放更多订阅名额,直至恢复正常订阅服务。在订阅体系调整方面,Kimi计划对后续新用户权益进行拆分,将Kimi主权益和Kimi Code权益分别管理。其中,Kimi主权益覆盖Kimi Web、Kimi APP以及Kimi Work等产品服务,Kimi Code则面向代码相关使用场景,以实现算力资源更精准匹配,提升整体服务稳定性。此次暂停新增订阅反映出AI应用快速增长背景下,模型服务商面临的算力供给压力。随着大模型应用规模持续扩大,算力基础设施、资源调度能力以及用户增长之间的平衡,正在成为AI企业商业化运营的重要挑战。本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29698阿里新一代大模型千问3. 8 将至:预览版抢先登陆阿里云与Qoder,正式版拟近期开源
2026年7月20日 09:00
阿里新一代大模型千问3. 8 将至:预览版抢先登陆阿里云与Qoder,正式版拟近期开源AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 20, 202629.7k大模型的开源节奏,正在被国内头部厂商越拉越紧。 据悉,阿里最新一代大模型千问3. 8 即将发布并同步开源,这意味着通义千问家族在开源赛道上又向前迈出一步。新模型的体验窗口已经悄然打开。目前,Qwen3.8-Max预览版已率先上线阿里云Token Plan、Qoder以及QoderWork三个平台,用户现在就能提前摸一摸这一代新模型的能力边界。按照阿里的规划,Qwen3.8-Max的正式版将于近期正式推出并开源,届时完整的模型权重将向开发者开放。在国产大模型密集发力的当下,阿里选择让预览版先行、正式版紧随开源,既提前释放了产品信号,也把模型能力放进真实用户场景里接受检验。千问3. 8 正式版开源的那一刻,开源大模型阵营的天花板,大概率又要被重新丈量一次。大模型千问3.8开源通义千问本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29697发布仅三天就踩下刹车:Kimi K3 用户请求爆表,月之暗面算力顶到天花板
2026年7月20日 09:00
发布仅三天就踩下刹车:Kimi K3 用户请求爆表,月之暗面算力顶到天花板AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 20, 20267一款大模型上线三天就不得不暂停新用户入口,这种事在行业里并不多见,但月之暗面刚刚就这么做了。 7 月 19 日,Kimi官方发布公告称,由于Kimi K3 上线后用户请求量快速增长,为保障现有订阅用户的使用体验,即日起暂停C端新用户订阅,把现有算力优先投入已订阅用户服务,确保他们的会员权益不受影响。这纸公告背后,是一组超出团队预期的数字。Kimi团队表示,自 7 月 16 日发布Kimi K3 以来,产品获得了远超预期的用户支持,但过去 48 小时内,用户请求量已大幅超过此前的预估,并逼近现有算力集群的承载极限。在算力完成扩容之前,平台将暂时停止向C端开放新的订阅名额。公告同时给出承诺:月之暗面目前正全速推进算力扩容,随着新增算力陆续上线,平台会逐步恢复新用户订阅,直至全面恢复正常开放。与暂停订阅同步抛出的,还有一项权益拆分计划。Kimi宣布,未来面向新订阅用户,将把Kimi主权益与Kimi Code权益拆开。其中,Kimi主权益覆盖Kimi Web、Kimi App和Kimi Work,平台称此举旨在更精准地匹配算力资源,保障不同产品的使用体验。换句话说,越来越吃算力的编程能力,将被单独拆出来核算成本。把时间拨回三天前的发布日。Kimi K3 于 7 月 16 日正式发布,是月之暗面目前能力最强的大模型,拥有2. 8 万亿参数和 100 万Tokens的上下文窗口,主要面向长程编程与端到端知识工作。根据Kimi开放平台公布的信息,K3 采用按量计费模式,输入价格为每 100 万Tokens2 元(缓存命中)或 20 元(缓存未命中),输出价格为每 100 万Tokens100 元。更值得玩味的是商业侧的反馈。 7 月 18 日,Kimi总裁张予彤表示,K3 将于近日开放模型权重。她同时透露,数据显示,在 7 月 17 日K3 发布节点,公司年化收入(ARR)创下了历史最大单日增幅。一边是收入曲线被需求瞬间拉出尖峰,一边是算力基础设施被真实流量顶到了极限这次暂停订阅,恰好把大模型从发布PPT走进真实生产环境后最尖锐的矛盾,赤裸裸地摆在了台面上。当一个2. 8 万亿参数的巨兽撞上用户的真实热情,算力扩容的速度,第一次成了比模型参数更紧迫的考题。KimiK3算力扩容C端新用户权益拆分本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29696NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本登顶 RTEB 检索基准
2026年7月17日 18:00
NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本登顶 RTEB 检索基准AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 202614NVIDIA 近日发布了 Nemotron3Embed 系列嵌入向量模型,专为生产级 RAG、智能体检索、代码检索及智能体记忆等场景设计。其中8B 版本在检索嵌入基准测试 RTEB 上排名第一,成为当前该领域性能最强的开源模型。该系列包含三个开放检查点:Nemotron-3-Embed-8B-BF16(精度优先)、Nemotron-3-Embed-1B-BF16(轻量化版本)以及 Nemotron-3-Embed-1B-NVFP4(针对 Blackwell 架构优化的4比特版本)。三者均采用双向注意力掩码训练的 Transformer 编码器,最大序列长度均为32,768个 token,支持34种语言,并采用 OpenMDW-1.1许可协议开源。值得注意的是,其基础模型均基于 Mistral 架构,8B 版本源自 Ministral-3-8B-Instruct-2512,两个1B 变体则基于 Ministral-3-3B-Instruct-2512。在 RTEB 基准的16项公开任务测试中,8B-BF16版本以平均 NDCG@10得分78.46位列榜首。1B-BF16版本得分72.38,相较上一代基线 llama-nemotron-embed-vl-1b-v2提升了10.4分。而针对 Blackwell 优化的1B-NVFP4版本仅损失0.38分,相当于保留了99.5% 的精度,同时在 Blackwell 架构上吞吐量比 BF16提升2倍。1B 模型的构建采用了压缩而非小规模训练的路径。研发团队先使用 NVIDIA ModelOpt 的神经架构搜索将3B 基础模型剪枝至2B,再从微调后的8B 嵌入向量教师模型中通过余弦距离损失和均方误差损失进行知识蒸馏,最终迭代至1.14B 参数。NVFP4版本则在此基础上进行了量化感知蒸馏,使用512个样本校准、2万个样本训练,在长输入场景下恢复了精度。在部署层面,三个版本存在差异:8B 和1B 的 BF16版本支持 Transformers 和 Sentence Transformers 框架,而1B-NVFP4仅支持 vLLM0.25.0的 /v2/embed 接口。微架构覆盖方面,NVFP4版本兼容 Ampere、Hopper、Lovelace 和 Blackwell,而 BF16版本主要面向 Ampere、Hopper 和 Blackwell。NVIDIA 还发布了针对1B 模型的优化版 NIM 微服务,基于 Rust 构建,在 GB200和 RTX PRO6000上达到或超越了 vLLM 检查点的性能。应用场景方面,该系列模型支持多语言企业搜索(跨语言检索)、代码检索(训练数据包含 SWE-bench 等代码数据集)以及智能体记忆(32K token 长上下文支持较长对话摘要嵌入)。对于成本敏感场景,可采用"1B-NVFP4处理高容量召回 +8B 处理困难查询"的分层 RAG 策略。NVIDIA 同时提供了完整的代码示例,涵盖基于 Sentence Transformers 的本地推理和基于 vLLM 的服务端部署,查询和文档分别通过 `query:` 和 `passage:` 前缀区分,嵌入向量经 L2归一化处理后点积即等于余弦相似度。NVIDIANemotron3EmbedAI新词Mistral本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29695得物App联合千觉机器人发布AI鉴别机器人,亮相WAIC 2026
2026年7月17日 18:00
得物App联合千觉机器人发布AI鉴别机器人,亮相WAIC 2026AIbase基地发布于AI新闻资讯·1分钟阅读·Jul 17, 2026222026 世界人工智能大会(WAIC 2026)在上海开幕,得物App联合千觉机器人发布全球首个AI鉴别机器人,探索人工智能与具身智能在商品鉴别领域的应用。该机器人基于得物多年积累的商品数据和AI技术体系打造。得物App依托先鉴别、后发货模式,已沉淀数十亿级查验数据样本和海量商品数据库,并自主研发AI大脑人工智能查验鉴别系统。据介绍,该系统通过细粒度感知、跨模态信息融合等技术,可识别商品纹理、工艺等细节差异,目前与人工鉴别结果吻合度达99.9999%以上,覆盖鞋类、箱包、手表、服饰、美妆等多个品类。此次AI鉴别机器人将AI系统与机械臂、高清摄像头结合,自动完成商品抓取、图像采集和智能分析。以运动鞋为例,机器人可采集鞋面、中底、鞋盒等多维数据,并在约 5 秒内生成鉴别报告。背后支撑是得物长期建设的商品样本库,目前覆盖 25 个品类、 6000 多个品牌和 10 万多个商品。此次发布显示,AI与机器人技术正加速进入质检、鉴别等专业场景,推动消费服务向智能化方向发展。AI鉴别机器人得物AppAI大脑千觉机器人本文来自AIbase日报扫码查看欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
信息源:AIBase 来源:https://www.aibase.com/zh/news/29694