您的当前位置:首页>科技咨询>资讯详情

阿里发布并开源千问3,称成本仅需DeepSeek-R1三

发表于:2025-04-29 10:00:15 浏览:14次 发布者: 网易互联网

4月29日凌晨,阿里巴巴宣布推出新一代通义千问模型Qwen3(千问3)并进行开源。阿里云方面表示,千问3是国内首个“混合推理模型”,将“快思考”与“慢思考”集成进同一个模型,参数量仅为DeepSeek-R1的1/3,成本大幅下降,并在ChatBot Arena等榜单中性能全面超越R1、OpenAI-o1等全球顶尖模型,登顶全球最强开源模型。知情人士对记者表示,这是今年上半年阿里云最核心的技术产品发布。


具体来看,通义千问官方发布的技术博客显示,千问3采用混合专家(MoE)架构,总参数量235B,激活仅需22B。预训练数据量达36T ,并在后训练阶段多轮强化学习。同时将非思考模式无缝整合到思考模型中,对简单需求可“快思考”,低算力“秒回”答案,对复杂问题可多步骤“深度思考”,两种模式的结合增强了模型实现稳定且高效的“思考预算”控制能力。

阿里云方面表示,性能大幅提升的同时,千问3的部署成本大幅下降,仅需4张H20即可部署千问3满血版,显存占用仅为DeepSeek-R1的三分之一。

目前,千问3已开源了2款30B、235B的MoE模型,以及0.6B、1.7B、4B、8B、14B、32B等6款密集模型,阿里云透露,千问3的30B参数MoE模型实现了10倍以上的模型性能杠杆提升,仅激活3B就能实现上代Qwen2.5-32B模型性能。所有千问3模型都是混合推理模型,API可按需设置“思考预算”(即预期最大深度思考的tokens数量),灵活满足AI应用和不同场景对性能和成本的多样需求。

开源后,用户可在魔搭社区、HuggingFace等平台下载模型并商用,也可以通过阿里云百炼调用千问3的API服务。个人用户可通过通义APP体验千问3,记者了解到,夸克也即将全线接入千问3。

未来,千问3将通过优化模型架构和训练方法等提升模型,以实现几个关键目标:扩展数据规模、增加模型大小、延长上下文长度、拓宽模态范围,并利用环境反馈推进强化学习以进行长周期推理。通义千问团队在技术博客中表示,“Qwen3 代表了我们在通往通用人工智能(AGI)和超级人工智能(ASI)旅程中的一个重要里程碑。我们认为,我们正从专注于训练模型的时代过渡到以训练 Agent 为中心的时代。”

猜你喜欢

库克闪现网易与丁磊见面,竟是为了这款游戏
库克闪现网易与丁磊见面,竟是为了这款游戏
发表于:2025-03-27 浏览:17 发布者: 网易IT
《血源》模拟器迎来史诗级更新:画面流畅、音频无损!
《血源》模拟器迎来史诗级更新:画面流畅、音频无损!
发表于:2024-11-07 浏览:61 发布者: ZOL中关村在线
京东已为超万名全职骑手缴纳五险一金,但是……
京东已为超万名全职骑手缴纳五险一金,但是……
发表于:2025-03-20 浏览:24 发布者: 网易互联网
紫牛问政|短视频招聘网约车司机“月入过万”?
紫牛问政|短视频招聘网约车司机“月入过万”?
发表于:2025-04-15 浏览:23 发布者: 网易互联网
支付宝崩了!多名用户遭遇多重扣款问题
支付宝崩了!多名用户遭遇多重扣款问题
发表于:2024-11-12 浏览:53 发布者: 新浪新闻
谷歌CEO要求员工保持斗志:我们必须缩小与ChatG
谷歌CEO要求员工保持斗志:我们必须缩小与ChatG
发表于:2024-12-30 浏览:35 发布者: 网易IT
全场景营销,将“信任”归还品牌本身
全场景营销,将“信任”归还品牌本身
发表于:2024-12-30 浏览:34 发布者: 网易互联网
滴滴顺风车严惩线下交易, 今年永久封禁超4万人
滴滴顺风车严惩线下交易, 今年永久封禁超4万人
发表于:2025-05-23 浏览:12 发布者: 网易互联网
共同体的不可能:“遥控时代”的监视权力、自我量化与同质性
共同体的不可能:“遥控时代”的监视权力、自我量化与同质性
发表于:2024-11-06 浏览:37 发布者: 澎湃新闻
今年双11,快递员赚钱了么?
今年双11,快递员赚钱了么?
发表于:2024-11-18 浏览:45 发布者: 网易新闻