萌力觉醒!京东618文具IP宠粉日 得力黄油小熊文具礼盒直降40元全新「美洽AI」上线,聚焦新媒体线索增长,新功能盘点!国产科幻机甲游戏《解限机》定档7月2日公测,登顶Steam国产游戏愿望单榜首文档解析LLM MonkeyOCR震撼登场:3B小模型完胜Gemini从实验室严测到家庭信赖:友望(UWANT)洗地机以技术透明赢得用户深度信任小红书发布首个开源大模型dots.llm1:11.2 万亿非合成数据助力中文性能提升英伟达 CEO 黄仁勋本周访欧,行程覆盖英法德三大国消息称印度计划开发 2nm AI GPU,瞄准 2030 年投入应用微星笔记本RTX50媒体交流会+昆山工厂行回顾:创新+品质服务玩家一场重新定义测评规则的跨界实验 解码友望与知乎携手的清洁行业革新意义Hugging Face发布轻量级开源机器人模型SmolVLA 助力开发者低成本入门高通同意收购半导体 IP 企业 Alphawave,总价约 24 亿美元恩智浦计划关闭多家 8 英寸晶圆厂,转向更高效率 12 英寸制造金砖大赛之元宇宙3D数字内容设计创作赛项·行业大咖谈|积木易搭CTO毛凯:3D数字内容的商业应用与发展传京东大举进军OTA 给出3倍薪资从各知名平台挖人三大运营商上线一键解绑服务!手机号码“二次焕新”到底有多重要?更有质感的iOS26要来了,但AI功能将继续跳票?西班牙Liberux推出NEXX隐私手机:硬件开关+Debian 13系统辅信推出XPC nano NE10N迷你主机:兼顾高效连接与多功能扩展需求江淮汽车 5 月新能源乘用车销量 1132 辆,同比下滑 57.81%
  • 首页 > 云计算频道 > 大模型

    小红书发布首个开源大模型dots.llm1:11.2 万亿非合成数据助力中文性能提升

    2025年06月09日 18:08:50   来源:Citnews中文科技资讯

      小红书近日宣布开源其首个大规模模型 ——dots.llm1,该模型具有1420亿个参数,是一种专家混合模型(MoE)。在推理过程中仅激活140亿参数,这种结构不仅保持了高性能,还大幅降低了训练和推理的成本。

      dots.llm1使用了11.2万亿个非合成的高质量训练数据,该模型在中文测试中的表现优异,平均得分91.3,超越了多款竞争对手。

      在技术架构方面,dots.llm1采用了单向解码器 Transformer 结构,并将传统前馈网络替换为 MoE。与传统模型不同,MoE 将多个专家网络分开,每个专家网络专注于输入数据的不同特征,从而在推理时只激活一小部分网络进行计算,大幅度节省了算力需求。

      dots.llm1包含128个路由专家和2个共享专家。每个专家都是一个具有两层前馈结构的网络,使用 SwiGLU 激活函数以捕捉数据中的复杂关系。在处理输入标记时,模型会动态选择出6个最相关的专家和2个共享专家进行运算。

      此外,dots.llm1在训练过程中还引入了改进的 RMSNorm 归一化操作,以稳定模型性能和输出。在 MoE 模块中,负载平衡策略的引入确保了所有专家网络的使用均衡,从而避免了过度依赖某些专家的问题。

      文章内容仅供阅读,不构成投资建议,请谨慎对待。投资者据此操作,风险自担。

    即时

    新闻

    明火炊具市场:三季度健康属性贯穿全类目

    奥维云网(AVC)推总数据显示,2024年1-9月明火炊具线上零售额94.2亿元,同比增加3.1%,其中抖音渠道表现优异,同比有14%的涨幅,传统电商略有下滑,同比降低2.3%。

    企业IT

    重庆创新公积金应用,“区块链+政务服务”显成效

    “以前都要去窗口办,一套流程下来都要半个月了,现在方便多了!”打开“重庆公积金”微信小程序,按照提示流程提交相关材料,仅几秒钟,重庆市民曾某的账户就打进了21600元。

    3C消费

    华硕ProArt创艺27 Pro PA279CRV显示器,高能实力,创

    华硕ProArt创艺27 Pro PA279CRV显示器,凭借其优秀的性能配置和精准的色彩呈现能力,为您的创作工作带来实质性的帮助,双十一期间低至2799元,性价比很高,简直是创作者们的首选。