刘聪 NLP:开源 awesome-open-llms!全网开源模型,一网打尽!
7 月开源模型以 Kimi-K3 为焦点,具身相关模型明显增多;腾讯混元 Hy3 正式版总参数 295B、激活 21B、上下文 256K。
7 月开源模型以 Kimi-K3 为焦点,具身相关模型明显增多;腾讯混元 Hy3 正式版总参数 295B、激活 21B、上下文 256K。
蒸馏 5 位作者 645 篇公众号文章,按 AI 硬件、论文解读等维度总结标题句式;每次从稳健准确、网感点击等方向生成并选出前 5 名,标注标题党风险与关键词过期。
6 月开源模型密集发布,Anthropic Fable5、智谱 GLM-5.2、MiniMax M3 等相继上线;后训练模型增多,Nex-N2-Pro 与 Macaron-V1-Preview 受关注。
5 月开源模型数量明显减少,国内集中在面壁、千问、混元等厂商;MiniMax M3 即将发布,Qwen3.7 的 32B 版本仍在等待开源。
4 月国内开源模型密集发布,DeepSeek-V4、GLM5.1、Kimi K2.6、Qwen3.6 等相继开源;作者认为国内头部模型与国外御三家仍有差距。
总参数 284B、激活参 13B,视觉 token 压缩率 7056×;预训练数据经两层过滤后超 4000 万条,SFT 覆盖计数、空间推理、迷宫导航与路径追踪四类任务。
DeepSeek 多模态模型灰度上线,视觉能力整体不如 Qwen3.5-Plus;OCR 与文字识别表现不错,但空间推理、表格还原和复杂逻辑推理较弱。
3 月开源模型以中小尺寸为主,Qwen3.5 小模型、美团 LongCat-Next 全模态等密集发布;Anthropic 的 Claude Code 源码被被动开源。
2 月国内厂商密集开源,GLM-5、Qwen3.5、MiniMax M2.5 等相继发布;字节 Seedance 2.0 未开源但表现突出。
总参数 397B、激活 17B,上下文 1M,词表扩至 250K;API 价格每百万 Token 低至 0.8 元,为 Gemini 3 Pro 的 1/18。
1 月开源模型密集发布,Kimi K2.5、GLM-4.7-Flash、DeepSeek-OCR 2 等追平闭源;DeepSeek 发布 mHC 和 Engram 论文,基本敲定 V4 架构。
核心改动是将视觉编码器从 ViT 换成 prefix LM 结构,引入可学习 query 交互;实测手写体、生僻字、竖版识别有提升,表格结构仍会出错。
12 月国内开源模型密集发布,智谱开源周与小米 MiMo-V2-Flash 最受关注;HuggingFace 热力图显示 Qwen 以 382 个模型居首。
11 月开源模型数量明显减少,Gemini3.0 Pro 与 Nano Banana Pro 成为最大亮点;国内字节、千问等发布新模型但未开源。
Densing Law 登上 Nature 子刊封面,模型能力密度约每 100 天翻一倍;作者认为小模型与端侧模型未来两年发展势头将强于大模型。
10 月国内开源模型共汇总 20 余款,Qwen3-VL 系列尺寸开全;蚂蚁连发 Ling-1T、Ring-1T、Ming-flash-omni 三款模型。
Qwen3-VL-30B-A3B 开源 Instruct 与 Thinking 两个版本,另有 FP8 版本,两张 4090 即可运行;实测中 Thinking 版在理解计算、图片排序、空间变换上强于 Instruct 版,表格识别与网页复刻表现不佳。
9 月国内开源大模型密集发布,阿里、腾讯、DeepSeek、智谱等均有新模型;月末 DeepSeek-V3.2 与 GLM-4.6 压哨开源。
LongCat-Flash-Thinking 采用长 CoT 冷启动加强化学习两阶段训练,RL 阶段用 DORA 系统并多领域并行训练后融合;实测速度快,指令遵循与数学代码表现不错,但老鹰飞行题答错。
8 月国内开源大模型密集发布,涵盖 Qwen-Image、GLM4.5V、MiniCPM-V 4.5、DeepSeek-V3.1 等;美团压线开源 560B 参数的 LongCat MoE 模型。