开源大模型ModelScope上手难度 🧪 硬核#低成本预训练#清华#RTX 5090#消费级显卡#开源大模型#ModelScope#Puro-2B

Puro-2B · Puro-2B(普罗)—— 4400美元训出的开源大模型,消费级显卡预训练方案

清华出品,4400美元在RTX 5090上训出20亿参数模型,15项评测平均超Qwen2-1.5B

指标同步中,请稍后刷新查看 在 ModelScope 查看

5 分钟上手

8×RTX 5090 集群起步,约 4400 美元训练成本
# 从 ModelScope 加载模型
from modelscope import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('thu-pacman/Puro-2B-Base', trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained('thu-pacman/Puro-2B-Base', trust_remote_code=True)

# 推理示例
inputs = tokenizer('你好,请介绍一下你自己', return_tensors='pt')
outputs = model.generate(**inputs, max_length=128)
print(tokenizer.decode(outputs[0]))

项目速览

Puro-2B(普罗)是清华大学陈文光教授与吕凯风教授团队联合推出的全流程开源低成本预训练大模型。核心突破在于:以约 4400 美元(使用消费级 RTX 5090 游戏显卡集群)的训练成本,从零训练了一个 2.03B 参数的 Dense 因果语言模型,并在 15 项评测任务平均指标上超越 Qwen2-1.5B。6900 美元成本的最高版本性能接近 Qwen2.5-1.5B。

团队公开了训练数据、训练框架、训练配置和模型权重全部资源,并提供成本-性能经验曲线(Puro Cost Scaling Law),让研究者在正式训练前即可预估不同预算能达到的能力水平。使用 RTX 5090 的原因是其 BF16 峰值算力/美元约为 H200 的 2.77 倍,最大化单位成本的算力产出。

能做什么

  • 从零预训练:提供完整的低成本预训练方案,包含数据配方、训练代码和超参配置,普通实验室即可复现
  • 通用语言任务:在 15 项综合评测(MMLU、C-Eval、GSM8K、BBH 等)中表现优秀,超越 Qwen2-1.5B
  • 成本预测:Puro Cost Scaling Law 帮助研究者在训练前预估不同预算下模型的性能水平
  • 消费级硬件可训:基于 RTX 5090 游戏显卡集群,无需数据中心级 GPU

怎么部署

模型权重在 ModelScope 公开发布。可通过 Hugging Face Transformers 或 ModelScope SDK 加载推理,支持常见推理框架。训练代码及配置全部在 GitHub 开源,含多节点分布式训练脚本。

适合谁

预算有限但想从零训练大模型的高校实验室、研究预训练科学问题的研究者、想了解消费级显卡训练方案的技术团队。

✅ 优点

  • •训练成本仅 4400~6900 美元,普通实验室可负担
  • •全流程开源含数据/代码/配置/权重
  • •RTX 5090 消费级显卡即可搭建集群
  • •提供成本-性能经验曲线辅助预算规划

⚠️ 局限与坑

  • •仅 2B 参数规模,能力上限有限
  • •消费级显卡训练效率低于数据中心卡
  • •社区生态尚在早期,周边工具较少
  • •评测范围以中文为主,英文泛化能力待验证

💼 典型应用场景

  • 1.低成本预训练研究
  • 2.高校大模型教学实验
  • 3.预训练成本-性能曲线参考

不想部署?试试同类在线工具

返回全部开源项目指标每周自动更新