精选· 重要性 4/5
Petals:以BitTorrent风格在家运行大型语言模型
Hacker News (AI)··snorbleck·约 1 分钟阅读
社区热度 134 分
中文导读
Petals项目允许用户通过点对点网络共享模型分片,在消费级GPU上运行Llama 3.1等大模型,实现推理与微调,降低硬件门槛。
Petals在家运行大型语言模型,BitTorrent风格- 使用Llama 3.1(最高405B)、Mixtral(8x22B)、Falcon(40B+)或BLOOM(176B)生成文本,并根据您的任务对它们进行微调——使用消费级GPU或Google Colab。
- 您加载模型的一部分,然后加入一个网络,其中其他人提供模型的其他部分。对于Llama 2(70B),单批次推理速度可达6 tokens/秒,对于Falcon(180B)可达4 tokens/秒——足以用于聊天机器人和交互式应用。
- 超越经典的LLM API——您可以使用任何微调和采样方法,通过模型执行自定义路径,或查看其隐藏状态。您既享受API的便利,又拥有PyTorch和🤗 Transformers的灵活性。
当前主要贡献者:加载中...通过Discord或电子邮件关注开发:我们每隔几个月发送一次更新。没有垃圾邮件。我们向您发送了一封邮件以确认地址。点击链接即可加入!特色推荐:该项目是BigScience研究研讨会的一部分。