AI 见闻
精选· 重要性 4/5

Petals:以BitTorrent风格在家运行大型语言模型

Hacker News (AI)··snorbleck·约 1 分钟阅读
社区热度 134
中文导读

Petals项目允许用户通过点对点网络共享模型分片,在消费级GPU上运行Llama 3.1等大模型,实现推理与微调,降低硬件门槛。

Petals在家运行大型语言模型,BitTorrent风格- 使用Llama 3.1(最高405B)、Mixtral(8x22B)、Falcon(40B+)或BLOOM(176B)生成文本,并根据您的任务对它们进行微调——使用消费级GPU或Google Colab。

- 您加载模型的一部分,然后加入一个网络,其中其他人提供模型的其他部分。对于Llama 2(70B),单批次推理速度可达6 tokens/秒,对于Falcon(180B)可达4 tokens/秒——足以用于聊天机器人和交互式应用。

- 超越经典的LLM API——您可以使用任何微调和采样方法,通过模型执行自定义路径,或查看其隐藏状态。您既享受API的便利,又拥有PyTorch和🤗 Transformers的灵活性。

当前主要贡献者:加载中...通过Discord或电子邮件关注开发:我们每隔几个月发送一次更新。没有垃圾邮件。我们向您发送了一封邮件以确认地址。点击链接即可加入!特色推荐:该项目是BigScience研究研讨会的一部分。

原文出处
Petals: Run LLMs at home, BitTorrent-style

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读