Poolside AI 联合创始人 Eiso Kant:模型工厂、开放权重与通往 AGI 的代码之路
Poolside AI 联合创始人 Eiso Kant 在访谈中深入探讨了其模型工厂的工程系统、开放权重策略、代码作为 AGI 路径的信念,以及为何他宁愿看到 100 家基础模型公司而非五家寡头垄断。
近几个月来,开放与封闭、美国与中国关于模型所有权和主权/本地人工智能的讨论已经白热化。因此,池畔人工智能终于推出了新车型,例如Laguna S 2,这是一个非常非常好的消息。1,其规模是Thinking Machines最近发布的近10倍。
Poolside最近的技术报告因其详细程度而受到了很多赞誉,Vibhu首先报道了Laguna最近关于我们纸质俱乐部的技术报告:从在全世界关心之前花费1200万美元构建代码语言模型,到创建一个模型工厂,可以在八周内将模型从预训练到发布,
Eiso Kant花了十多年的时间押注代码是AGI的道路。
在这一集中,这位Poolside联合创始人与swyx和Vibhu一起解释了为什么ChatGPT感觉像是平反,为什么Poolside拥抱开放重量和开放研究,以及为什么他宁愿生活在一个拥有100家基金会模型公司的世界里,而不是五家基金会模型公司,
即使Poolside是五家之一。我们深入研究Poolside的模型工厂:每月10,000 - 20,000次实验背后的工程系统,将数据直接流传输到训练、可重复实验、低精度计算以及越来越多地编写代码、启动作业、评估结果和修改用于训练未来模型的管道的代理。
Eiso还解开了他们最近推出的Laguna S,为什么持久性、验证和回溯可能比原始智能更重要,较小的模型中保留了多少能力,为什么强化学习将更早地进入预训练,以及为什么下一个令牌预测仍然从网络中提取的内容太少。
我们还讨论了模型利用协同设计、Poolside从编码代理到AGI的路径、为什么Eiso认为LCP和传统工具调用是“愚蠢的”、前沿模型培训背后的真正经济学、Poolside的5亿美元融资、开源人工智能、监管、英伟达和台积电的影响力、代理时代的工程生产力、
高代理团队以及Poolside的招聘。
我们讨论:
Andrej Karpathy的RNN工作如何启发Eiso在2015年开始构建代码语言模型为什么Eiso在市场关心之前花了四年时间和1200万美元来追求一个想法为什么ChatGPT感觉像是平反并让Poolside重返开源为什么EISO更喜欢100家基金会模型公司而不是5家
寡头垄断公司发布开放权重和发布真正开放的研究之间的区别为什么Poolside故意在湾区人才大战之外建立一个全球性的研究机构为什么模型构建最终90%是工程模型工厂:
池畔的端到端系统,用于快速训练和改进模型不到70名的研究人员如何每月进行大约10,000 - 20,000次实验Poolside如何从六个月的模型周期转变为五周和八周的发布为什么将数据直接流传输到训练中可以实现更快的实验不可变数据、
版本化代码和可重复性如何实现严格的模型研究为什么Eiso希望有能力的研究人员离开实验室并成为Poolside的竞争对手为什么95%的模型构建可以简化为更好的数据或计算效率Laguna S以及为什么持久性、
验证和回溯可以胜过原始智能为什么较小的模型可能处理比之前预期更多的知识工作为什么强化学习会更早进入预训练为什么下一个代币预测仍然无法从网络中提取足够的知识为什么蒸馏和环境成为人工智能行业最喜欢的“药物”为什么中期培训确实是课程设计的早期形式低精度培训、
网络瓶颈以及计算效率的下一步提高Laguna S:1180亿个总参数,80亿个活跃参数,从训练到发射需要八周时间为什么模型构建者经常可以在前30分钟内评估新检查点模型与利用:
代理能力的实际来源为什么Poolside将编码和长期软件任务视为实现AGI的途径为什么Eiso认为LCP和传统工具调用是“愚蠢的”为什么未来的代理将编写脚本,而不是从数十种预定义工具中进行选择最少的安全带、容器和模型自由的案例为什么Poolside优先考虑愿景,
但预计不会很快开发音频为什么语言可能是编码知识和推理的计算效率最高的方式模型开发的实际成本以及为什么最终的训练运行虎头蛇尾Poolside名称背后的故事以及为什么它代表拒绝降低雄心Poolside如何筹集5亿美元,
而投资者仍然质疑AGI是否真实为什么情报可能成为世界上最需要和商品化的资源当开放模型可能变得太有能力不受限制地发布时为什么单方面的人工智能安全在全球竞争环境中行不通监管如何意外锁定两三家AI公司的寡头垄断NVIDIA、
台积电和支撑基础模型进展的硬件系统为什么学习挂钟时间是池畔最大的瓶颈之一为什么Poolside从头开始训练模型,
而不是简单地提取更大的模型人工智能如何改变公司衡量工程生产力的方式为什么代理可能成为AI时代员工最重要的素质领导者如何通过共同的目标和明确的约束来调整高层管理人员在Poolside招聘研究、培训后、培训前、建筑、evals和工程领域伊索·康德LinkedIn:https:
//www.
LinkedIn. com/in/eisokant池畔:https://poolside。
AI时间戳00:00:00简介00:00:54变形金刚之前的Karpathy、RNN和建筑规范模型00:02:26价值1200万美元的失败和ChatGPT辩护00:03:39开源和100家基金会示范公司的案例00:09:22 Open Weights、
Open Research和Poolside的全球团队00:
16:04模型工厂:为什么模型建造90%是工程00:20:19代理、自动化实验和RTI的早期迹象00:24:04流数据、再现性和科学严谨性00:30:35创建更多基础模范公司00:36:07 Laguna S:毅力与原始智力00:43:01重塑预培训、RL和课程设计00:
52:33低精度训练并从较小型号身上榨取更多00:58:37模型装备、编码代理和AGI之路01:09:26为什么HCP和传统工具调用是“愚蠢的”01:13:04愿景、多模式以及为什么语言仍然很重要01:18:15扩展模型和培训的实际经济学01:20:
40为什么Poolside被称为Poolside并筹集5亿美元01:
27:37开放模型、人工智能安全和寡头垄断的风险01:33:53英伟达、台积电和强化学习瓶颈01:41:52小型型号、蒸馏、工程生产力和招聘转录物简介:Eiso Kant、Poolside和Open模型Swyx [00:00:00]:好吧,
我们和来自Poolside的Eiso Kant以及Vibhu一起来到工作室。客气Eiso Kant [00:00:08]:谢谢。
谢谢你们邀请我,伙计们。很高兴来到这里。Swyx [00:00:10]:是的,刚上飞机。你给我发短信,你说:“嘿,我正在去旧金山的路上。“我当时想,‘你现在在飞机上,对吧?“就像,嘿。Eiso Kant [00:00:16]:我知道。
在我给你发短信后,我意识到今天可能会带来一些有趣的体验,但让我们这样做吧。
Swyx [00:00:23]:我的意思是,我想我会告诉客人的一件事是,他们不必准备那么多,因为如果你真的每天都在努力,那么甚至,就像,你模糊地记得的东西对于很多不是每天生活在你的世界里的观众来说将是新的,对吧?
所以10年前,您在Google Slush做了一次演讲,谈论了人工智能的民主化。现在,你正在开源一个令人难以置信的新模型,我们将谈论它。但我猜你为什么会喜欢dem