最近看了一期很有意思的访谈,嘉宾叫 Neil,前英伟达工程师,现在自己创办了一家叫 Sal Research 的公司。


最近看了一期很有意思的访谈,嘉宾叫 Neil,前英伟达工程师,现在自己创办了一家叫 Sal Research 的公司。这家公司做的事情说白了就是一个“token 工厂”,专门给别人提供最便宜的 AI 推理服务。他的原话是:我的工作就是把 token 的价格压到人类能做到的极限。

他有一个很核心的判断:当一样东西的成本降低 10 倍,它就会变成一个全新的产品品类。就像手机流量从几块钱一兆变成几乎不要钱之后,短视频才成为可能。AI 也是一样的道理。

Neil 认为 AI 的未来不是你坐在电脑前跟聊天机器人一问一答,而是大量的 Agent 在后台默默运行几个小时甚至几天。你晚上睡觉,早上醒来,活儿已经干完了。最好的延迟就是零延迟,你根本不需要等。

这个判断直接影响了他的技术路线。GPU 本质上是一台吞吐量机器,你给它塞满任务它最开心。但过去几年,因为大家都在做聊天机器人,所有人都在拼“谁能更快吐出下一个字”,这其实是在用一种很低效的方式使用 GPU。Neil 说,既然我的客户是后台跑的 Agent,我根本不需要追求极致的速度,我只需要追求极致的便宜。

于是他搞了一套“拾荒者策略”。别人抢着买英伟达最新最贵的芯片,他不跟着抢。他去找那些别人看不上的芯片,AMD 的、谷歌 TPU、亚马逊自研芯片,什么都行,只要每瓦特算力的性价比够高,他就买。他甚至愿意接受只有 95% 可用性的数据中心,别人觉得这简直不可接受,他说没关系,我的 Agent 在后台跑着呢,偶尔断一下,把任务挪到别的机器上就行了,客户根本感知不到。

更狠的是,他在考虑用太阳能和风能来供电。这种间歇性能源一直被认为不适合数据中心,因为云一来就没电了。但他说,我可以预测天气,提前把负载转移到别的地方,哪怕一个数据中心停了几天我也无所谓。这样他就能拿到别人根本不会碰的廉价电力。

他还聊到一个很有意思的数字:按照现在 OpenAI 的定价,消耗一万亿个 token 大概要花 500 万美元。他的目标是把这个数字压到 5000 美元。三到六个数量级的成本下降。到那个时候,你可以让 AI 不计成本地去研究任何一个科学问题,去审计每一行代码的安全漏洞,去实时监控整个互联网的变化。

关于 AI 行业的大格局,他觉得开源模型和闭源模型会长期共存。闭源模型花巨资保持领先三到六个月,但蒸馏这件事根本挡不住,因为人们用 AI 生成的代码和文章已经遍布互联网了,这本身就是一种“隐性蒸馏”。开源永远不会消失,因为做开源的激励太强了。

最后他说了一句让我印象很深的话:我们现在还是把 AI 当成一个很贵的顾问,有难题才去问它。这种思维方式要变了。机器能思考这件事本身就很了不起,我们应该想办法让尽可能多的人用上它。

#How I AI##科技先锋官#



分类