由前OpenAI CTO米拉·穆拉蒂创立的AI初创公司Thinking Machines,今日发布了其首款AI模型。该模型专为实时人机交互设计,融入了DeepSeek等中国竞争对手的架构理念。公司此前已以120亿美元估值融资20亿美元,显示出投资者对穆拉蒂愿景的强烈信心。
事件:Thinking Machines首个模型发布
Thinking Machines发布了其首款模型,公司声称该模型在保持连贯、低延迟对话的同时,仅需美国实验室同类模型一小部分算力。据英国《金融时报》报道,该模型采用了“混合专家”架构,每次查询仅激活相关子网络——这项技术由DeepSeek和Qwen等中国AI实验室率先推广。

该模型目前通过API和有限的消费者聊天界面提供。穆拉蒂将此次发布描述为“一家致力于让人工智能保持人类智慧、而非取代人类的公司推出的首款产品”。此次发布距离Thinking Machines以20亿美元融资轮走出隐秘状态不到18个月——这是AI领域规模最大的种子轮融资之一。
意义所在:中国AI架构的影响
该模型的设计大量借鉴了中国最新一代大语言模型,这些模型优先考虑效率而非原始规模。DeepSeek的V3和R1模型表明,通过激活的专家模块精心路由计算,可以在训练和运行成本远低于GPT-4等单体模型的情况下,达到或超越其性能。
Thinking Machines采用这种方法,标志着西方AI策略的重大转变。大多数美国前沿实验室——OpenAI、Anthropic、Google DeepMind——在大型训练任务和数万块GPU集群上投入巨资。相比之下,中国实验室专注于架构创新,以榨取更高的单位能耗性能。穆拉蒂的团队押注,同样的原则可以赋予Thinking Machines成本与速度优势,同时不牺牲质量。

“我们研究了DeepSeek和Qwen的做法,然后问:为什么我们不能用更好的数据和更好的对齐来实现同样的效果?”Thinking Machines的一位工程师在随发布附上的技术博客文章中写道。结果,该模型据称能够处理50-token上下文窗口,响应时间低于200毫秒,因此适用于实时语音和聊天应用。
市场影响:20亿美元的赌注
投资者显然认同穆拉蒂的主张。由Sequoia Capital和Andreessen Horowitz领投的20亿美元融资轮,在Thinking Machines尚未推出任何产品前,就将其估值推至120亿美元。如今,这一估值将面临首个考验:该模型必须证明自己能够吸引开发者和企业客户。
定价策略颇为激进:Thinking Machines每百万输入token收费0.15美元,每百万输出token收费0.60美元——约为OpenAI GPT-4o价格的一半,Anthropic Claude 3.5 Sonnet的三分之一。如果该模型能提供同等质量,可能会迫使现有厂商降价,否则将在快速增长的API市场中失去份额。
不过,企业采用将取决于可靠性、安全功能以及围绕该模型的工具生态系统。Thinking Machines已推出与LangChain、LlamaIndex及主要云提供商的集成,但缺乏OpenAI或Google那样的企业销售基础设施。
竞争格局:穆拉蒂对阵OpenAI及其他
穆拉蒂在2023年底离开OpenAI,是业界最重大的高管离职事件之一。作为CTO,她曾负责GPT-4和ChatGPT的开发。如今,她直接与前雇主——以及Anthropic、Mistral和Google——竞争。
时机颇为棘手。OpenAI最近发布了具备原生语音和图像推理能力的GPT-4o,而Anthropic推出了基准测试领先行业的Claude 3 Opus。与此同时,Meta的Llama 3和Mistral的Mixtral等开源替代品持续进步,缩小了与专有模型的差距。

Thinking Machines的差异化在于其架构和创始人的品牌。穆拉蒂仍是AI安全与工程领域最受尊敬的人物之一。公司将其模型宣传为“思考优先,而非规模优先”,以此吸引对单体模型成本和延迟感到沮丧的开发者。这一信息能否赢得企业买家,仍有待观察。
Thinking Machines的下一步
该公司计划在数周内推出微调框架,使客户能够将基础模型适应法律、医疗、金融等专业领域。一个侧重于推理的变体,内部称为TM-R,预计将于今年晚些时候发布。
Thinking Machines也在扩充团队,招聘数据工程、安全研究和开发者关系等职位。据报道,公司拥有数年的现金储备,因此有时间迭代模型并构建企业市场推广体系。
短期最大的风险是竞争对手迅速复制Thinking Machines模型的效率提升。如果OpenAI或Anthropic更广泛地采用混合专家架构,成本优势可能消失。但就目前而言,穆拉蒂的团队已经推出了一款可信的首款产品——并传递了一个信号:中国AI策略在西方同样奏效。
对行业意味着什么
Thinking Machines的首次亮相验证了一个论点:架构创新——而非单纯砸钱——可以驱动下一波AI性能提升。对投资者而言,这引出一个问题:他们应该支持资本密集型的训练任务,还是更精简、更高效的设计?对竞争对手而言,优化推理成本的压力骤然加大。API市场的价格战可能加速。
该模型依赖于中国首创的技术,也凸显了AI研究的全球性。尽管存在地缘政治紧张局势,但思想跨越国界流动。轻视中国创新的美国实验室可能会错失下一个范式。
对企业客户而言,更多选择和更低价格是明显的胜利。但最终的考验在于:Thinking Machines能否在规模扩张时保持质量?以及穆拉蒂能否打造一家经得起发布热潮考验、持续发展的公司?
常见问题解答
Thinking Machines的首个AI模型叫什么名字? 该模型正式名称为TM-1,不过公司在公开场合常简称为“思考模型”。
TM-1与GPT-4o相比如何? TM-1旨在以更低的延迟和成本实现类似的对话能力。独立基准测试尚未公布,但公司声称,在常见推理和编程任务上,TM-1能媲美GPT-4o,同时算力消耗减少约40%。
为什么Thinking Machines在产品推出前就融资20亿美元? 投资者押注米拉·穆拉蒂在OpenAI的业绩记录以及团队架构方法的潜力。这笔资金用于人才、算力和企业市场推广开支。
任何人都可以使用这个模型吗? 是的,通过开发者API即可使用,免费套餐每月最多10万token。消费者聊天界面也已上线,但初期仅限美国用户。
模型如何融入中国AI技术? 它采用了混合专家架构和动态路由,类似于DeepSeek的V3和Qwen的Qwen2。这一选择是深思熟虑的:优先考虑效率而非暴力扩大规模。
Thinking Machines会发布开源版本吗? 公司尚未宣布开源计划。穆拉蒂表示,该模型目前将保持专有,不过预计会发布一篇详细介绍架构的研究论文。
结论
米拉·穆拉蒂的Thinking Machines已正式入场,首款AI模型融合了中国实验室的成熟技术与创始人强调安全至上的理念。20亿美元融资和120亿美元估值设定了极高的期望,但产品本身——更便宜、更快、架构更精简——构成了强有力的开场论证。至于它将重塑竞争格局,还是仅成为一段有趣的注脚,将取决于市场采纳、迭代速度以及现有厂商的反应速度。










参与讨论
Will architectural efficiency beat scale in AI?