下一代大模型方向:初创公司竞逐 LLM 新前沿
2017年夏天,谷歌AI研究人员发表论文《Attention Is All You Need》,提出Transformer架构,奠定了此后近十年大语言模型的技术基础,并催生了ChatGPT、Claude、Llama等产品。MIT Technology Review的"What's Next"系列关注的是在此基础上探索下一阶段突破的初创公司,这些公司不再满足于单纯的规模扩张,而是从模型架构、训练范式或应用场景三个维度寻找新的可能性;其中部分团队尝试用混合架构或状态空间模型替代纯Transformer以提升效率,另一些则聚焦于推理时计算优化,让模型在回答前进行更深入的思考,还有些押注于特定行业场景的专用模型以降低部署成本。对于行业而言,这些方向预示着大模型竞争正从"参数军备竞赛"转向效率、推理能力与垂直落地,这决定了下一代AI产品能否真正进入企业核心业务流程。
原文 ↗