中国AI为什么追得这么快?美媒找到一批关键人物

摘要:

据《华尔街日报》报道,中国AI模型近年来快速缩小与美国头部模型的差距,其背后并非短期突然出现的技术突破,而是清华大学等高校长期形成的人才网络,以及开源技术、人才回流和更高算力效率等因素共同推动的结果。报道认为,以智谱AI联合创始人唐杰、月之暗面创始人杨植麟以及DeepSeek创始人梁文锋等人为代表的一批研究者,构成了中国这一轮AI追赶的重要力量。

《华尔街日报》称,中美两国多名行业人士认为,中国最好的AI模型目前与美国最先进模型的能力差距已经缩小至数月。今年6月,马斯克曾预测中国要到2027年第一季度才能追上Anthropic的顶级模型,唐杰随后回应称,“不会需要那么久”。

报道将中国AI人才体系的形成追溯至20多年前。2005年,图灵奖得主姚期智在清华大学创办“姚班”,培养计算机领域的顶尖人才。与此同时,唐杰长期在清华从事数据挖掘和机器学习研究,其实验室后来成为中国AI人才的重要来源之一。杨植麟曾师从唐杰,在清华研究机器学习算法,随后赴卡内基梅隆大学攻读博士,回国后创办月之暗面。

这种高校与创业公司的人员流动逐渐形成了一张AI人才网络。2018年,中国进一步放宽科研人员创业及科研成果商业化限制,次年唐杰从清华实验室孵化出后来发展为智谱AI的公司。早在OpenAI于2020年发布GPT-3后,智谱就将开发同等级模型作为目标。

不过,相比美国AI企业,中国公司长期面对资金和先进芯片不足的问题。杰富瑞测算,在相关时期内,中国科技公司的投入规模不到美国同行的五分之一。在这一背景下,提高算力利用效率成为中国AI企业追赶的重要路径。

DeepSeek是其中的代表。报道提到,DeepSeek通过多头潜在注意力机制(MLA)降低模型运行中的内存消耗,并较早在中国采用混合专家模型(MoE),以减少对芯片算力的需求。这些技术成为2025年初“DeepSeek冲击”的重要基础,当时其推出的低成本开源模型引发美国科技股震荡,也迫使中国同行重新审视技术路线。

中国AI企业之间的技术交流也进一步加快了迭代速度。月之暗面后续模型采用了DeepSeek使用或验证过的MoE及MLA变体,而DeepSeek也采用了月之暗面优化过的训练技术。不同团队通过论文、开源模型和技术实践相互借鉴,形成了与封闭模型路线不同的技术扩散机制。

与此同时,人才回流也成为另一条技术路径。腾讯招募了曾在OpenAI工作的两名清华毕业生,字节跳动则引入曾供职于谷歌的中国研究人员。报道认为,美国AI公司的技术进展、海外人才回流以及中国本土研究网络,共同加快了中国AI公司的追赶速度。

但算力仍是中国AI企业面临的主要制约。梁文锋今年5月表示,芯片而非人才,是中美AI公司之间最关键的差距。阿里巴巴、智谱等头部实验室研究人员称,他们获得的高端芯片数量往往只有OpenAI、谷歌同行的五分之一。

查看评论
created by ceallan