首页 > 年代秀 > 正文

达芬奇的恶魔

沿用DeepSeek架构,美国大模型开始抄中国作业_我的网站

金刚狼

A |     OpenAI前首席技术官穆拉蒂,做出了一款中国模型的“贵替”。         Thinking Machines发布的首款模型Inkling,混合专家架构主要沿用DeepSeek-V3,后训练冷启动还使用了Kimi K2.5等开放模型生成的数据。    

中国社会科学院俄罗斯东欧中亚研究所研究员  张弘
中国国际问题研究院国际战略研究所副研究员 唐奇芳
2024年5月16日上午,国家主席习近平在北京人民大会堂同来华进行国事访问的俄罗斯总统普京举行会谈。会谈前,习近平在人民大会堂东门外广场为普京举行隆重欢迎仪式。图/视觉中国
2024年5月16日,国家主席习近平在北京人民大会堂同来华进行国事访问的俄罗斯总统普京举行会谈。

B | 两国元首共同签署并发表《中华人民共和国和俄罗斯联邦在两国建交75周年之际关于深化新时代全面战略协作伙伴关系的联合声明》,并共同见证签署经贸、自然保护、检验检疫、媒体等领域多项双边合作文件。

C |

普京于16日凌晨4时许乘专机抵达北京,对华开启为期两天的国事访问。
此次访华期间,普京还专程访问中国东北重镇哈尔滨,出席第八届中国-俄罗斯博览会和第四届俄中地方合作论坛开幕式,并与哈尔滨工业大学的学生和教授交流。

D |

《莫斯科共青团员报》称,普京此次中国之行有超过半数的副总理和主要政府部门的部长随同,包括几乎所有经济部门领导人。然而在多项基准评测中,Inkling落后于Kimi和GLM,调用价格反而更高。
刚刚出任俄国防部长的别洛乌索夫和联邦安全会议秘书绍伊古也在随行名单之列。         对于一家融资20亿美元、估值120亿美元,团队中聚集了大量OpenAI前员工的明星公司来说,这个结果多少有些低于预期。         但穆拉蒂可能从一开始就没打算靠Inkling争夺第一。随着美国企业使用中国模型面临越来越多不确定性,一款性能尚可、支持定制、合规风险更低的本土开放模型,已经拥有自己的市场。“贵替”没有那么强,也不愁“市场”。         01          穆拉蒂的首款模型,就这?          当地时间7月15日,Thinking Machines Lab发布了成立以来的首款模型Inkling。         单看配置,这款模型很符合一家明星AI实验室应有的排场。         Inkling采用混合专家架构,总参数量达到9750亿,每处理一个Token会激活410亿参数;预训练使用了45万亿个Token,数据涵盖文本、图像、音频和视频,最长支持100万个Token的上下文。
普京就任后首访选择中国,传递出其对发展对华关系的重视。

E | 它可以理解文字、图片和音频,再以文字形式输出结果,还支持通过调节“思考强度”,在性能、速度和成本之间进行取舍。         Inkling同时开放了模型权重,采用相当宽松的Apache 2.0许可证。开发者可以下载权重、自行部署,也可以通过Thinking Machines旗下的Tinker平台对模型进行微调。中国已经连续13年成为俄罗斯最大贸易伙伴国。西方制裁之下,美欧已经基本关闭对俄市场,南方国家市场容量有限,中国市场则仍有增长潜力。此次普京率领的代表团堪称“豪华”,凸显出对于拓展中国市场的渴望。

此外,在当前复杂的国际形势下,普京希望增强与中国合作,也不乏战略方面的考量。         公司给它的定位很明确:与其直接和ChatGPT争夺普通用户,Inkling更适合充当企业开发AI应用的底座。俄罗斯希望加强与中国的互动,打破西方的孤立,增强其反击西方制裁的能力。         不过,Inkling最引人注意的部分,藏在技术报告后半段。
哈尔滨是中国与俄罗斯交往的重要中转站。19世纪末中东铁路修建时,就有大量俄罗斯人进入中国东北寄居。十月革命后,不少俄罗斯贵族流亡中国。

F |          Thinking Machines在介绍模型架构时直接写道,Inkling的混合专家设计“主要沿用了DeepSeek-V3”。

G | 它同样设置了大量专家模块,每个Token只调用其中一小部分,并采用了DeepSeek-V3的无辅助损失负载均衡等设计。          作者声明:该图片由AI生成          中国模型对Inkling的影响还延伸到了训练阶段。

H | 位于哈尔滨的苏联红军烈士纪念碑是中国和苏联红军一起打败日本法西斯的见证。

I | 普京访问哈尔滨就是要巩固中俄两国的民间互信,增进两国人文合作,提升俄罗斯在中国社会的形象。         Thinking Machines表示,为了启动后训练,公司先用开放权重模型生成的合成数据做了一轮监督微调,其中明确提到了月之暗面的Kimi K2.5。

J |          整条技术路线已经足够清楚:一家由OpenAI前首席技术官创办的美国实验室,首款模型沿用了DeepSeek的架构,又借助Kimi生成的数据完成后训练起步。         借鉴开放模型本身没有问题。

K |

中国和俄罗斯是搬不走的邻居,促进两国关系发展符合两国社会和人民的利益,也有助于国际和地区局势稳定。中俄是新型的大国关系,政治互信基础坚实,经贸合作稳步提升,但在政治和安全领域,双方都强调“不结盟、不对抗、不针对第三方”,为国际社会树立了新型大国关系的典范。DeepSeek和Kimi公开权重并允许开发者使用,科学研究和工程开发原本就建立在公开成果的积累之上。更尴尬的地方在于,Inkling吸收了中国模型的技术之后,性能依然没有压过这些“老师”。         Thinking Machines对此也没有粉饰。
今年是中俄建交75周年。

L | 公司在发布文章中直接承认:“Inkling并非目前表现最强的模型,无论开放模型还是闭源模型。在百年未有之大变局下,长达万字的中俄联合声明包罗万象,涵盖了经贸、安全、人文、国际政治、地区合作等方方面面,不仅凸显出中俄关系的稳定性和连续性,而且体现了中俄新时期继续增强合作的意愿。”          从Thinking Machines公布的结果看,          .在“人类最后的考试”纯文本评测中,Inkling得分29.7%,Kimi K2.6和GLM 5.2分别达到35.9%和40.1%;          .加入工具后,Inkling升至46%,依然低于Kimi K2.6的54%和GLM 5.2的54.7%。

M |

当地时间2024年5月15日,新加坡总理黄循财(左)与前总理李显龙(中)在宣誓就职仪式上握手,新加坡总统尚达曼在旁观看。         .在考察真实软件工程能力的SWE-Bench Pro中,Inkling得分54.3%,Kimi K2.6为58.6%,GLM 5.2达到62.1%;          .Terminal Bench 2.1上的差距更加明显,Inkling只有63.8%,Kimi K2.6和GLM 5.2分别达到71.3%和82.7%。

N |          当然,Inkling也有自己的长项。它在网页应用设计、音频理解和安全性评测中表现不错,在部分数学任务上也能超过Kimi和DeepSeek。图/视觉中国

2024年5月15日,新任总理黄循财从执政20年的李显龙手中接过总理一职,成为新加坡第四任总理。         只是从综合推理、编程和智能体能力来看,它目前很难被归入开放模型的第一梯队。         性能没有冲到最前面,价格同样没给出惊喜。
历经李光耀、吴作栋、李显龙三任总理的新加坡,正式进入“4G”(第四代领导团队)时代。         在Tinker平台上,64K版本Inkling每100万Prefill Token收费1.87美元,每100万Sample Token收费4.68美元。新加坡《联合早报》指出,这是新加坡独立建国59年以来,第三次经历领导权顺利平稳交接。前者可以粗略理解为输入成本,后者接近生成成本,而且这已经是“限时五折价”。

o |

黄循财现年52岁,曾在新加坡国防、通讯及新闻、文化、国家发展、教育、财政等多个部门任职。2022年4月,他被推选为该国执政党第四代领导团队新领导人以及新加坡副总理。
在新加坡总统尚达曼的主持下,黄循财发表就职演说,强调连续性和稳定性对新加坡政府的重要性。256K版本的价格更高,分别达到3.74美元和9.36美元。         作为对比,Kimi K2.6官方API每100万输入和输出Token分别收费0.95美元和4美元,GLM5.2分别为1.4美元和4.4美元。         Tinker同时提供训练和采样服务,与普通模型API并非完全相同的计费口径。但按照上述价格粗略比较,Inkling的预填充价格接近Kimi K2.6的两倍,生成价格也高于Kimi K2.6和GLM5.2,暂时没有体现出价格优势。
新内阁成员也于同日宣誓就职。         于是,Thinking Machines的首款模型呈现出一种有些微妙的局面:架构参考DeepSeek,后训练借力Kimi,综合性能没有超过中国头部开放模型,调用价格反而更贵。         02          穆拉蒂的选择          考虑到穆拉蒂和Thinking Machines的背景,这样的选择便更加耐人寻味。黄循财接任总理后会继续掌管财政部;曾与他在疫情期间共同领导工作小组的颜金勇升任副总理,并兼任贸工部长;现任国务资政兼国家安全统筹部长张志贤同样留任。
此外,曾担任新加坡副总理5年的王瑞杰同样获得留任,并继续兼任经济委员会主席。卸下总理职位的李显龙并未完全退出政坛,他接受黄循财的邀请,担任国务资政,继续在内阁服务。
新加坡将在2025年11月前举行下一次大选,黄循财计划在选举后对内阁进行更大的调整。

p |

“我们会以自己的方式领导国家。

q | 我们会继续大胆设想,并且考虑长远。         如果Inkling来自一家普通的AI创业公司,借鉴DeepSeek、借助Kimi训练,或许还没有这么耐人寻味。偏偏它来自Thinking Machines——一家几乎可以称为“OpenAI校友会”的公司。         2025年2月,Thinking Machines正式亮相时,团队只有约30人,其中大约三分之二来自OpenAI,其余成员主要来自Meta和Mistral。         创始团队一度包括OpenAI联合创始人John Schulman、OpenAI前研究副总裁Barret Zoph,以及Lilian Weng、Andrew Tulloch和Luke Metz等研究人员。         这些人分别参与过OpenAI的强化学习、后训练、预训练、安全和推理研究。我们知道还有很多工作要做,因为我们岛国的故事还在进行中。我们还有很多篇章要谱写,新加坡故事最好的篇章还在前方。路透社当时甚至直接形容,穆拉蒂从前东家挖走了至少20名研究人员。”黄循财在总统府发表就职演讲时说。

但在外界看来,黄循财面临着对新加坡模式如何更新的压力。         站在这群OpenAI校友中间的穆拉蒂,当然是最特殊的一个。         她于2018年加入OpenAI,先后参与DALL-E、Codex、ChatGPT和Sora等产品,2022年升任首席技术官,负责协调研究、模型训练、安全和产品落地。
新加坡历史上有过三次权力更迭,已形成了成熟的交接和过渡机制。

r | 领导人正式交接之前会有一段过渡期,而在新总理执政初期,为了确保权力平稳交接,前任总理不会完全隐退,“扶上马送一程”是惯常做法。

s |           作者声明:该图片由AI生成          2023年11月,OpenAI董事会突然罢免Sam Altman后,穆拉蒂还曾短暂担任临时首席执行官。她的角色更接近技术和产品的总负责人,对OpenAI的模型研发流程和产品化路径有着完整了解。此次李显龙就任国务资政,正是扮演这样的角色。         换句话说,Thinking Machines从成立之初就不缺OpenAI经验。         穆拉蒂和她的团队知道一家顶级闭源实验室如何开发模型,也亲历了ChatGPT从研究成果变成全球产品的全过程。

t | 当这群人离开OpenAI,从零搭建自己的技术体系时,外界自然会期待他们拿出一条带有OpenAI印记的路线。         结果,Inkling最明确的技术来源却指向了中国。

黄循财是新加坡1965年独立后出生的年轻领导人,正处于最年富力强的黄金时代。这很容易被理解成一个戏剧性的信号——最了解OpenAI的一群人离开OpenAI后,最终选择了中国模型的技术蓝图。虽然与李显龙和吴作栋相比,黄循财作为“接班人”的培养时间相对较短,但新加坡成熟的交接制度,可以确保其实现平稳过渡。         不过,这个结论还需要拆开来看。         OpenAI近年来的前沿模型全部采用闭源路线,外界拿不到模型权重,也不了解完整的架构、训练数据和后训练方案。穆拉蒂即使熟悉OpenAI内部技术,也不能把前东家的商业机密直接搬进新公司。DeepSeek和Kimi则公开了权重或技术报告,架构、训练方法和工具链都可以合法研究和复用。

u |

黄循财就职后只对内阁进行了微调,大多数成员继续留任,这说明他在优先考虑稳定性和连续性,整体上将会延续前任政府的政策路线。
李显龙执政的20年,实现了新加坡在政治社会稳定前提下的高速发展,使新加坡跻身世界最发达国家行列。这是他留给黄循财最大的政治遗产。而李显龙对新加坡大国平衡外交的完善和巩固,也形成了较为有利的外交格局。
目前来看,黄循财在政治上不太会面对严重的对立和波动,但在具体的施政方针和政策上,如何容纳不同的意见,考验着他的政治智慧。此外,当前国际局势日益复杂,地缘政治挑战不断加剧,新加坡如何在大国之间维持平衡、做出有利于自身发展的决策,将是黄循财面临的重要考验。
当地时间2020年10月22日,美国田纳西州那什维尔,美国大选最后一场辩论举行,总统候选人特朗普和拜登正面交锋。图/视觉中国
当地时间2024年5月15日,美国总统拜登与特朗普共同发声,确定同意提前进行总统大选辩论,双方已确定出席美国有线电视新闻网(CNN)和美国广播公司于6月27日和9月10日举办的两场电视辩论。
特朗普还提议10月2日在福克斯新闻进行第三场辩论,但拜登并未接招。
在CNN总部亚特兰大举行的首场辩论,将是美国史上首次由私营电视台主持的总统选举辩论。CNN称,此次辩论将不会有观众参加。
有分析指出,此次总统辩论的形式、时间、场所均打破了几十年来的传统,并可能成为美国现代历史上在选举年最早进行的总统辩论。         Inkling本身也是一款开放权重模型。
自1988年以来,美国大选的总统辩论一直由“总统辩论委员会”组织操办。对于一家想要建设开放模型生态的公司来说,从DeepSeek、Kimi等开放模型中吸收成熟方案,属于顺理成章的工程选择。该委员会曾在2023年提议,在今年9月16日、10月1日和10月9日举行3场总统候选人辩论。
但据两位不愿透露姓名的知情人士透露,拜登和特朗普的竞选团队曾就如何规避总统辩论委员会进行了数周的非正式会谈。
《纽约时报》分析,拜登和特朗普之所以提早进行总统辩论,是因为他们相信,这将有助于提高自己的支持率。

v |

在拜登阵营宣布这场辩论之前,最近的一项民意调查显示,拜登在密歇根州、亚利桑那州、内华达州、佐治亚州、宾夕法尼亚州等五个关键州的支持率都落后于特朗普。         今天开发一款开放模型,完全避开中国团队已经公开的成果,反而要付出更高的试错成本。         因此,Inkling借鉴中国模型,并不能直接证明穆拉蒂认为DeepSeek的技术全面领先OpenAI。
当地时间2024年5月15日,斯洛伐克总理菲佐在内阁外出会议后被枪击受伤,随后警方逮捕了一名男子。

w | 图/视觉中国

枪击事件发生两天后,当地时间2024年5月17日,斯洛伐克总理菲佐接受了二次手术,仍在重症监护室接受治疗。

x |

该国副总理兼国防部长卡利尼亚克称,“接下来的两三天对菲佐的康复至关重要,他的病情仍然很严重。”
5月15日,菲佐在主持完政府会议后遭遇枪击,随后被紧急转移至中部第一大城市进行手术。这是自斯洛伐克于1993年1月1日成为独立主权国家以来,该国历史上第一次出现针对政府高层的暗杀。
71岁高龄的枪手辛图拉被现场逮捕,并被控“谋杀未遂”。公开资料显示,辛图拉是杜哈文学俱乐部的创始人之一,自2005年以来一直活跃于该俱乐部,曾写了三本诗集,还出版过小说。双方公开程度不同,可供借鉴的条件也完全不同。         但这件事依然释放了一个清晰的信号:至少在开放权重领域,中国模型已经成了美国AI团队的重要参考系。

y |

斯洛伐克内务部长埃什托克表示,辛图拉是不属于任何政治团体的“孤狼”,“袭击本身是出于政治动机”。         所以,借鉴中国模型并不难解释。真正需要回答的问题是:Thinking Machines吸收了现成的架构和训练经验,为什么最终做出的Inkling性能更弱、价格更高?          穆拉蒂拥有顶尖团队、充足资金和英伟达最新的训练系统。埃斯托克指出,自2023年以来,行凶者曾多次参加反政府抗议活动,其作案动机是出于对斯洛伐克政府决策及其改革措施的异议。
斯洛伐克枪击事件,引发欧洲政坛的普遍担忧。她没有理由看不到Inkling与中国模型之间的性能和价格差距。

z |          既然如此,“贵替”很可能就是一个经过计算的选择。         03          “一般般”,就够了          按照Thinking Machines获得的待遇,Inkling原本不该只是一款“够用”的模型。         2025年7月,公司尚未推出任何产品,就完成了20亿美元种子轮融资,估值达到120亿美元,投资方包括安德森·霍洛维茨、英伟达、AMD和简街等。四个月后,Thinking Machines又传出新一轮融资谈判,目标估值高达500亿美元,尽管交易最终没有官宣完成,外界已经将它视为OpenAI和Anthropic的潜在对手。         因此,当Inkling以一款性能不如中国模型、价格还更贵的产品亮相时,难免显得低于预期。         可从商业角度看,穆拉蒂可能从一开始就没打算用它争夺基准评测第一名。欧盟委员会消息人士担心,此次袭击可能会加剧整个政治格局的进一步暴力。(详见南方周末报道《斯洛伐克总理遭枪击,欧洲政治暴力愈演愈烈?》)

2024年5月13日,中共中央政治局委员、外交部部长王毅同韩国外长赵兑烈在北京举行会谈。

|          Thinking Machines公司强调的是开放权重、多模态能力和可定制性,希望企业通过Tinker对它进行微调,把Inkling改造成客服、编程助手、行业智能体等专用模型。穆拉蒂押注的市场,对基准评测第一名没有那么执着。图/视觉中国

2024年5月13日,应中共中央政治局委员、外交部部长王毅邀请,韩国外长赵兑烈对中国进行访问。
王毅和赵兑烈在北京举行会谈,双方均表达了改善中韩关系的愿望。
王毅表示,近段时间,中韩关系面临困难和挑战,这不符合双方共同利益,也不是中方愿意看到的。赵兑烈在长约1400字的开场白中至少7次谈到合作,并表示韩方愿同中方“尽可能避免地缘政治因素制约,共同开启韩中合作新局面”。企业更在意模型能否私有部署、能否掌握数据、能否按照自己的业务继续训练。

|

韩联社报道称,赵兑烈表示,双方就两国关系、朝鲜问题等坦诚深入交换了意见。对于趋冷的韩中关系,他表示,现政府认为上届政府对两国关系定位有不准确之处并尝试纠正,因此当前对华关系仍处于调节、变化调整的阶段。         此前,这类需求很大一部分被中国开放模型接住了。         美国的OpenAI和Anthropic长期坚持闭源,Meta的Llama 4表现不及预期后,也逐渐收缩开放路线。与此同时,DeepSeek、Kimi、Qwen和GLM持续开放权重,性能越来越接近美国闭源模型,价格却低得多。         美国企业很快用脚投了票。
这是赵兑烈今年1月就任外长后首次访华,也是韩国外长时隔6年半再次访问北京。

|          根据OpenRouter向CNBC提供的数据,2026年2月以来,中国模型在美国企业经由该平台调用的Token中,每周占比都超过30%,最高一度达到46%。

| 2025年上半年的平均占比还只有4.5%。

| 因此,赵兑烈此访能否为近年明显冷却的中韩关系升温寻找突破口,备受外界关注。         Cursor开发Composer 2时测试了多款基础模型,最终选择Kimi K2.5,理由也很直接——它在评测中表现最强。

《韩国时报》指出,在尹锡悦政府的领导下,首尔与美国紧密结盟导致其与北京疏远。赵兑烈上任时曾强调与北京保持稳定关系的重要性,并指出在经济和其他领域与中国深化合作的潜力。桥水基金则通过Tinker微调阿里的Qwen,得到的定制模型以更低成本超过了部分顶级闭源模型。

|

另据韩国《中央日报》报道,有分析认为,随着最近中国加强同美国等国的外交协商,中韩关系也有可能转换氛围。

|

2024年3月3日,上海北外滩,黄浦江滨江,邮轮停靠在国客中心港口。图/视觉中国
2024年5月15日,国家移民管理局召开新闻发布会,决定即日起在中国沿海省份全面实施外国旅游团乘坐邮轮入境免签政策。         中国开放模型由此成了美国企业降低AI成本的一条捷径。
根据新政策,自5月15日起,乘坐邮轮来华并经由境内旅行社组织接待的外国旅游团(2人及以上),可从天津、大连、上海、连云港、温州、舟山、厦门、青岛、广州、深圳、北海、海口和三亚等13个城市的邮轮口岸免签证整团入境。
为支持邮轮旅游发展,国家移民管理局决定将大连、连云港、温州、舟山、广州、深圳、北海等7个邮轮口岸新增为中国过境免签政策适用口岸,方便符合中国过境免签政策条件的外籍旅客乘坐邮轮过境。只不过,这条路正在承压。
不过,邮轮入境管理仍有限制。         与此同时,美国对中国AI模型的监管氛围正在收紧。政策表明,旅游团入境后停留时间不得超过15天,且需随同一邮轮前往下一港,直至本次邮轮出境,活动范围限定在沿海省(自治区、直辖市)和北京市。相关部门已经围绕数据安全、模型来源和供应链风险发出警告,部分使用中国模型的企业也受到调查。即便尚未形成统一限制,政策上的不确定性已经足以影响企业选择,尤其是涉及政府业务和敏感数据的公司。
国家移民管理局外国人管理司司长毛旭表示,此次新政策将为邮轮经济和邮轮产业发展提供政策支持,打造高质量发展新引擎。

|          这正是Inkling的市场空间。

|          它是一款美国公司开发、采用Apache 2.0许可证、支持私有部署和定制的开放权重模型。美国企业选择它,不必担心使用中国模型引发的政治争议,也更容易通过政府客户和大型公司的合规审查。同时,这一政策有利于吸引更多外国人来华观光旅游,为中外人员交流交往提供更为丰富、更加便利的渠道和方式。         Inkling真正的价值,来自这种合规确定性。

。         穆拉蒂显然看到了这个正在形成的空缺。          作者声明:该图片由AI生成          Thinking Machines吸收DeepSeek和Kimi的公开成果,再把它们转化成一款由美国公司提供的模型。Inkling不需要在所有基准评测中击败中国模型,只需要成为那些不敢继续使用中国模型的美国企业可以接受的选择。         这也解释了它为什么敢于更贵。政策替Inkling缩小了竞争范围,性能和价格上的差距便没那么致命。对于一些美国企业来说,一款稍弱、稍贵但风险较低的模型,已经足够。

|          从这个角度看,Inkling更能证明穆拉蒂懂得做生意。

|          不过,这套生意成立的代价,可能由美国企业承担。         美国之外的公司仍然可以自由选择GLM、Kimi和DeepSeek,在更强、更便宜的基础模型上开发产品;美国企业却可能被迫采用性能稍弱、价格更高的本土替代品。基础模型的能力差距会继续传递到微调后的产品中,最终形成结构性的竞争劣势。         华盛顿原本希望用限制保护美国AI公司,结果可能先替Inkling这样的“贵替”创造了市场。对穆拉蒂来说,“一般般”已经够了。

| 对美国AI产业来说,这份“够用”则意味着成本的升高和竞争力的下降。

|

Current article:http://v8pf.liangkuataosanxuanmiancen.sbs/list_y84bv/ul9s13.html

Published on:21:31:39