Skip to content
Archive

Post

Back to deliverables

O open_weights_ai
Open Weights AI
@open_weights_ai

中国开放权重已越过不可逆转的临界点 过去24小时里,中国AI已从一连串令人瞩目的模型发布,转变为一层可实际部署的计算基础设施,能够扩散到海外云平台、企业软件和消费级个人电脑中。阿里巴巴宣布推出拥有2.4万亿参数的Qwen旗舰模型,并计划开放权重;DeepSeek则以极低的API价格上线了智能体功能;中国本土开发者还报告称,模型在游戏显卡上的推理性能取得了显著提升。这与你息息相关,因为如今的竞争优势不仅来自模型质量,也同样取决于分发的速度和覆盖范围。 每一项具体说法仍需仔细审视。阿里巴巴的基准测试对比主要来自阿里巴巴自身,而多项本土性能测试结果缺少可复现的配置或独立验证。但这些进展所共同指向的趋势更难忽视:中国实验室正在发布能力强大的模型权重,社区会在几天内完成压缩和优化,而西方基础设施公司则将这些模型封装成面向企业的产品。一旦这条链路运转起来,任何开发者、监管机构或云服务提供商都无法彻底撤回一次发布。 旗舰模型实现跨越 阿里巴巴的Qwen3.8-Max将中国开放权重模型推向了一个此前通常只属于严格受控前沿系统的规模。彭博社报道称,这是阿里巴巴迄今规模最大、能力最强的模型,总参数量达到2.4万亿;阿里巴巴声称,其性能可与Anthropic和OpenAI的领先系统竞争。 — @BloombergJapan 该模型采用混合专家架构,每生成一个token时仅激活约950亿个参数,而非全部2.4万亿参数。它支持多模态输入,上下文窗口最高可达100万token。阿里巴巴列出的API价格为:每百万输入token 2美元,每百万输出token 6美元。凭借这些规格,Qwen3.8-Max足以支持处理大型代码库、冗长法律文档、视频和图像集合,或连续数天智能体活动的应用。 阿里巴巴表示,Qwen3.8-Max在多项测试中超过了月之暗面近期发布的Kimi K3,并在其他测试中可与ChatGPT和Claude匹敌。在独立评测机构复现这些结果之前,我们应将这些对比视为厂商自己的说法。不过,发布时间本身仍传递了一个重要信号:Kimi K3才发布几周,阿里巴巴就已经拿出了规模更大的回应。中国模型之间的竞争,如今正以数周为周期快速迭代。 开放权重的计划改变了这次发布的意义。一则讨论阿里巴巴时间表的帖子称,Qwen3.8-Max的权重预计将在次周上线Hugging Face和ModelScope,同时还会发布开放权重的Qwen3.8-27B。据引用该公告的报道,这将是Qwen首次发布Max级别模型的权重。 — @takamasa045 对普通开发者而言,拥有270亿参数的模型可能更加重要。即使每个token只激活其中一小部分参数,也没有多少机构能够高效托管一个2.4万亿参数的混合专家系统。而经过量化后,27B模型可以融入现有的本地和托管式推理工作流。因此,阿里巴巴能够同时覆盖市场两端:一端是面向大型集群的旗舰模型,另一端则是企业能够自行适配、微调并在自主控制下运行的较小模型。 DeepSeek正以另一种方案从下方施压。其V4-Flash公开测试版新增了编程辅助、工具调用、内置网页搜索,以及对OpenAI Responses API的支持。一则帖子称,其价格为每百万输入token 0.14美元、每百万输出token 0.28美元。 — @beulsatang35 这样的价格大幅降低了试验智能体的成本,尤其是那些需要反复调用模型、搜索网页并消耗较长运行轨迹的智能体。它也会给闭源API提供商带来压力,因为后者的利润率依赖于客户接受高得多的token价格。DeepSeek声称,其智能体性能比此前的V4-Pro预览版更强,但只有测试版的实际使用情况和独立评测,才能告诉我们这些提升在真实工作负载下还能保留多少。 桌面电脑正在迎头赶上 社区优化正在缩短模型权重发布与实际本地部署之间的距离。一名与club-3090社区有关的贡献者报告称,仅修改四行代码,就将DeepSeek-V4-Flash在1万token上下文下的预填充吞吐量从每秒127个token提升至312个token。在4万token上下文下,报告的速度则从每秒91个token提升至283个token。 — @malikwas1f 这意味着第一次测试的速度约为原来的2.5倍,第二次则约为3.1倍。作者称,召回检查已经通过,解码行为在机制上保持不变。不过,补丁、完整配置和硬件细节尚未公开,因此你应将这些数字视为有潜力但仍属初步的结果。即便如此,这件事仍展示了开放权重如何吸引外部工程力量参与。模型开发者可能花费数月优化官方技术栈,而发布后,一名与其无关的用户仍可能找到另一项巨大的性能提升。 另一则社区报告称,经过Q2量化的DeepSeek-V4-Flash 0731版本可以在一张RTX 4090上运行。发帖者报告称,生成速度约为每秒12个token,预填充速度超过每秒650个token,并且在不量化KV缓存的情况下支持25万token上下文。 — @analogalok 据称,另一份社区报告也测得了接近每秒11个token的生成速度,但其提示词处理速度低得多。这一差异说明,硬件、内核、上下文长度和测量方法都会产生重要影响。DeepSeek、Hugging Face和vLLM的资料为官方版本本身提供了更可靠的支持。报告中的智能体基准成绩包括:Terminal Bench 2.1从61.8提升至82.7,DeepSWE从7.3提升至54.4。至于单张GPU上的性能数字,目前仍只是社区说法。 AirLLM等分层流式加载工具进一步延续了这一趋势。它们会在存储设备、系统内存和GPU之间转移模型层,而不是要求所有模型层始终驻留在显存中。用户需要付出生成速度降低、系统内存占用增加和存储读写增多的代价,但也因此能够尝试原本会超出显卡容量的模型。量化、稀疏激活和分层流式加载,正在把硬件限制从绝对障碍转变为可以权衡的工程问题。 视频模型也在沿着语言模型走过的路径发展。一名日本用户在配有48GB系统内存的RTX 5070 Ti电脑上,安装了MiniMax H3经过剪枝的INT8检查点。据其报告,生成5秒视频时,384×576分辨率需要70秒,640×960分辨率则需要188秒。 — @3501Route MiniMax以开放权重形式发布了H3,并允许商业使用。官方资料介绍了支持文本控制、首帧或尾帧控制的不同版本,以及一个由参考素材驱动、最多可接收12个图像、视频和音频文件的版本。据称,H3支持最长15秒的视频片段、最高2K分辨率和原生立体声音频。RTX 5070 Ti测试只是单个用户的结果,但它展示了真正重要的工作流程:一个来自中国的前沿媒体生成模型,可以在发布后几乎立刻变成可定制的桌面工具。 分发走出中国 西方企业基础设施正在让中国开放模型更容易被采用,而且客户无需重构自己的软件。Nebius Token Factory通过兼容OpenAI的接口,推动用户从闭源前沿模型API迁移至60多款开放模型。一则介绍其以色列业务的帖子特别提到了Kimi、Qwen、DeepSeek、英伟达的Nemotron和智谱的GLM。 — @RayT168 Nebius总部位于阿姆斯特丹,并在欧洲、北美和以色列设有研究及基础设施团队。Token Factory加入了大型组织所期待的功能,包括访问控制、团队管理、单点登录、统一计费、面向审计的工作空间,以及模型全生命周期管理。帖子声称该公司与以色列顶尖AI企业合作,但所提供的材料并未列出相关客户名称。相比之下,Nebius自身发布的资料和外部报道对该产品及其模型支持情况提供了更有力的佐证。 对于已经在使用OpenAI风格API的企业而言,这一分发层降低了切换成本。团队可以通过熟悉的端点测试Qwen或DeepSeek,保留大部分应用代码,并将敏感工作负载迁移到托管环境中。如果某个模型的许可证、价格或性能发生变化,平台还可以提供另一个模型。中国实验室得以接触自己并未直接托管的客户,而Nebius则获得相关基础设施支出。 开放权重也模糊了中国与西方AI生态系统之间的现实边界。实验室可能位于杭州、北京或上海,推理服务商则在阿姆斯特丹运营,而客户可能在特拉维夫、伦敦或纽约开发软件。随后,来自多个国家的社区贡献者又会发布量化版本、内核和部署方案。模型的国别来源对于政策和供应链仍然重要,但它已无法准确说明模型在哪里运行,或由谁来改进。 不可逆转的发布 沿着整条链路观察,Anthropic对于强大模型权重发布的警告就变得具体起来。一则帖子称,Anthropic将20多款开放权重模型认定为灾难性风险,并主张这些模型永远不应发布。 — @murtuza_merc 现有证据并不支持这种一概而论的描述。Anthropic反对全面禁止开放权重,主张依据模型能力设定门槛。CEO Dario Amodei提出的论点范围更窄,重点在于不可逆性:一旦模型权重可供下载,原始开发者就无法撤回所有副本、强制推送安全更新,也无法可靠阻止用户移除安全防护。Anthropic讨论的是可能出现的严重风险情景,而不是声称灾难必然发生。 这一更为具体的担忧与当前市场高度吻合。阿里巴巴可以把Qwen权重上传至Hugging Face和ModelScope;用户可以制作镜像、进行量化并修改推理代码;海外云平台可以提供托管端点;本地爱好者可以从系统内存流式加载模型层,或在游戏显卡上运行压缩版本。在这个过程的每一个环节,原始实验室都会失去一部分实际控制力,而模型也会变得更容易获取、运行成本更低。 因此,政策问题已不只是某个下载页面是否仍然在线。监管机构还必须面对镜像站点、衍生检查点、点对点分发,以及分布在多个司法辖区的基础设施服务商。即使各方协调删除,私人副本和经过定制的衍生版本仍会留存。访问控制依然能够影响主流采用,但撤回发布已不再是一种可靠的安全机制。 我们接下来关注什么 我们首先会关注阿里巴巴是否会按计划发布Qwen3.8-Max和Qwen3.8-27B的权重,以及采用何种许可证。仅仅能下载文件,并不能说明企业是否可以商业化部署、修改和再分发这些模型。 我们还会关注独立的Qwen基准测试、可复现的DeepSeek-V4-Flash补丁,以及RTX 4090和RTX 5070 Ti相关说法所对应的完整硬件配置。持续吞吐量、内存占用、功耗和长上下文准确率,比单次峰值数据更重要。 最后,我们会关注企业通过Nebius及类似服务商采用这些模型的情况。真正有决定意义的证据,将来自具名客户、生产环境流量,以及从闭源API迁移出去的实际案例。如果这些数字不断增长,同时本地推理能力持续提升,中国开放权重模型就将完成从单次模型发布向全球共享基础设施的转变。到那时,整个行业将不得不在一个撤回已不再现实的世界里,设法管理这些模型的能力。 来源: x.com/BloombergJapan/status/20… x.com/takamasa045/status/20842… x.com/beulsatang35/status/2084… x.com/malikwas1f/status/208407… x.com/analogalok/status/208427… x.com/3501Route/status/2084169… x.com/RayT168/status/208407865… x.com/murtuza_merc/status/2083…

photo
@

Anthropic broke ranks with Silicon Valley to argue 20+ open-weights AI models pose "catastrophic risk" and should never be released. Meta, Mistral, and half the industry are now building exactly what Dario Amodei calls existentially dangerous. https://www.fathom.news/anthropic-open-weights-irreversible-two-year-fight/

· 1.6K Views

6 Likes
replies reposts likes
1 replies collected
露露体验用网络加速器 @VardiIoanna ·

@open_weights_ai The key is whether the cost of independent reproduction and actual deployment can keep up.

original · zh

@open_weights_ai 关键还是看独立复现和实际部署成本能否跟上。

1