电商|张一鸣的10万亿参数大模型:还能跑赢时间吗?

核心内容摘要

电商|张一鸣的10万亿参数大模型:还能跑赢时间吗?通勤路上听音频讲解特别合适,语速不赶,吐字也清楚。像相关系数为什么不是因果这种问题,讲解顺序清楚,不太把人劝退。谣言澄清结构清楚:常见说法、现有证据、更稳妥的理解。学习记录能看见看过哪些主题,有种在铺知识地图的感觉。信任是一笔一笔攒起来的,急不来也假不了。有问题就来翻,有收获就收藏,节奏刚刚好。

电商|张一鸣的10万亿参数大模型:还能跑赢时间吗?

"不要用别人的输出,换一时的榜单排名。"张一鸣对台下约2000名Seed研究人员说。他明确反对通过蒸馏竞争对手的模型来追赶,认为字节应该"为长期目标牺牲一部分短期利益",坚持"长期主义和延迟满足"。 他们都知道,这不是一次普通的战略宣导。就在这次会议之前,Seed内部至少发生过三次关于"是否采用蒸馏路线"的激烈讨论——DeepSeek-R1发布后一次,Blackwell芯片部署后一次,Kimi K3发布后又一次。每一次,张一鸣都投了否决票。 那么问题来了:当竞争对手用蒸馏这条"捷径"在榜单上狂奔时,张一鸣的"不蒸馏"宣言,究竟是高瞻远瞩的战略定力,还是追赶无力之下的一块遮羞布? 用市场上先进的大模型训练自己的小模型,成本低、见效快,能在短时间内把能力提上来。DeepSeek、Kimi、阿里Qwen,或多或少都走了这条路。甚至Anthropic已经公开指控多家中国公司蒸馏其Claude模型。 技术上,这套说辞站得住脚。牛津大学和Meta的研究表明,过度依赖合成数据会导致"模型坍缩",尾部信息不可逆丢失。蒸馏还会带来词表依赖和奖励模型错位的问题——你继承的是别人的价值观,而不是自己的商业逻辑。 当Kimi K3以2.8万亿参数横扫榜单、阿里Qwen 3.8 Max以2.4万亿参数紧追不舍时,字节拿得出手的语言模型是什么?Seed 2.1 Pro,在全球LLM排行榜上仅列第21位。CEO梁汝波在年中全员会上不得不公开承认:"大语言模型和海外领先模型的差距有所拉大。" 张一鸣从去年下半年开始,将一半精力倾注在Seed团队,定期参加核心技术复盘会。这种级别的创始人介入,在字节历史上极为罕见。但高度介入的另一面是:当创始人把个人技术洁癖注入公司战略,组织的容错空间还有多大? 据英国《金融时报》报道,字节正在预训练一个参数规模最高可达10万亿的超大模型,体量是Kimi K3的三倍以上,对标Anthropic最先进的Mythos系统。项目由Seed Foundation负责人项亮主导,目前仅处于预训练初期,完整周期预计3至6个月,能否正式发布仍是未知数。 2022年DeepMind的Chinchilla论文已经证明:参数规模翻倍,训练数据量也应同步增加。研究机构Epoch AI估算,全球公开的人类高质量文本大约只有300万亿Token,按照当前消耗速度,可能在2026年至2032年间被"吃干抹净"。字节一边拒绝蒸馏抄答案,一边要训练全球最大的模型之一,这意味着它必须自己准备海量"教材"。为此,字节甚至将数据团队整合升格为一级部门"AI数据与安全"。 但就在这个节骨眼上,原AI数据与安全负责人傅越被传离职。核心数据负责人的出走,给10万亿参数模型的"教材供应"蒙上了一层阴影。 更值得追问的是:字节是不是在重复自己最熟悉的那套打法——大力出奇迹?从今日头条到抖音,字节过去十年的成功公式是海量资源+快速迭代+流量变现。但大模型不是短视频。参数堆到10万亿,如果数据质量、训练框架、优化方案跟不上,可能只会造出一个更昂贵的"笨蛋"。业内已有声音指出,"将参数规模一次推到同行数倍以争取领先位置的举措,像一场赌博"。 2025年,字节全年资本开支超过1500亿元,其中约900亿用于AI算力采购。2026年,这一数字被曝超过2000亿元。豆包App月活3.45亿,日均Token调用量达180万亿,但光鲜的用户数据背后是一张触目惊心的成本账单:单次推理成本中,硬件折旧占58%,电力消耗占29%,每天算力消耗达数千万元。 收入方面,每天2亿多人使用的豆包,日收入不足百万元,主要来自电商佣金。唯一能让账面好看一点的是Seedance——这款视频生成模型的年化收入已达20亿美元(约135亿元人民币),单月超10亿元,刚好能抵消豆包的算力成本。 字节并非一事无成。恰恰相反,它在AI视频生成领域做到了全球顶尖。Seedance 2.0原生支持多模态混合输入,火山引擎MaaS收入的一半以上由其贡献。但是,字节真正能拿得出手的AI成果集中在视频(文娱)内容生成,而B端产业客户真正看重的通用基座能力——长文档理解、逻辑推理、代码生成、复杂任务拆解——恰恰是字节的短板。 这种"偏科"直接反映在了商业战场上。2026年夏天,在上海举办的WAIC(世界人工智能大会)——国内最重要的to B与产业AI公共舞台——字节跳动继续选择放弃独立官方展台,仅以第三方合作微弱露出。而就在同一时期,字节却在ChinaJoy(游戏展)上为抖音直播和朝夕光年设置了超大展台,布展面积超过了腾讯。 一个想做企业AI服务巨头的公司,在to B主舞台上隐身,在to C游戏展上狂欢。这不仅仅是市场策略的选择,更是底层能力缺位的外化——当你的语言模型还不足以支撑B端客户的复杂工作流时,你确实没什么可展示的。 比技术路线更耐人寻味的是人的动荡。2025年6月,豆包大模型大语言模型团队负责人乔木因合规问题被辞退。随后,顾全全离职创业,傅越离职,周畅从阿里"挖角"过来却引发竞业诉讼。更剧烈的是组织层面的"挥刀":成立近十年、数千人规模的飞书"一夜拆分",产品团队并入豆包,GTM团队并入火山引擎。飞书负责人谢欣——2014年字节只有300人时的第一任HR负责人、张一鸣时代的元老——从直接向梁汝波汇报,改为向豆包负责人赵祺汇报。 梁汝波解释这是为了"更好地打造面向办公与生产力场景的优质产品"。但一个无法回避的事实是:当一家公司的AI战略需要靠"拆分元老业务"来推进时,这究竟是资源整合的魄力,还是底层焦虑的应激反应? 现实是,AI大模型的竞争正在呈现"赢家通吃"的特征。用户心智一旦形成,迁移成本极高。当Kimi和DeepSeek用蒸馏快速迭代、占领市场时,字节却在坚持"自研"的清白。这种清高,用户会买单吗? 答案正在浮现。2026年5月,豆包启动付费,推出68/200/500元三档会员。社交平台上很快出现"豆包笨还收费"的质疑。一位用户的吐槽很直白:"既然收费了,免费的肯定会打折扣,完全可以Kimi或智谱换着用,总有还在免费的大厂。" 更微妙的是政治风险和美国监管。利用美国公司拥有的西方模型的输出结果来训练本地模型已成为一个重大的地缘政治热点,避免这种做法可以保护公司免受被列入贸易黑名单或遭受华盛顿制裁的风险。2026年以来,Anthropic连续指控MiniMax、月之暗面、DeepSeek、阿里蒸馏Claude模型,字节恰好不在名单上。有人解读为"提前避险",但另一种解读同样成立:字节之所以没被指控,可能是因为它的语言模型能力还不足以引起Anthropic的警惕。 张一鸣说,要"延迟满足"。但延迟满足的前提是,你知道那个"满足"终将到来。如果10万亿参数模型在预训练中遭遇瓶颈,高质量数据真的在2032年前就被耗尽——那么,延迟满足会不会变成无限期拖延? 8月6日,梁汝波在全员会上说,公司战略要"高度优先,粗主干,优化长期"。他否认"字节因为外部压力才坚持自研",表示是希望团队"延迟满足,打好技术基础"。 但叙事之外,有一组冰冷的数字不容忽视:豆包日均Token消耗180万亿,距离内部目标250-300万亿仍有差距;豆包LLM全球排名第21,语言模型能力"落后半年";2000亿年投入,日收入不足百万;10万亿参数模型还在预训练初期,3-6个月后能否发布仍是未知数。 在AI这场考试中,有人选择抄答案,有人选择自己写。张一鸣选择了后者,这值得尊重。但一个残酷的问题是:当你终于写完自己的答案时,考场还在吗?

📕作者: 冀现科撰 · 更新于 2026-08-15 18:08:44

🥵同居了天天被男朋友妈妈催生孩子苏州一对七旬老夫妻上山采摘野生蘑菇,回家煮汤食用后险些丧命,医生提醒:这种毒素约1克即可致命,台风天生长活跃暗藏致命风险

🍆嗯~啊~快点 死我翔霖从分项来看,能源价格下跌继续成为PPI降温的主要推动力,7月能源价格环比下降3.1%,食品价格环比下降0.9%;剔除食品和能源后,商品价格环比上涨0.1%;服务价格则延续上涨,但涨幅明显放缓。7月最终需求服务价格环比上涨0.2%,低于6月的0.5%。第16分钟,曼联发动快速反击,姆伯莫横传助攻,齐尔克泽轻松推射破门,帮助曼联打破僵局。第29分钟,丹尼尔詹姆斯直塞助攻,阿伦森推射破门,帮助利兹联扳平比分。第38分钟,姆伯莫内切打门,皮球击中横梁。第81分钟,B费低射破门,可惜越位在先进球无效。90分钟结束,双方战成1-1。按照事前约定,双方进入点球大战,德莫特-米扑点。最终,曼联点球大战总比分6-5击败利兹联。

👄直男艾草的日常by浮生若梦苏彬记者:巴萨有没有费兰都需要真正的9号,他去巴黎也只是替补

🌶春雪欲燃小说TXT百度云穆德里克说:“我当然非常高兴,缺席比赛已经有一段时间了,能够回到同一个训练场,对我来说真的是一个非常幸福的时刻,我感觉很好,感觉棒极了,我很感激能重返赛场。”

🔞公交车上被高湖刘炽平明确表示,对于目前的算力采购和预付订单,如果要当下出售,就可以获得一笔可观的利润,侧面印证了即便是腾讯级别的买家下场,整个算力市场依然是标准的卖方市场。

电商|张一鸣的10万亿参数大模型:还能跑赢时间吗?

📸 记者 曹艳君 摄 · 更新于 2026-08-15 18:08:44

相关标签

电商|张一鸣的10万亿参数大模型:还能跑赢时间吗?

电商|张一鸣的10万亿参数大模型:还能跑赢时间吗?: 本文详细介绍了电商|张一鸣的10万亿参数大模型:还能跑赢时间吗?通勤路上听音频讲解特别合适,语速不赶,吐字也清楚。像相关系数为什么不是因果这种问题,讲解顺序清楚,不太把人劝退。谣言澄清结构清楚:常见说法、现有证据、更稳妥的理解。学习记录能看见看过哪些主题,有种在铺知识地图的感觉。信任是一笔一笔攒起来的,急不来也假不了。有问题就来翻,有收获就收藏,节奏刚刚好。

关键词:电商|张一鸣的10万亿参数大模型:还能跑赢时间吗?