即使是5万亿,这一模型的规模也已经超过目前中国已发布的最大模型Kimi K3,接近Anthropic的Fable 5;如果是10万亿,那字节的新模型规模将超越约有8万亿参数的Mythos 5。截至文章发表前,字节跳动未对此发表回应。
▲英国《金融时报》报道
据外媒报道,其中一位知情人士透露,字节的这一模型还处于早期阶段,目前正在进行为期3到6个月的预训练,如果一切顺利,之后会进行微调并发布,具体的模型尺寸将在后期阶段才能确定。另据晚点LatePost报道,字节的新模型将由Seed Foundation负责人项亮主导,与大语言模型预训练数据负责人沈科合作。字节这一“巨无霸”大模型的爆料,引起了不少外网网友的关注。有网友化用了漫威电影《蜘蛛侠》中的经典台词“With great power comes great responsibility.(能力越大责任越大)”,说“能力越大,竞争越大。(AI)走到这一步并不让人意外,如果他们的模型能像Kimi K3那样持续进化,那就会逼着所有人都得加速追赶,否则只能出局。”
还有网友认为:“10万亿参数(的模型)还没正式推出,就已经改写了推理的算账逻辑。”
此前,字节跳动将飞书团队一分为二,产品团队并入豆包,销售线划归火山引擎。对这一拆分决定,晚点LatePost报道,字节跳动创始人张一鸣在与Seed负责人吴永辉共同召开的Seed全员会上解释称,把火山引擎、飞书和豆包的资源整合到一起,是为了构筑在算力和数据上的优势。
在会上,张一鸣认可了编程(Coding)的关键地位。这一点,字节跳动CEO梁汝波在8月6日召开的字节年度全员会“All-Hands”上再次强调,据财新报道,他坦承豆包大模型在AI Coding方面并不算突出,还用Anthropic的Claude Code举例。但张一鸣也提醒称,编程只是眼下的热点之一,要着眼其他领域。同时,张一鸣反对模型蒸馏,蒸馏能在短期内改善模型表现但本质上仍是在复制已有的能力。沿着这条路走,模型能力最多只能不断逼近对方,很难真正实现超越。张一鸣表态,即使不蒸馏意味着字节在技术上会短暂落后国内竞争对手,但也不想走捷径。模型蒸馏(Model distillation)是将一个大型、复杂的AI模型压缩为更小、更快模型的过程,即通过训练小型模型复制大型教师模型的知识和输出。张一鸣还透露,过去几年,字节已经在AI方向投入了很多,未来还会投入更多。结语:国内大模型迎来窗口期字节跳动“双线”进攻