被字节开除的实习生,融资2亿:挑战李飞飞 - 胜负彩开奖公告
- 赛事, 生活
- 03条评论
精选胜负彩期次查询内容,胜负彩开奖结果与你一同发现更多精彩。
公司尚未命名,产品也未成型,团队仅10人,却已获得近3000万美元(约合人民币2亿元)融资,投后估值达2亿美元。
根据最新报道,这笔资金投给了田柯宇创办的世界模型公司,投资方包括五源资本、IDG资本等。
田柯宇最引人注目的身份,是“被字节跳动辞退并索赔的实习生”。
一个被大厂开除的实习生,如何在两年后以2亿美元估值重返市场?他计划打造的“世界模型”,又为何能吸引资本如此急切地投入?
一篇论文,大幅降低行业成本
田柯宇本科毕业于北京航空航天大学软件学院,后进入北京大学攻读研究生,师从王立威,研究方向为深度学习优化与生成模型。自2021年起,他在字节跳动商业化技术部门实习,从事超参数优化、强化学习和视觉生成工作。
2024年6至7月,因对团队内部算力资源分配不满,他手动关闭了另一名实习生的程序,以便将显卡用于自己认可的研究。字节跳动方面称,他通过编写、篡改代码,恶意攻击团队研究项目的模型训练任务,造成资源损耗。
事发后,田柯宇一度否认,声称动手的是其他实习生,甚至报警称自己被造谣。字节跳动认为他毫无悔意,于2024年11月正式提起诉讼,索赔800万元。
后来,他承认行为不当。法院最终认定他违反实习合同,判赔50万元,并没收全部实习工资。
戏剧性转折发生在起诉后第十天。2024年12月,NeurIPS将年度最佳论文授予田柯宇作为第一作者的成果——《视觉自回归建模:通过下一尺度预测生成可扩展图像》(VAR),该论文在当届排名第六。这是中国大陆背景的学者作为第一作者,极为罕见地获得该奖项。
这篇论文的分量,直接决定了他如今的工作方向。
在VAR之前,AI图像生成主要依赖扩散模型——先勾勒模糊全局,再逐层细化,画面质量高但速度慢、成本高、算力消耗大,架构也与大语言模型不兼容。田柯宇及其团队改变了方法:不再将图像拉平为一维逐个像素预测,而是保留二维结构,从1×1的模糊轮廓开始,依次为2×2、4×4、8×8……由粗到细逐级预测,类似人类绘画过程。
结果是,这种GPT式自回归模型首次在图像生成上超越扩散模型:在ImageNet基准上,衡量失真度的FID从18.65降至1.73,推理速度提升20倍,并首次让视觉生成实现了“模型越大、效果越好”的规模化规律。项目开源后,在GitHub上获得超过4400颗星。
田柯宇最擅长的是用更经济的架构,降低视觉生成的成本。两年后他创业,仍聚焦于此,只是从图片转向视频,从图像生成转向世界模型。
世界模型处于风口
世界模型,简单来说,是让AI不仅理解单帧画面,还能掌握现实世界的空间、运动和因果关系,预测“下一步会发生什么”。它被视为机器人、自动驾驶、交互式视频的共同底层能力,也是李飞飞、杨立昆等人近年来全力推进的方向。
田柯宇认为,人类语言根本不适合描述视频。一段猫从桌上跳下的几分钟画面,涉及物体位置、运动轨迹、光影和碰撞,用文字描述会丢失绝大部分信息,还浪费算力。
他的方案是为AI创建一套新语言。团队已编制出一本包含约20万个符号的“视觉词典”,这些符号人类无法识别,但AI能用它们表示、压缩和预测视频。“我们首先是在为AI创造一种语言,然后向它输入1亿小时的视频。”田柯宇表示。
采用这种方法,生成1秒视频的成本至少降至原来的十分之一,完整模型计划于2027年发布。
他选择的时间点,正值该赛道最活跃、也最微妙的时期。
9月1日,李飞飞的World Labs发布Atlas,能用图片重建3D场景、指定镜头轨迹,生成最长1分钟、1440p的视频。9月22日,国内PixVerse发布R2,主打长时间记忆,玩家可通过文字、语音、动作实时改变正在生成的世界,剧情即时生成。海外,谷歌DeepMind的Genie 3已能让人实时探索虚拟3D环境。
10月7日,谷歌与Unity联合公布Playground和即将推出的Unity Spark,用户可用自然语言创建、分享小游戏。
当然,最令行业震惊的是,9月28日,AMD突然宣布以约82亿美元全股票收购World Labs。
一家有资金、有团队、刚发布新模型的公司,为何如此迅速选择出售?李飞飞解释称,下一代AI需要模型研究、系统和芯片紧密配合,加入AMD能获得工程和硬件实力。
这对田柯宇来说是一个双重信号。一方面,它为世界模型投资人指明了一条清晰的退出路径,赛道估值被重新点燃;另一方面,连李飞飞都承认,仅靠模型团队已不够,胜负关键正转向算力、成本和工程系统——而这正是田柯宇押注“便宜一个数量级”的原因。他等于用一个10人团队,去赌AMD用82亿美元想买的同一个答案。
五源资本、IDG资本为何愿意投资一家没有产品的十人公司?一个可能的答案是,田柯宇正尝试解决世界模型最昂贵的问题:算力成本。
世界模型开始盈利
目前距离客户最近的领域是三维内容制作。
World Labs的Marble已按月收费:标准版20美元,专业版35美元,最高一档95美元,并提供API和企业合作入口。用户输入文字或照片,即可生成可探索的三维空间,导出场景文件,继续交由设计或游戏工具加工。9月发布的新模型Atlas进一步展示了按指定镜头轨迹生成最长一分钟、1440p视频的能力,但完整模型仍处于早期访问阶段。
世界模型解决了广告公司、影视工作室和游戏开发者最头疼的返工问题。导演觉得镜头太高,希望降低20厘米;美术人员希望将房间内的沙发换个位置。如果每次调整都需要重新生成、重新布置,AI带来的效率就会被抵消。能让同一套场景反复修改、导出、进入原有生产流程,才有机会成为软件预算的一部分。
今年8月,World Labs披露,制作公司Promise为Paramount+和CBS的节目《Harlan Coben’s Final Twist》重建了十个历史犯罪现场。部分地点已消失,团队只拥有旧照片或历史影像。
Promise先修复图片,再用Marble生成三维环境,交由美术人员补齐缺失部分、修正细节,最后将场景放到LED摄影棚中拍摄。
创意平台Magnific则将Marble接入3D Scenes工具。营销人员可将参考图片变为三维环境,在其中摆放产品、调整镜头并取景。一组广告需要多个角度时,可围绕同一场景继续拍摄,不必每次重新描述、重新生成。
对投资人而言,更大的故事在工厂、物流和自动驾驶领域。机器人如果能在电脑中完成大量训练和测试,就能减少昂贵的真实设备试错。这一需求并非空想。
今年3月,ABB机器人宣布将英伟达Omniverse能力接入RobotStudio工业软件,富士康正在试点相关技术,用于消费电子精密装配。ABB给出的目标是部署成本最多降低40%、产品上市时间缩短50%。
自动驾驶汽车需要测试雨雪天气、道路施工和突然出现的障碍。靠真实车辆去路上碰,既慢,也难以反复遇到同一种情况。机器人要进入不同家庭、仓库和商店,同样需要大量环境检验能力。
世界模型提供的机会是批量生成这些环境,让企业将更多测试放入电脑。
2月6日,Waymo发布基于Google DeepMind Genie 3的世界模型。公司当时披露,其车辆已完成近2亿英里的全无人驾驶,而虚拟环境中的驾驶里程达到数十亿英里。
内容、机器人、自动驾驶三条路径都有机会,但风险截然不同。通用模型需要持续烧钱扩大领先,应用公司必须做销售和交付,被收购则取决于少数战略买家的意愿。
本文不构成任何投资建议。
本文来自微信公众号“铅笔道”,作者:铅笔道,36氪经授权发布。
胜负彩开奖结果深耕每期开奖结果按固定期次编号整理,支持按日期或场次名称回溯查询。领域,用心服务每一位用户。
在对阵结果与对应赛事背景说明并列展示,方便核对不同期次间的同名场次。方面,胜负彩开奖结果提供贴心周到的支持。
05条评论
胜负彩开奖结果专注针对易混淆的赛事名称提供附加标识,降低跨期次误读概率。,为用户提供专业可靠的体验。
艾米莉·布朗特
2017年12月4日下午3:12
围绕数据更新与官方发布同步,结果公布后即时整理上线。,胜负彩开奖结果持续打磨更优质的服务。
艾米莉·布朗特
2017年12月4日下午3:12

精选历史资料与当前查询页面互联,可一键从结果页跳转至原定玩法说明。内容,胜负彩开奖结果与你一同发现更多精彩。
艾米莉·布朗特
2017年12月4日下午3:12