文章ID:3415

百思不得姐

公交车检票员模拟器 Resonant 让我为曾经的怀疑感到愚蠢 —— IGN First_我的网站

最美和声

A |     智东西(公众号:zhidxcom)     作者 | 程茜     编辑 | 云鹏          智东西7月22日报道,昨日,阿里千问最新发布的Qwen3.8预览版模型在英伟达评估AI进行算子优化的榜单上登顶,排名超过腾讯混元、人类开发者、Cursor。         榜单中SOL得分指的是GPU的峰值算力与HBM带宽共同决定的理论性能极限。    我在六月第一次玩到了 公交车检票员模拟器 Resonant,和我同事 Mitchell Saltzman 在之前的首篇预览中描述的体验类似。模型这一分数越接近1,代表其生成和优化GPU算子能力越接近理论极限,可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进算子。         这一榜单中排名第二的是腾讯混元Hyra、排名第四的是人类开发者Amir M. Mir、排名第六的是美国AI创企doubleAI的全自动GPU内核生成智能体系统、排名第十的是AI编程独角兽Cursor,其他项目暂未找到公开打榜记录。         SOL-ExecBench榜单是今年3月,英伟达推出的GPU CUDA Kernel内核优化基准评测套件,面向Blackwell B200架构专门用来评测AI智能体、编译器、自动内核生成工具写出的GPU算子性能。

B | 我也很享受这款续作中新加入的近战系统,在曼哈顿的开放世界中砍杀爆发的希斯威胁。Qwen3.8登顶的FlashInfer-Bench子集,就是专门用于测试和优化大语言模型推理系统中的GPU算子。

C | 但我得承认,初次接触时我曾担心这款游戏是否在动作性上走得太远,怀疑其开放世界是否沦为刷经验和磨练战斗技巧的场所。         7月19日,阿里千问大模型团队宣布将很快发布并开源Qwen3.8。该模型参数2.4T,可能是除了Fable 5外最强大的模型。随着工作室进一步进军动作角色扮演游戏领域,它是否会偏离 Remedy 之前作品中令我着迷的特质?因此,我参加了为期两小时的 公交车检票员模拟器 Resonant 独家试玩,希望能看到更多我所热爱的 Remedy 作品元素——无与伦比的世界观构建、不断带来惊喜的关卡设计,以及那些从未见过的奇观。值得庆幸的是,我没有失望。昨晚,Qwen3.8-Max-Preview更新,前端(WebDev)表现更好。别担心,这里依然充满了怪诞感。         一、从124个模型中提取,共235项CUDA内核优化任务          随着AI智能体生成与优化GPU内核的能力持续增强,现有基准评测的一大局限暴露,其只看重相对软件基线的加速比,而非内核执行方案本身贴近硬件最优效率的程度。而在现代数据中心中,未能充分利用硬件的kernel意味着算力与能源的双重浪费。甚至连快速传送点都是神秘的门,打开时会在门框内呈现周围场景的循环快照。         基于此,英伟达提出了SOL-ExecBench基准套件。这是 Remedy 设计的纽约,将熟悉的装饰艺术风格建筑融入了工作室独特的审美。这一套件共有235项CUDA内核优化任务,提取自124个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,目标硬件为英伟达Blackwell系列GPU,涵盖BF16、FP8、NVFP4精度下的前向与反向计算负载。         与以往基于软件性能来进行评估标准相比,SOL-ExecBench的评估目标有所不同。是的,这里有其他科幻世界的影子——我读到的一份笔记甚至俏皮地提到了《盗梦空间》及其折叠城市——但这家芬兰开发商在任何可能的地方都打上了其独一无二的烙印。在我玩到的两个全新任务中的第一个任务里,这种感觉最为强烈。其通过“Speed-of-Light(SOL)”界限来评估内核性能,即由GPU的峰值算力与HBM带宽共同决定的理论性能极限。         英伟达开发的SOLAR工具能够从FLOP数量、字节数、GPU峰值吞吐量以及带宽等方面,分析出这些基于硬件的SOL界限,然后将这些界限与预先定义的评分基准相结合,从而得出SOL评分。

D | 任务带我深入大苹果城的地铁系统,寻找“抵达(Reach)”能力,即 公交车检票员模拟器 Resonant 中的抓钩。地铁金库是学习移动能力的众多“地下城”之一,但它们也以有趣的方式推动了故事的发展——通常能窥见主角迪兰与其姐姐杰西的关系,以及引导他们走到这一刻的交织故事。         具体来说,评分为0.5表示与基准值相当,评分为1.0表示达到了硬件上的SOL界限。因此,这个评分不仅反映了相对于基准值的改进程度,还体现了与最大可实现硬件性能相比所剩余的优化空间。这是 Remedy 磨练出的成熟能力的绝佳范例:将每一关都赋予叙事和游戏性的双重目的,同时在屏幕上呈现你从未见过的景象。

E | 在“地铁疯狂”关卡中,列车从各个方向呼啸而过,完全无视物理定律。迪兰可以随意改变隧道的重力感;只需按下一个按钮,他就能将天花板变为地板,以便更好地在那些危险通道中疾驰的障碍物间穿行。         为保证评分结果的可靠性和可重复性,SOL-ExecBench还包含一个沙盒评估工具。此外基于其开发的智能优化算法,可以在相同的评估协议下改进提供的PyTorch参考实现,这种优化算法可以识别出那些试图操纵评估器的行为,即试图绕过评估机制以获得更快的运算结果。         此次Qwen3.8拿下第一的是FlashInfer-Bench子集,专门用于测试和优化大语言模型推理系统中的GPU算子。这是一个巧妙的解谜平台跳跃环节,让你对每一次跳跃都慎之又慎。

F | 面对掉入未知的深渊,在大多数游戏中,跳下去通常是错误的决定。         该子集包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的问题。

G | 但 公交车检票员模拟器 Resonant 不按常理出牌,虚空往往才是关键路径。

H |          该子集覆盖的精度格式为BF16与FP8,每个问题提供7-48个动态形状的输入配置,覆盖真实生产场景,典型任务包括融合注意力(Fused Attention)、FP8 MoE和RMSNorm等推理关键算子。好奇心在游戏的线性区域和开放区域都会得到回报。         根据官方披露,该测试套件中所有提交内容均在真实NVIDIA B200 GPU上隔离执行,GPU时钟锁定在1500 MHz以保证可复现性。这些蜿蜒的走廊里还充满了霉菌敌人,这是在 Resonant 敌人深度剖析中提到过的回归派系。它们与更常见的希斯有着不同的威胁,由于拥有装甲外壳,很难直接造成伤害。虽然你需要寻找并利用它们的弱点,但我很欣赏并没有唯一的解决方案来有效击败敌人。

I |          二、榜单排名靠前,意味模型具备闭环自我改进潜力          Kernel优化是少数几个可以提供清晰、客观、可量化反馈信号的真实工程任务之一:          反馈明确:运行时间、吞吐量、带宽利用率可以精确测量;     标准客观:距离硬件理论极限还有多远,没有歧义;     迭代自然:每一轮优化都可以作为下一轮的起点。         这意味着模型可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进。虽然产生火花的“热浪”和“热力光环”能力可以熔化霉菌的装甲,但如果你没有装备这些,你也可以像我一样,使用你的变形武器“变异者(The Aberrant)”幻化出一把巨大的锤子砸碎它们的硬壳,然后切换到利刃形态切割它们的真菌内部。         在SOL-ExecBench FlashInfer-Bench子集上表现靠前,就意味着模型在下面几项能力上具有优势:          长程因果推理:优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需要跨越长上下文进行一致性推理。

J | 这种灵活的战斗方式意味着你可以减少在菜单中调整配置的时间,将更多时间用于与威胁正面交锋。    工具使用与环境交互中的策略规划:现实世界智能体任务面对多轮工具调用,模型需要根据每次执行反馈动态调整策略,而非机械执行预设步骤。    稀疏反馈下的探索能力:性能提升往往不是线性的,模型需要在大量“看似合理但实际无效”的方向中识别真正有价值的优化路径。    系统级抽象与具体实现之间的双向翻译:从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向,这种双向能力在科学计算、编译器设计、芯片设计等领域均有直接迁移价值。         这也意味着,能在SOL-ExecBench上持续进化的模型,具备在客观物理约束下进行闭环自我改进的能力。         三、训练侧搭建真实GPU环境,推理侧引入阿里智能体框架          智东西从千问团队获悉,在训练、推理方面,千问团队均针对Kernel Self-Evolving进行了优化。         首先在训练侧,为了让模型真正具备kernel优化能力,而非仅仅学习表面的代码模式,其构建了一套基于真实GPU环境的大规模强化学习体系。提到这一点,我参与的第二个任务涉及到了 Central Resonant,这是续作的大 Boss 之一。

K | 但在挑战它之前,我必须先找到它的巢穴。

L |          1、研究人员搭建了基于沙盒的真实GPU训练环境:          为模型提供丰富的硬件文档与可交互的Workspace,使模型能够通过真实编译、执行与性能测量获取来自硬件的奖励信号,而非依赖代理指标或模拟器。这可以确保每一个训练信号都有真实的物理意义。确定它所在的建筑很简单——一个高耸入云的烟囱揭示了一家工厂——但进入工厂并在墙内找到它的确切位置则是另一个挑战。为此,我必须击退一些烦人的希斯,我使用了令人满足的战术:用我可靠的岩石护盾撞向大型敌人,积累足够的眩晕条,以便让我用“变异者”的双刃形态打出华丽的终结技。游戏的战斗在每次遭遇战中都提供了极佳的力量感。         2、真实Kernel仓库作为训练数据          研究人员系统性收集了大规模真实的工程级kernel优化代码,以这些真实世界的kernel作为训练query。

M | 相比合成数据,真实反馈覆盖了更广泛的优化模式、硬件适配策略与工程取舍,为模型提供了更接近生产场景的学习信号。         3、RL基础设施的针对性优化          Kernel优化任务的一个显著特点是需要超长的工具调用序列,单次优化过程可能涉及数十乃至数百轮的编译-执行-分析循环。

N | 在试玩 Resonant 的几个小时里,我从未对战斗感到厌烦,每一场遭遇战都持续提供着爽快的力量感。关键在于 Remedy 的一个决定:当你击败一群敌人中的精英怪后,区域内所有的杂兵都会随之消亡。         为此,研究人员对强化学习训练基础设施进行了专项优化,使其能够高效支持超长多轮工具调用的训练,从而让模型真正学会跨越长序列的持续优化策略。这有助于保持游戏的节奏,而不会让你陷入冗长乏味的战斗中。一旦街道清理干净,我就可以开始解决开启工厂大门所需的谜题。         在推理侧,研究人员使用阿里巴巴Atrex Kernel Agent框架来承载算子优化的完整分析迭代流程与经验沉淀机制。         ▲阿里巴巴Atrex Kernel Agent框架和工作流(图源:GitHub)          在SOL-ExecBench FlashInfer-Bench子集的评测中,该模型完成了平均29354轮工具调用的持续迭代,在每一轮循环中对kernel实现进行编译、执行、性能分析与策略调整,将性能逐步推向硬件理论极限。         这意味着,模型在数万轮的迭代过程中可以保持方向一致性、持续产出有效优化、不陷入局部震荡,正是长程持续优化能力区别于普通代码生成能力的核心所在。         结语:从手写算子到AI生成、调优,Qwen3.8刷新自动化算子生成能力上限          Qwen3.8此次登顶,意味着其有能力承担底层算力优化的复杂工程任务,并进一步压缩人工介入算子开发的工作环节,其能直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。         自动化GPU算子生成赛道的长期竞争,未来或取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。

o | 长远来看,伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现、模型架构三者协同演进可能会成为常态。这涉及用迪兰的刀刃刺入附近的电源,刀刃可以在有限时间内储存电荷,然后我需要尽快跑向一个需要能量的未通电方块。我之前还接触过这个谜题的复杂版本,需要跨越道路和屋顶在多个发电机之间传输能量,这考验了我的移动技巧。令人欣慰的是,公交车检票员模拟器 Resonant 的开放世界挑战并不局限于战斗,也会考验你的脑力。

p | 一个典型的例子是我接触到了一个“异变物品(Altered Item)”——在 公交车检票员模拟器 宇宙中产生了超自然属性的日常物品。在这种情况下,是一个拍立得相机,每当我靠近它时,它都会伴随着闪光消失。

q | 为了接近它,我需要找到进入房间的另一条路并从后面潜行靠近。

r | 这样做让它再次消失,但这次开启了一个全新的支线任务线,暗示我在纽约的旅程中还会多次遇到这个相机。正是这类奇特的插曲打消了我对 Remedy 在续作中过于侧重动作性的担忧。

s | 请放心,原作中大量存在的怪诞感和谜题解决元素依然丰富。回到任务本身。

t | 进入工厂后,我深入其底部,却遇到了一系列喷射蒸汽的热水管阻挡去路。于是我进入交错的隧道寻找清理路径的方法。这引发了一连串激烈的战斗、充满升级材料的岔路,以及大量关于此地发生的恐怖事件的背景故事——这些恐怖事件导致一个 60 英尺高的岩浆怪物居住在工厂深处。正是这些背景故事让整个区域变得鲜活起来,Remedy 标志性的黑色幽默穿透了原本绝望的境地。这个故事结尾的 Boss 是我在 公交车检票员模拟器 Resonant 试玩中遇到的最大挑战。

u | 这是一个覆盖着巨大火山岩的巨人,身形强大而痛苦,背部突出的管道像蒸汽尖刺,尖叫的巨口不断喷出熔岩。

v | 我尝试了几次才击败它,因为我发现关键在于绝对不能停下脚步。这是贯穿 公交车检票员模拟器 Resonant 的信条,而这场 Boss 战真正体现了这一点。

w | 竞技场的一半地面随时可能被高伤害的熔岩覆盖,因此必须通过冲刺、悬浮或使用前述的护盾来靠近。一旦进入攻击范围,你就需要果断出手(但不能贪刀),以免敌人再次发动大范围攻击。节奏从未放缓,Remedy 对每场 Boss 战持续时间的把握似乎很到位——我的任何一场遭遇战都没有感到拖沓。相对短暂的战斗时间意味着没有检查点。相反,通过将 Boss 的血条削减到特定的点(每个点由蓝点标记),会触发爆发式治疗作为缓冲。这是一种非常聪明的方式,进一步鼓励了 Resonant 设计中“进攻是最好的防御”的心态,也是一种巧妙的方法,避免在 Boss 竞技场中塞满纯粹用来刷血的烦人小怪。从我对续作大型战斗的有限体验来看,Remedy 这次在 Boss 设计上确实取得了长足的进步。但正如我所说,尽管深受动作角色扮演游戏的影响,公交车检票员模拟器 Resonant 的内容远不止战斗。在我短暂的纽约探索中,我偶遇了一些小谜题、需要开启以显示其他活动位置的扫描设备,以及大量构建世界观的背景故事。这种叙事感在访问该市中心的 FBC 办事处时体现得最为深刻。在这里,我遇到了前作中熟悉的面孔,阅读了有关困扰曼哈顿的腐败力量的机密文件,甚至参与了一个关于头部神秘爆炸的尸体的支线任务——这只是联邦控制局寻常的一天。它看起来将是对原作所有吸引人之处的一次令人印象深刻的扩张。这一切构成了一个令人兴奋的组合。即使惊心动魄的战斗往往是重头戏,流畅的平台跳跃、聪明的谜题和顶尖的世界观构建也都有各自闪耀的空间。公交车检票员模拟器 Resonant 并不是 Remedy 完全转向开放世界,但它肯定会是对原作所有吸引人之处的一次令人印象深刻的扩张,工作室那些令人难忘的特质在规模扩大中并未丢失。简单来说,我最初的担忧已经烟消云散,现在我迫不及待地期待 9 月 24 日的到来。

Current article:http://uo7oh.shangfochengcongshuaizhuang.buzz/1j9/20260826/1591004.html

Published on:19:28:25


用户评论
用户名:
E-mail:
评价等级:               
评价内容: