当前位置:主页 > 国内 >

靳东疑暗讽金星

GPT-5.6-Sol在网络攻防能力上,超越了Mythos!开源模型也排好了_我的网站

孤独的美食家

一 |     

全红婵在比赛中北京时间6月28日凌晨,布达佩斯游泳世锦赛的女子10米跳台决赛在紧张刺激又充满悬念的角逐中落幕。最具人气的东京奥运会冠军全红婵,以0.3分最微弱的劣势输给队友陈芋汐,两人在奥运会时的名次颠倒。

二 |     新智元报道                    GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5!                    英国 AI 安全研究所(AISI)7 月 17 日发布了一份评估报告,第一次公开量化了开源 AI 模型与闭源前沿模型在网络攻击能力上的差距:4 到 7 个月。                   https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber                    去年同类内部测试中,这个差距是 6 到 10 个月。连同预赛、半决赛以及出征匈牙利前的两次队内测试赛,在去年奥运会、全运会上看起来还和全红婵有明显差距的陈芋汐,接连5次赢下二人对决,这绝非偶然。                   防御窗口在收缩,而攻击前沿在加速。青春期是女子跳水运动员的发展敏感期 除了陈芋汐比赛经验丰富、性格沉稳、愈发成熟、发挥稳定等原因,全红婵的翻腾能力特别是向后翻腾能力的略略减退,是原因之一。在跳水比赛特别是女子跳台比赛中,运动员的发育对动作带来的影响比较显著。                   今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的评估中制造了自 2023 年开始测试以来最大的一次网络攻击能力飞跃,多国政府随即发出警告。只有非常自律地和正确科学地对待这个问题,才能让跳水女运动员运动巅峰期保持得更长久一些。

先从科学的角度谈谈这个问题。跳水是一个技巧性项目,对于运动员身体成分的要求很高,女子跳水特别是跳台运动员的体重控制,一直是教练和运动员自己最关注的问题。体重是身体成分的总重量,包括体脂(脂肪体重)和去脂体重(瘦体重)两部分。

三 | 瘦体重与体力、有氧能力和最大吸氧量等成正相关,所以运动员要尽量减去脂肪,保持瘦体重。                   开源模型还没有复现这次跳跃,但它们追赶的脚步比去年更快了。可是女孩子在青春期发育时,脂肪会增加,如果不控制,成绩不仅很难提升,连稳定都很难。

四 | 由于相较于其他运动,跳水运动时间非常短,所以更强调的是速度、力量和协调能力的配合,尤其是下肢弹跳能力和腰腹能力。青春期是运动素质发展的敏感时期,男女有别,13岁之后区别更为明显。                             4 到 7 个月:怎么测的,差在哪                    AISI 用两套体系评估模型的网络攻击能力。                   第一套是 70 项窄任务,覆盖漏洞研究、逆向工程、Web 渗透、密码学四个方向,按难度分四级,从「有技术背景的非专业人士」到「十年以上经验的专家」。由于遗传、营养和运动训练等等因素,会影响青春期的进程,运动系统如肌肉、骨骼的发育,对于体能素质尤其是力量素质影响非常大。还有身高增长带来的困惑,试想一下,让全红婵和一名女篮运动员从跳台上向下翻腾,谁的翻腾周数会多一些,翻腾半径会小一些,体态会轻盈些?答案显而易见。                             第二套是 Cyber Range,在模拟企业网络中测试模型自主执行多步骤攻击链的能力。

五 | 所以身高的增长,对翻腾、转身、空中姿态、入水等必不可少的评分因素都会有着负面的影响,中国女子跳台选手都是成名较早,很多都是十三四岁左右,接下来她们就会不可避免地遇到发育和成长问题。全红婵身高明显增长5到8厘米 比起东京奥运会和陕西全运会时,全红婵的身高明显增长,虽没有确切数据,但根据前线几家国内媒体记者报道预测,增长5到8厘米是有的。其中一个名为「The Last Ones」的测试场景包含 32 个攻击步骤、4 个子网、约 20 台主机,AISI 估算人类专家完成全部步骤需要约 20 小时。                             两套体系给出了一致的结论:                    GLM-5.2(2026 年 6 月发布)在窄任务上的表现与 Opus 4.6(2 月发布)相当,差距 4 个月;                    在 Cyber Range 上追平 Opus 4.5(去年 11 月发布),差距 7 个月。

六 |                    DeepSeek V4-Pro 在窄任务上对标 Opus 4.5,差距 5 个月。

七 |                    两个差距都比 2025 年内部评估中测到的 6 到 10 个月更窄。                   成本差距比能力差距更大。                   同一场 Cyber Range 测试(1 亿 Token 额度),用 Opus 4.5 或 4.6 跑一次约 85 美元,用 GLM-5.2 约 46 美元,用 DeepSeek V4-Pro 只要 1.19 美元。

八 |                    在两个模型都能 100% 完成的窄任务上,Opus 4.6 每个任务花 15.17 美元,GLM-5.2 花 6.12 美元;                    Opus 4.5 花 12.50 美元,DeepSeek V4-Pro 花 0.28 美元。为何在世锦赛上全红婵可以和陈芋汐配双人了?除了技术因素两人遥遥领先之外,个头日趋一致和般配,在同步方面显得更合拍也是原因。

九 | 在去年,全红婵明显比陈芋汐、张家齐要看起来小一块。                   同等攻击能力,开源便宜一到两个数量级。                   闭源模型的安全护栏也没能拉开差距。                   AISI 测试中,DeepSeek V4-Pro 偶尔拒绝逆向工程类任务,但靠少量重试也能绕过。                   Anthropic 的 Fable 5 是一个更极端的案例:6 月 9 日发布,三天后安全研究者 Pliny the Liberator 用多步骤越狱策略突破了安全分类器,相关截图显示模型产出了本该被拦截的漏洞利用代码。身高增长是客观存在的现实,无法去刻意压制,训练量也是科学分配的,一味加大加强训练量来抑制身体发育是不可取的。                   Amazon 研究员随后独立报告了另一种绕过方法。                   这直接触发了美国商务部首个针对 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分类器才恢复上线。那么合理控制饮食,特别是高能量零食的摄入是必然的。这方面全红婵做得很好,因为她有一个这方面经验丰富的教练——陈若琳。女子跳台选手可以说是所有跳水项目中更迭最快的,“跳板女皇”郭晶晶可以在两个奥运周期称霸,吴敏霞可以坚持三届奥运会都有奖牌、金牌入账,但是女子跳台选手坚持两三个奥运周期,特别是还能实现在奥运会上卫冕的真是凤毛麟角。陈若琳可以把成功经验传授给小师妹 只有陈若琳做到了,她从2008年的北京一直跳到2016年的里约,拿下5枚奥运金牌。                   闭源并不自动等于安全。                             防御窗口收窄     防御工具也在加速                    AISI 在报告中明确了政策信号:防御方的准备时间比去年更短。陈若琳保持体型的秘诀在于严格控制饮食,当初“坚持一年不吃晚饭”的故事广为流传,确实是存在的。

十 |                    英国国家网络安全中心已经呼吁各机构加固网络安全基线,并利用 AI 增强防御能力。训练量大,还能如此控制自己的饮食,并且用科学的方法补充能量,克服零食对女孩子的诱惑,陈若琳在自己指导教练任少芬的监督下,在自己的严格自律下还真就做到了。                   同一代 AI 工具确实也在加速防御端的工作。                   游戏网络编程领域的资深开发者 Glenn Fiedler,是在游戏网络编程领域写了二十年教科书级文章的大佬,最近用 Claude Code 对自己维护的四个开源网络库(yojimbo、netcode、reliable、serialize,合计约 6000 个 GitHub Star,在游戏领域已属相当有影响力的老牌开源大库)做了系统性安全审计:部署 libFuzzer 目标、上线 AddressSanitizer 和 MemorySanitizer CI、执行数百万次迭代的压力测试、逐行代码审查。                   Glenn Fiedler                    两周内修复了 43 个安全漏洞,其中 27 个可从网络远程触达。现在,陈若琳会把自己的经验传授给全红婵。陈芋汐在这方面做得就比较好,从16岁到17岁的重要关口,体型基本没有变化。

十一 | 张家齐18岁了,动作显然不如她刚成名的时候,所以只能在全红婵、陈芋汐之外出战世锦赛的非奥项目。这就是发育带来的客观结果。

十二 |                              最严重的是 yojimbo 中一个自 2019 年就存在的远程堆溢出——恶意客户端可以通过构造特定数据包触发它。                             整个审计的 Token 成本约 2500 美元。                             攻防两端都在被 AI 加速,但加速方式不对称。                   攻击能力的扩散是不可逆的:开源模型权重一旦释出,就无法收回,安全护栏可以被移除,副本可以在私有服务器上不受监控地运行。

十三 |                    而防御工具的部署需要每个团队主动投入时间和成本。张家齐是生不逢时的代表,这个北京小姑娘出生在2004年,里约奥运会时太小,2017年世锦赛时她一统国内女子跳台,但因为国际泳联的规定,13岁的她无法参加世锦赛。                   AISI 报告中有一句话点明了这个结构:「一旦开源释出,这些选项永久丧失。

十四 | 」                    这组数据对 AGI 格局的影响比数字本身更深远。                   开源与闭源的能力差距收窄到半年以内,「用闭源独占期充当安全缓冲」的默认策略快要失效了。                   闭源模型的护栏在 Fable 5 事件中被证明同样脆弱。

十五 | 那一年,她连夺全运会单双人女子跳台金牌,2018年世界杯冠军得主。                   下一阶段对于全球的决策者而言,政策博弈的核心问题已经变得更尖锐:什么能力级别以上的模型不应开放权重。张家齐的教练也是任少芬,在夺得世界杯冠军时她就冷静地对北青报记者分析过,担心小家齐的发育问题,并明确指出,她到时能参加奥运会就是好的。                   AISI 宣布将继续评估 Kimi K3 等下一批开源模型——上面这条线画在哪里,很可能取决于接下来几个月的测试结果。果然,任少芬指导的话都应验了。                   参考资料:          https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber          https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md          https://www.patreon.com/MasBandwidth/posts/important-news-164199395          编辑:马可。2019年的光州世锦赛,14岁的陈芋汐替代张家齐的主力位置。要不是奥运会延期,张家齐会在单人女子跳台上参赛,和陈芋汐争一争冠军。

十六 | 结果晚一年,天赋异禀的全红婵横空出世,张家齐只能参加双人赛。一茬一茬的好苗子在女台领域涌现,中国跳水人才辈出是一方面原因,发育给运动员带来的不利影响也是重要因素。小巧、轻盈,永远是女台选手得天独厚的优势,中国跳水队在选材方面非常注重。所以说在发育期刻苦勤奋训练的同时,对身体成长、饮食方面的控制同样重要。以中国跳水特别是女子跳台跳水的发展来看,大家喜爱全红婵和陈芋汐是必然的,但要说距离巴黎奥运会还有两年,这中间如果再杀出一位天才小姑娘,取而代之她们其中一位,绝不是意外。中国跳水队首先要保证以派出水平最高的选手去参加世界大赛为基准。全红婵和陈芋汐要想“永葆青春”,就必须要有艰苦的付出,做到常人难以做到的自律才行。

Current article:http://30imu.zhouangnaoguangsundianzhenmou.cfd/p47c5vb/o7dcw2.html

Published on:03:00:14


相关新闻

最后更新

热门新闻