军棋(Stratego)长期被视为 AI 的盲区:棋盘上大部分棋子对双方都不可见,胜负取决于在信息缺失下持续做出判断。Ars Technica 报道,这一局面刚刚被打破,而关键并不在于更大的模型,而在于多训练了一个专门「猜子」的神经网络。

发生了什么

据 Ars Technica 报道,此前军棋一直让 AI 束手无策,核心原因是游戏中绝大部分信息是隐藏的——你只能看到对手棋子的位置,却不知道它究竟是炸弹、元帅还是普通士兵。研究者采用的做法是:在原有决策网络之外,额外引入第二个神经网络,专门负责推测隐藏棋子的身份。这一「猜子」网络把不确定性显式地建模出来,再交给决策部分使用,从而让 AI 在信息不完整的情况下也能形成有效策略。报道将这一双网络结构描述为破解军棋的关键。

为什么重要

军棋的难点从来不是算力,而是信息结构。围棋、国际象棋属于「完全信息博弈」,双方看到同一张棋盘,AI 只需要搜索与评估;而军棋、扑克、麻将属于「不完全信息博弈」,决策者必须同时处理两件事:我该怎么走,以及对手的哪些牌是我不知道的。这正是现实世界的常态——谈判、竞价、军事对抗、甚至日常沟通,都发生在信息不完整的前提下。

因此,军棋的突破不只是多赢了一个棋类游戏。它验证了一条思路:与其让单一模型在模糊状态下硬扛,不如把「推断未知」拆成独立模块,让模型先建立对隐藏状态的信念,再基于信念行动。这与博弈论中「信念更新」的经典框架相呼应,也让人联想到扑克 AI 领域的类似路线。

影响与看点

对研究者而言,这一结果提示:不完全信息环境下的性能瓶颈,可能更多来自表征方式而非模型规模。把「世界模型」或「对手建模」显式分离出来,或许比继续堆参数更有效。

对开发者而言,这套思路有直接的迁移价值。任何需要处理缺失数据、部分可观测状态的产品——风控、推荐、供应链预测、对话系统——都面临类似的「猜子」问题:输入不完整,但必须给出决策。把推断与决策解耦,可能是比端到端更稳健的工程选择。

值得关注的点在于:这种双网络结构能否扩展到更复杂的隐藏信息场景,以及它是否会被后续工作统一进单一模型。一个克制的判断是——军棋被攻克,标志着 AI 在不完全信息博弈上又前进了一步,但距离真正处理开放世界的模糊性,仍有相当距离。