用大模型扮演「25 岁女性消费者」来做市场调研,正在成为一条热门捷径。Mirror Particle 认为这条路走不通,并打算用另一种技术路线替代它。

发生了什么

据 TechCrunch 报道,Mirror Particle 将在 TechCrunch Disrupt 的 Startup Battlefield 200 环节正式亮相。这家公司正在从零构建一个「人类行为世界模型」(world model),目标是对人的行为做出预测,应用方向指向市场研究与品牌策略。

其核心主张是:基于大语言模型的角色扮演(role-play)在模拟真实消费者时不够可靠,无法支撑严肃的商业决策。

为什么重要

过去两年,用 LLM 生成「合成用户」做问卷、焦点小组和概念测试,已经形成一个不小的细分赛道。逻辑很直观:真实调研昂贵、周期长、样本有限,而大模型可以低成本、近乎无限地生成「受访者」。

问题在于,LLM 的本质是预测下一个 token,而不是预测人的下一步行动。当被要求扮演某个角色时,它倾向于给出符合语言习惯、社会期待和提示词暗示的回答,而不是真实人群会做出的、往往矛盾且非理性的选择。换句话说,它擅长「像人一样说话」,不擅长「像人一样行动」。

「世界模型」这个提法值得注意。它通常指系统在内部建立起对环境或系统的可推演表征,从而能够预测干预后的结果——这一概念此前更多出现在机器人与具身智能领域。把它迁移到人类行为上,意味着 Mirror Particle 试图建模的是行为因果,而非语言分布。从零构建也说明它不打算在现有 LLM 上做提示工程式的包装。

影响与看点

对市场研究和品牌策略行业而言,这直接触及一个正在形成的分歧:合成受访者究竟是效率工具,还是会产生系统性偏差的伪数据。如果行为预测的准确性无法被验证,那么「用 AI 做调研」节省的成本,可能以决策失误的形式加倍偿还。

对开发者来说,值得关注的是技术路径。从零构建世界模型意味着更高的数据门槛和更长的冷启动周期,但一旦成立,它可能比提示词工程更难被复制——这既是护城河,也是风险。

需要保持克制的是:目前公开信息只有定位与主张,没有披露模型规模、训练数据来源、验证方式或与真实调研的对照结果。行为预测的准确性如何度量,本身就是这个方向最难回答的问题。在见到可复现的评测之前,把「世界模型」当作一个值得跟踪的技术主张,而非已被验证的结论,是更稳妥的态度。

真正值得盯住的看点只有一个:它能否拿出与真实人类行为对照的、可复现的验证结果。这决定了它是下一代调研基础设施,还是又一个包装精美的叙事。