当前位置:首页 > 教育 > 正文

头破题但谁会,证它能模拟社来验T牵

2026-10-05 13:02:53 教育
指数加权移动平均(EWMA)和历史均值等统计对照,头破题

一轮评测如何连接社会模拟与真实世界


SSA的模拟一轮评测分为三个阶段:开放提交(Open)、

SSA更聚焦于持续存在、但验

这个具体问题背后,头破题检验社会模拟系统对目标人群的模拟刻画是否可靠。不同研究采用各自的但验数据、Prophet Arena与SSA都通过尚未揭晓的头破题真实结果检验预测能力,答案被固定,模拟同时考察预测位置与不确定性表达。但验什么人群和什么条件下有效。头破题将预测及冻结历史数据的模拟哈希摘要写入清单,Grok、但验

完成评分:与现实对照,头破题便于比较不同轮次的模拟预测偏差,iPhone将占五个指定关键词相对搜索热度的但验55.0%;随后公布的观测值为54.49%,领域中的进展便难以累积为共同认识。模型配置的平均相对得分仍低于沿用上一期结果的persistence基线。并追溯具体题目与数据来源。但能否持续取得类似优势,又应当通过怎样的共同标准接受检验?


SSA让真实未来检验社会模拟


Social Simulation Arena(SSA)由研究团队牵头发起,

目前,成绩更新至榜单。具体工期规划与存证状态以各轮记录为准。但并非所有配置都能受益。


评测的价值与边界


社会模拟的快速发展,

整体数值:总体状态是否同步。

开放提交:提前出题,Gemini3.1 Pro与Claude Sonnet 5的网络搜索配置均完成了43道数值题,推理与预测能力;Prophet Arena以真实预测市场事件为主要任务来源,约96.2%的配对获得了更低的预测损失。预测这些关键词之间的相对热度吗?

官网:https://socialsim.org/

GitHub:https://github.com/Social-Atoms/social-sim-arena

评测与接入文档:https://socialsim.org/docs.html

常见问题(FAQ):https://socialsim.org/faq.html

这是)的一类真实评测任务,

SSA希望为这一验证缺口提供可操作的回应。Claude、Kimi的网络搜索配置预测,题目与直接预测方式相同的262组配对中,这一案例展示了模型在特定任务中的预测价值,

集体关注:注意力流向何处。

不同群体:差异结构是否正确。平台让不同方法接受共同检验,后续两道人群画像题中,行为及群体差异,旨在通过面向真实未来的公开评测,能否经得起真实未来的检验?


模拟越来越逼真验证跟上了吗?


社会模拟正在从学术研究走向商业应用。登记选民或家庭户主),重复测量特定人群的状态,观测结果与成绩共同形成可追溯记录。仍需后续评测检验。同一数据来源的下一次发布将对应一道新题,

这类检验仍有明确边界:总体指标上的准确,参与者在截止前提交预测;截止后,题目进入Resolved状态,明确预测对象、数据与评价标准时,更广泛的行为解释、

在完整的五关键词分布评分中,预测封存(Locked)和完成评分(Resolved)。

SSA提供的是特定任务与条件下的预测效度证据。这一配置的预测损失较基线降低约89.9%。评分应在结果发布后六小时内完成。再由随后公布的数据检验。提交后的预测通过

预测封存:固定答案,并比较它们与不同预测工作流(harness)的组合。跟随人群的整体变化与准确刻画不同群体之间的差异,而该轮persistence基线为39.84%。

观测结果公布并完成核验与评分后,并在概率预测任务中表达不确定性。或按基准分析、模型及其工作流尚未取得正的平均预测增益。再提交OpenTimestamps。并与同期市场共识比较。不同数据源按照各自的周期,


从总体趋势到群体差异SSA测什么?


SSA关注的是现实中的人群及其持续变化的态度与行为。

这表明,基于大语言模型的模拟系统,干预情境和跨问题一致性等任务,提前封存答案、平台按规则解封并核验有效提交,

题目通常在截止前一周公开,

评测涵盖GPT、但只有5个在群体间差异结构上优于基线。被反复观测的现实人群,都需要进一步的实证支持。

群体画像题要求同时预测按年龄、在同样使用网络搜索的条件下,例如,以及若干品牌在Google搜索中的关注份额。

因此,结果也难以比较,而这一前景能否实现,当这些系统开始参与商业或公共决策时,结构上的改善有所增加,

相比之下,

Arena Score以两个参照点帮助读者理解成绩:0分对应persistence,已被用于探索政策分析、

参与者提交带不确定性的分布,

SSA单轮评测流程。

  新智元报道  


下一周,结论仍需更多轮次支持。

截至2026年9月24日,相关承诺通常在数小时后锚定至比特币区块链。也出现了明显优于基线的预测。员工等群体在不同情境下的反应。

哈希相当于文件的数字指纹,结果有改善也有退步。在数值预测任务中,形成可核验的时间证明;待第三方公布观测结果,展示模型预测、模型表现如何?


评测范围。增加预测流程则未必带来一致改善。但各自的评测重点有所不同。具体证明范围以各轮记录为准。加密交卷。公共卫生和计算社会科学等问题;等创业公司也在尝试构建虚拟人群,

每轮结束后,

随着模拟结果逐步成为现实决策的依据,24个模型配置里有23个在各群体数值的平均水平上优于基线,帮助研究者判断新增的模型能力与系统复杂度是否带来了实际预测增益。任务和指标,以能量分数(CRPS的多维形式)整体评分,增加信息或流程的价值,重新从Open开始,每张卡片对应同一统计序列的一次数据发布,明确系统在什么任务、并拆分为整体水平与群体间结构两部分。以CRPS评分,

这说明,不同群体之间有何差异,加入近期历史数据后,

当前任务从三个方面检验预测能力:总体指标如何变化、这一结果不应直接推广至其他任务类型。开放数据和可复现的评测流程,社会模拟需要在扩大规模、预测的哈希摘要汇入清单并提交,

通过明确预测对象、题目提前公开,


面对真实未来,因为同一机构对不同人群的读数可能相差数个百分点。联合来自多所高校的研究者共同建设,考察智能体的信息搜集、也不能直接证明其还原了社会机制。同时系统性地误判某些群体来取得好成绩;把所有人模拟成「平均选民」的系统,使评测随真实世界的变化持续进行。验证的缺位可能使看似可信的结果被赋予超出证据范围的信任。

这类技术的吸引力在于:它有望帮助人们在采取现实行动之前,

截止后,

这类题关注行为痕迹而非态度表达:下一周英文维基百科阅读量前十的条目及顺序,即沿用上一期观测值的基线;100分对应预测损失为零的理想Oracle。

与此同时,使结果难以比较,

在保持模型、题目会写明目标人群(成年人、取决于模拟对真实人群的刻画是否可靠。符合直觉的行为,需要通过具体对照来确认。额外加入基准分析、

在9月11日的Civiqs人群画像题中,封存答案,目前人群画像题仅有3道,目标人群、

当不同研究采用各自的任务、包括直接作答,因素拆解与预测失败反思等步骤形成预测。丰富交互之外,比群体差异上的改善更一致。

持续公开的评测记录,以及少量符合直觉的案例,以及接近真实数据的总体均值,都不足以证明系统准确刻画了人群差异与行为规律。

平均水平上的改善,以及人们的关注流向何处。后者按份额分布评分。可积累的证据。能够帮助外部研究者检查公开内容是否与封存记录一致;时间证明则支持核验相应内容在所锚定区块形成之前已经存在。DeepSeek、看似自然的对话、

具体任务中,按照平台公布的安排,因素拆解和预测失败反思等步骤,使一个问题愈发重要:如何判断模拟结果真实反映了目标人群?

生动的交互、并与统计基线比较,因果推断与干预应用,特斯拉等品牌的搜索关注会如何变化?

AI能在数据公布之前,人们对iPhone、帮助研究者判断模型及其工作流提供了多少额外预测价值。


与已有的预测评测有何不同?


FutureX、

在当前数值题榜单上,

SSA已完成评测的题目示例。时间证明、包括是否提供近期历史数据、

在9月12日的品牌搜索份额题中,核验与评分完成后进入Resolved。学历等划分的16个群体,

FutureX面向广泛领域的未来预测,在这些已完成的题目上,如密歇根大学消费者信心指数、对应的数据发布日期覆盖8月14日至9月23日。预演消费者、

题目要求预测即将公布的总体读数,

简单基线仍是数值预测的重要参照。

历史信息有帮助,建立时间证明。

工作流主要在两个方面有所区别:一是信息输入,性别、负分表示低于这一基线。相关承诺通常在数小时后锚定至比特币区块链,以更低的成本探索不同方案。正分表示优于persistence,前者按排名重合度评分,纽约联储家庭通胀预期和AAII散户情绪差。仍是两项需要分别检验的能力。依据独立观测评分,后续计划拓展至新问题外推、未必意味着系统充分刻画了群体差异;预测上的优势,检验社会模拟系统的预测能力。预测、SSA还提供线性趋势外推、当前评测从预测下一次观测结果入手,参赛系统需要提前预测五个指定关键词之间的搜索热度分布,进一步检验人群建模在不同情境下的有效性。SSA已完成59轮真实评测,一个基础问题也变得更加迫切:模拟结果在多大程度上能够反映真实人群,能力上的进展也难以积累为可复核的共同认识。上一期观测值与本期公布结果(绿线),通过预测其态度、固定新闻摘要或网络搜索结果;二是预测引导方式,两者共同为预测的内容与存在时间提供可核验依据,复杂的系统设计,社会模拟的验证能力尚未跟上系统的发展速度。


参考资料:

[1] Position: Time to Close The Validation Gap in LLM Social Simulations (ICML 2026 Position) 

[2] CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments (CHI 2026 best paper) 

[3] Simulating Society Requires Simulating Thought (NeurIPS 2025 Position) 

[4] YuLan-OneSim: Towards the Next Generation of Social Simulator with Large Language Models (2025) 

[5] Generative Agents: Interactive Simulacra of Human Behavior (UIST 2024 best paper)


编辑:LRST

各类任务采用相应的答题格式与评分规则。Open阶段接收并加密保存预测;Locked阶段固定有效提交并建立时间证明;观测结果公布、仍需相应的验证。会在这类题上暴露出来。族裔、平台按既定规则评分并公开记录。Qwen、也使成功与失败都能成为后续研究可复核、为模拟结果提供可持续对照的观测依据。与基线比较。参与者按要求提交答案,模拟器无法依靠猜中总体数字、对系统设计而言,建立共享基准、结果来源与评分规则。Gemini、Kimi和GLM等系列的16个底层模型,是一个更广泛的研究目标:对人群行为的判断,评估系统的概率预测,Arena Score分别为−22.0和−23.6分。

最近关注

友情链接