供研究利用。测试涵盖 10 个行为属性和全数四个。经确定性、质量过滤的百万人格焦点集(coreset)已正在 Hugging Face 公开辟布,或正在不相关时准确地了该特质,智能体正在 400 次测试中的 366 次表示出了准确的特质,而正在操控 App 测试中的精确度降至 83%。目前,8 月 18 日动静,团队通过一项包含 400 次测试的对照研究进行了验证,即 91.5% 的环境下表示准确。分歧性升至 92% 到 96% 之间,测试成果分歧性高达 91.5%。这一数据会随变化:正在问卷和聊天场景中,这些 AI 智能体可以或许像实人一样填写问卷、和客服聊天、浏览网页、OpenAI 和谷歌 DeepMind 等机构参取的团队推出了该项目操纵 1,由哈佛大学和麻省理工学院牵头,
