{"as_of":"2026-08-05T13:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:440a8a35e470e0c59f2d6723f7deb9dfbe29f48eddef3fa5285ba6dc0948eb68","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T07:15:27.939886Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T09:04:16.361753Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29512","snapshot_observed_at":"2026-07-14T09:04:16.361753Z","title":"The official arXiv record lists 53 authors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10814","last_updated":"2026-07-12T16:03:30Z","snapshot_observed_at":"2026-08-03T22:07:12.441334Z","submitted_at":"2026-07-12T16:03:30Z","title":"Auditing Belief-Conditioned LLM Agents in Hidden-Information Social Deduction Games","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T09:04:16.361753Z"},"links":{"cited_paper":"/paper/2605.29512","citing_paper":"/paper/2607.10814"},"observation_digest":"sha256:b17450e690702dbdaca5d30413c0a883bd166669325f50e4c50e663e1932abe2","observation_id":"06d8aea6-d889-451c-9bde-93f64ebb53ae","resolution":{"observed_at":"2026-07-14T09:04:16.361753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.29512/citation-record","integrity":"/paper/2605.29512/integrity","json":"/paper/2605.29512/citation-record.json","paper":"/paper/2605.29512"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Does the chimpanzee have a theory of mind?Behavioral and brain sciences, 1(4):515–526, 1978","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:12305dc42b4317b031a56460f7ce69b679f0878592541d79ba421baef85415f1","observation_id":"351274df-e0b7-4f92-a198-9a81a2dcb098","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08399","last_updated":"2023-03-14T13:47:26Z","snapshot_observed_at":"2026-07-06T14:52:34.482294Z","submitted_at":"2023-02-16T16:18:03Z","title":"Large Language Models Fail on Trivial Alterations to Theory-of-Mind Tasks","version":5},"cited_work":{"arxiv_id":"2302.08399","doi":"10.48550/arxiv.2302.08399","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.08399","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models Fail on Trivial Alterations to Theory-of-Mind Tasks","venue":"arXiv (Cornell University)","work_id":"1bc47679-bdf4-4416-89dc-897e02469d50","year":2023},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2302.08399","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:a35112649ad57a831a27bfaadec33927b6b8f38c56e47b52d96f2c475dfda256","observation_id":"2c7cdacb-ec2a-40eb-a818-b7ef9bc8b574","resolution":{"observed_at":"2026-06-29T07:23:13.213072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T22:19:51.216017+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T22:19:51.216017+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Weisz, and Murray Campbell","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:eca659afc15c1221c619a7cfd2642b63c89f60be8cec40c6b1424591e5d748be","observation_id":"4ea8a0ce-c108-417f-bb3c-431d8ea281b9","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Fantom: A benchmark for stress-testing machine theory of mind in interactions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:de14dafd154dc08ac6238055ab6e970ca0bbc9373f839ee46a741e842e14292a","observation_id":"4ca0b38b-517b-4b49-aafd-09c78b9c1eba","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:5f42a7bf6ff6d0c1a41f9b397c313a5dd9dbd9b2633dbb0c33d9991f7ed57819","observation_id":"6dbd5255-3843-4f5f-98d5-c1d9b2526420","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:23:13.220043Z","title":"Large language models miss the multi-agent mark","venue":null,"work_id":"88c4c4d9-ad4f-4ba4-b2af-a577b6e5d5fb","year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:3530bb80eefb95e8d06196eb3e4afc4f37ebaf475881ae036834d97acfc69cd4","observation_id":"85e4bf93-ef97-4c69-9fd3-fb1555ad3115","resolution":{"observed_at":"2026-06-29T07:23:13.221492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Theory of mind for multi-agent collaboration via large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:9a1f89e2902c34da6e33ac96eeaaf72cf6b161c55be06905f5908ce4798d1d63","observation_id":"46f680a9-4248-488c-9cec-20144452372e","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.13","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/2023.emnlp-main.13","venue":null,"work_id":"20a9aa98-dc16-48d2-91a4-779234bd1778","year":2023},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:6cd77628a8278cf8f52fc01b4b5d4b43be65f034a98a72f3d9378d769cc2b014","observation_id":"1a4551af-4cb3-4f58-8f6c-be125f364fe8","resolution":{"observed_at":"2026-06-29T07:23:12.396765Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T08:23:14.231021+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T08:23:14.231021+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18940","last_updated":"2025-05-29T08:46:38Z","snapshot_observed_at":"2026-08-05T10:10:10.975440Z","submitted_at":"2023-10-29T09:02:57Z","title":"Language Agents with Reinforcement Learning for Strategic Play in the Werewolf Game","version":4},"cited_work":{"arxiv_id":"2310.18940","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.18940","snapshot_observed_at":"2026-07-03T15:08:33.096987Z","title":"Language agents with reinforcement learning for strategic play in the werewolf game","venue":null,"work_id":"75326cf6-326b-4d75-b414-b80dcb50328c","year":2023},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2310.18940","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:cccd29d13d820ba06f8d38625f2dfa18d2507cd174036ba814aaea5288ca8df5","observation_id":"e1d2defc-3b7b-4ab8-88a3-d6a698ea3672","resolution":{"observed_at":"2026-06-29T07:23:13.205074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Playing repeated games with large language models.Nature Human Behaviour, 9(7):1380–1390, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:42ac61086ab1d3d16ea90bd64bc42857b3e1c08635d76b5480f02373e5252cb1","observation_id":"d1d03d25-b0fd-4d70-9f0c-e99262169b33","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15146","last_updated":"2025-06-03T09:53:37Z","snapshot_observed_at":"2026-07-06T21:27:37.409259Z","submitted_at":"2025-05-21T06:02:55Z","title":"lmgame-Bench: How Good are LLMs at Playing Games?","version":2},"cited_work":{"arxiv_id":"2505.15146","doi":"10.48550/arxiv.2505.15146","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xing, Ion Stoica, Tajana Rosing, Haojian Jin, and Hao Zhang","venue":"ArXiv.org","work_id":"10ddd4f7-8f21-466f-b975-f64ea89b9b2e","year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2505.15146","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:18bbcab4abbd8d569d45913fc3299604d2cc4f5bd33b2c2c230608c1429d6bb3","observation_id":"cb5202f0-d7ec-4fae-b9ff-6d58f9651a63","resolution":{"observed_at":"2026-06-29T07:23:13.196706Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09053","last_updated":"2025-08-05T02:23:31Z","snapshot_observed_at":"2026-07-06T20:35:49.677643Z","submitted_at":"2025-02-13T08:08:27Z","title":"Game Theory Meets Large Language Models: A Systematic Survey with Taxonomy and New Frontiers","version":2},"cited_work":{"arxiv_id":"2502.09053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09053","snapshot_observed_at":"2026-07-02T16:37:09.358190Z","title":"Game theory meets large language models: A systematic survey","venue":null,"work_id":"c0afadfc-2664-4571-a5c7-e7c7fbd59a29","year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2502.09053","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:4541b93218e09b40746aaef979c666a0715d2090a93522db3739f593ffe302c3","observation_id":"5e027425-9616-4ff7-b2d6-8a615cac417a","resolution":{"observed_at":"2026-06-29T07:23:13.199308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Autonomous agents modelling other agents: A compre- hensive survey and open problems.Artificial Intelligence, 258:66–95, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:bd30f82631fa1a767d0a57e87195935615e2921f55a8c674ec82c1f3e4cba8df","observation_id":"447c10ce-a351-483a-8289-8d0a61be2720","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"PhD thesis, Carnegie Mellon University, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:02d25e5a99873e4e9f33f2ccca502ca58df3a1cda34fd5909987aed038e4b9ce","observation_id":"afab9041-35fa-41e2-b0dd-4d4b0a56fd5c","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Multiagentbench: Evaluating the collaboration and competition of llm agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:23993e54e11e7ad3c97bf7c253c2c43aade20ad26788d7330e1db662c136e648","observation_id":"978edb85-cd3c-4d13-a8ac-6c526fa729d3","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:23:13.236711Z","title":"Beyond survival: Evaluating llms in social deduction games with human- aligned strategies","venue":null,"work_id":"4b8b8071-d614-45dc-bc65-33b7f16efd53","year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:ecceb626848af9cc6c2d64e53e3504a58ed3ae33b6c5216514b81fb5e6223e08","observation_id":"cdcd3381-0e88-4884-8ca0-8a339329c3bb","resolution":{"observed_at":"2026-06-29T07:23:13.238595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11442","last_updated":"2025-05-24T04:10:59Z","snapshot_observed_at":"2026-07-06T21:09:55.394184Z","submitted_at":"2025-04-15T17:55:20Z","title":"TextArena","version":2},"cited_work":{"arxiv_id":"2504.11442","doi":"10.48550/arxiv.2504.11442","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.11442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Textarena","venue":"ArXiv.org","work_id":"5e2b14af-8a88-4c5c-8bfd-831d9590aa34","year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2504.11442","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:36fac5e1fefbae71987cc04749fa83f717ae1aa36854a18fa3b1fd34472bc86b","observation_id":"5082dbc8-f575-4c23-b2cd-daa31f7fbb1e","resolution":{"observed_at":"2026-06-29T07:23:13.232548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Trueskill™: a bayesian skill rating system","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:faf9496b6a3f3215bc7660f0eb542f7438363d583dfe8649fdda5bb903f7bf8d","observation_id":"14e9900e-2ccb-4449-8941-68acee705ae6","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-07-06T16:29:19.703823Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":"2310.05036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-07-04T17:29:59.553004Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","venue":null,"work_id":"c23496f9-74e5-4822-bd5b-57536d93086a","year":2023},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:fad43cf2fb106da70034a175026cde1814fb5607883f1b451a04ba1a6befa1a1","observation_id":"4ecfe833-ade7-4e2d-ab47-4aff26c4a9e3","resolution":{"observed_at":"2026-06-29T07:23:13.235012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Gtbench: Uncovering the strategic reasoning capabilities of llms via game-theoretic evaluations.Advances in Neural Information Processing Systems, 37:28219–28253, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:3c1c3c271bc0fbd1758d4a66dac64037e4e177365ba22bd3e0a851a9ee6c48f7","observation_id":"2c017877-c7f0-4fe9-ada9-bbc37a8c170a","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.12349","doi":"10.48550/arxiv.2503.12349","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spin-bench: How well do llms plan strategically and reason socially?","venue":"arXiv (Cornell University)","work_id":"5865d5d2-491c-40f7-bd24-bbf951fe5e0b","year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:a4087499f948d2dd88672352415924476be3c22136ea198511e0e09be5e08915","observation_id":"7047ddad-62cc-4550-9aee-d5a655cd513e","resolution":{"observed_at":"2026-06-29T07:23:13.219939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11667","last_updated":"2024-03-22T18:52:15Z","snapshot_observed_at":"2026-08-01T04:15:49.179138Z","submitted_at":"2023-10-18T02:27:01Z","title":"SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents","version":2},"cited_work":{"arxiv_id":"2310.11667","doi":"10.48550/arxiv.2310.11667","metadata_source":"pith","pith_arxiv_id":"2310.11667","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sotopia: Interactive evaluation for social intelligence in language agents","venue":"cs.AI","work_id":"47b9c80b-5140-4a3e-9d18-d298c3ffac79","year":2023},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2310.11667","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:2e188755e18438422e0b4a364626299e62b5c59ad10725b3794b5af574036703","observation_id":"8ca7c88a-47bc-4592-a1cd-96d42e7e98b9","resolution":{"observed_at":"2026-06-29T07:23:13.223995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Tombench: Benchmarking theory of mind in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:fb055588829645dad3c5e93ed11f1bc2ea4c5a8311c4fce601c41e301c36928f","observation_id":"6d8de1a3-c254-4368-bfec-81ccf48c9e13","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Hi-tom: A benchmark for evaluating higher-order theory of mind reasoning in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:67b1e8012ceb541a6bb12d76e01634b1ec632126cdccf6e6143da9038f7db21c","observation_id":"bd15dd98-9368-49ac-b816-15cab2c66850","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Understanding social reasoning in language models with language models.Advances in Neural Information Processing Systems, 36:13518–13529, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:7d4a3db9ab7e98efd5c1a7df0f32af4527ed5c7db7f20e2c4da57e51e40b87de","observation_id":"90dfda3f-5aee-4796-a359-e1ff3c68377e","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Opentom: A comprehensive benchmark for evaluating theory-of-mind reasoning capabilities of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:379aab4089137d8cf6c22cc28513f0d3897ae2279506a0dfd1efa02feeccc643","observation_id":"a683f702-e36b-40ee-bae8-4a50016c11b9","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Theory of mind: Mechanisms, methods, and new directions","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:f0020ec18da3b13ab50cc0620fae2a7ef3b8e603b16e3388ca3064fb2ff9591a","observation_id":"8a752feb-8500-4cd8-9742-bdd38025e4a6","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13943","last_updated":"2024-07-18T23:41:05Z","snapshot_observed_at":"2026-07-06T18:48:46.032977Z","submitted_at":"2024-07-18T23:41:05Z","title":"Werewolf Arena: A Case Study in LLM Evaluation via Social Deduction","version":1},"cited_work":{"arxiv_id":"2407.13943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13943","snapshot_observed_at":"2026-07-04T00:49:18.497365Z","title":"Werewolf arena: A case study in llm evaluation via social deduction","venue":null,"work_id":"fbd66d3f-66bc-4206-927d-823093ae3fa7","year":2024},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2407.13943","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:a95bd9c6f00cf8da1874c4a21bf40f03be5a1045c35b34a331e12e4f724a5143","observation_id":"9d9b41be-bcdb-4364-a6c3-024f314de6cf","resolution":{"observed_at":"2026-06-29T07:23:13.222505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Hidden in plain text: Measuring llm deception quality against human baselines using social deduction games","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:1ded1d8b4203a1379a220ea1425039679536ee2e03c9c704741d1d231b75f77b","observation_id":"625f0190-dc61-4e34-a234-f5a528d07763","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Fine-grained and thematic evalua- tion of llms in social deduction game.IEEE Access, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:66edc896f83d376b7b2dd4c26dc502a18fc076b9828b0606238324099f950fe8","observation_id":"4bc33241-e4f1-407d-b138-d39418ffd6b6","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Codenames as a benchmark for large language models.IEEE Transactions on Games, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:405755dd4efa9f589148c5c1ab8d7e5d295c9ac3235cd831d85f3c363107a025","observation_id":"709434e3-0b49-4a7c-90bf-13adf1708a3f","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"The hanabi challenge: A new frontier for ai research.Artificial Intelligence, 280:103216, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:8d6d4e1adb3f659af588be748853c6d146b897a95ca1b4bdf18f5cad7078e48f","observation_id":"7c0cdd08-3ff5-4b42-971a-8e97d3651c59","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Human-level play in the game of diplomacy by combining language models with strategic reasoning.Science, 378(6624):1067–1074, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:efc4afa9213a00072898762ef7f8c95e6071e628267b0a670bc8b61788b2e6ea","observation_id":"ec9b299f-29bc-48e7-9dab-c6dc04c3eb76","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Richelieu: Self-evolving llm-based agents for ai diplomacy.Advances in Neural Information Processing Systems, 37: 123471–123497, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:a47720135e93c64076bd21aeb973282de9a1be49f680de838365b42bdeb8d444","observation_id":"289d9c27-49c3-49af-84e0-e7bf2d01c1e4","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06613","last_updated":"2024-07-22T14:32:33Z","snapshot_observed_at":"2026-07-06T18:28:24.821865Z","submitted_at":"2024-06-07T00:28:43Z","title":"GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents","version":2},"cited_work":{"arxiv_id":"2406.06613","doi":"10.48550/arxiv.2406.06613","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06613","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gamebench: Evaluating strategic reasoning abilities of llm agents","venue":"arXiv (Cornell University)","work_id":"cdb22e0a-9571-4240-9df5-528000181bf8","year":2024},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2406.06613","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:114a6f13b9697e18a985ec61f0ea902e32ca7d6ae36d5704a103ee25d6dba034","observation_id":"d3c50d8d-6641-45cc-ac87-441fa5e8ab56","resolution":{"observed_at":"2026-06-29T07:23:13.225042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Game of thoughts: Iterative reasoning in game-theoretic domains with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:eb7016170c6689bcbaff90f99d2eab86d7ad81ee02715117b551b5caff5f0ed1","observation_id":"17e8b0db-df6c-4185-9fd5-196a4969efc8","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.03318","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:58:57.665923Z","title":"Evaluating generalization capabilities of llm-based agents in mixed-motive scenarios using Concordia","venue":null,"work_id":"ce93c321-f438-4125-bddc-d106f6425bb8","year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:684938c54aca1c1c1b884f85e4d54433001df62a8c733aef4caaafff247acfe8","observation_id":"288a108c-3b2b-4454-b3e6-f6909c81f243","resolution":{"observed_at":"2026-06-29T07:23:13.227804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"https://www.mafiabench","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:e7ac2d5416a0f7a1aaeb28459423aa811b368e5157bf1b337a3191681f2e095d","observation_id":"c2100cfa-a80a-48a8-9808-2f3841688633","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:b508ae7df51d8adc5707bd8aab784e82d0fa44f6f6a2eba88619d78f62390752","observation_id":"9807179f-93d2-4791-bbec-5baf6080530a","resolution":{"observed_at":"2026-06-29T07:23:13.230099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"The colonel blotto game.Economic Theory, 29(1):1–24, 2006","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:6e5676e618dde8389f2fa93afd9f0dc48c51b9e8eb63e39882b1c0332bbe4e8c","observation_id":"eb7377f4-b79a-424a-ad80-56966f2eacfc","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Evolution of strategies in the three-person iterated prisoner’s dilemma game.Journal of theoretical biology, 195(1):53–67, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:2ffc68605437bccf1cfa1c7035e81fc3953b7cf69bbc9c5b905250e6f7307da5","observation_id":"64c9d471-1e51-46d6-adfd-2acec1369f3d","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1214/07-aap456","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mafia: A theoretical study of players and coalitions in a partial information environment.The Annals of Applied Probability, 18(3): 825–846, 2008","venue":"The Annals of Applied Probability","work_id":"629dad15-b4dc-4cc2-bdf3-27798f913218","year":2008},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:a24628d1429ef8f1c160566d25e3897c92ad8d39610dea822980ce0a510f08a4","observation_id":"ba9795b2-94b6-4e06-bcd8-a070ae468f92","resolution":{"observed_at":"2026-06-29T07:23:12.398890Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Gpt-5 system card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:4cc450261df071007392a1966b6ef56af7a6001c303239da46f767fd66cf4209","observation_id":"3b3e3063-9c95-459e-a3ec-0732e1e5d491","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:39:30.747752Z","title":"International Conference on Machine Learning (ICML) , year=","venue":null,"work_id":"79819b4c-ffb2-46fc-8507-318e9ec20de9","year":2026},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:58e5dabfac9ba5e77e7821a07e3336c9ceb35657a9703e0ca6b8651c6de37adc","observation_id":"706c9c4b-6d96-404c-847a-5ab298a60753","resolution":{"observed_at":"2026-06-29T07:23:13.210667Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02060","last_updated":"2024-06-12T02:46:16Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T15:59:11Z","title":"Long-context LLMs Struggle with Long In-context Learning","version":3},"cited_work":{"arxiv_id":"2404.02060","doi":"10.48550/arxiv.2404.02060","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02060","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long- context llms struggle with long in-context learning","venue":"arXiv (Cornell University)","work_id":"595d1e20-91fe-461e-9442-4baeb3560aee","year":2024},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"cited_paper":"/paper/2404.02060","citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:39347e2424e727869ba94258d1b0fbc0e52aaa0f545b821f88b7a6b2d403786c","observation_id":"f86840d6-93a8-45a3-a22d-a1f02c194019","resolution":{"observed_at":"2026-06-29T07:23:13.213462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Lost in the middle: How language models use long contexts.Transactions of the association for computational linguistics, 12:157–173, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:747012e7803321019ef19375bb528e4930316ff73be39fb63cee15f6e4cf60cf","observation_id":"bb3949b4-9e38-48af-bf44-157f54a876b2","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"text-embedding-3-small, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:1f2b30179cf49bcfdcf979607904d5feeca0d85a84ed88e5540ef055f31b2193","observation_id":"5197147e-c80e-45dd-8042-934c61e906c2","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:c88a34fc24a1554ee498b9a5ee145ba04c523384e4e216442e867afb69c22d74","observation_id":"d597b9f1-c87a-41e6-ab71-91323488d59c","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Episodes are terminated with typed failure metadata when violations occur, enabling downstream attribution of responsibility","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:0501f99e523e8ebaed0fc88197a7f23f1b0bada8ba6947a233f96c5ebb1d3b3f","observation_id":"b4c6cba6-4ade-4f9b-846b-471d413dd4ee","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:df54dae8e8b98ee7ad22018ce8be64813ab75380cdfc494fde4b1342ef56db21","observation_id":"f53d8ee6-26d1-4769-b898-930b59203c14","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Crucially, error steps themselves remain eligible and receive penalty rewards to teach format compliance; only steps with no outcome to learn from are excluded","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:0841873b20979f2d67a630f4f4ac05fcf84350e373f4afe8bbf9fcb38f4b939a","observation_id":"ca5f043c-cf7f-42c1-950e-40a6e5884369","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:c019490446dccd752e7e33e81663c9df79319fa989d643a21582a49fd3129d8f","observation_id":"befdefea-1f78-47bc-83a7-8e928a058352","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:d8c351c546cdc691b76b1ddbcba9bc57b23c3f979b2190ad7a5881661b36c53b","observation_id":"9b2ae82e-7306-4d8d-8bfe-445e4e5fad4e","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:a8a4462a87bb901eb1715d3fc369cd74f6304b663b6f11c7d83bbaac4c03b7c0","observation_id":"78a9d60f-e4b9-499f-8a05-1cd7c05bc2d2","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Zero-heuristic design principleA deliberate design choice: the system uses no hardcoded lookup tables, decision trees, or game-specific heuristics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:64bcc2e5d97b5b719a3fd3ac880eac220d16a47709f20d668615842f78dd779d","observation_id":"47e7d7d0-16fb-48be-a11e-8318eba00363","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:744a6ce2f1019ab410d318eea9f5b70c35abbb86929da51ee9bba08886e39d68","observation_id":"5ad36749-d0c4-49a6-ab89-7e2f05beaf8d","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:97f686a430c9efff8b8322cc73ba513e11d46a8c7fb7171f3e28eb288b5d7369","observation_id":"df0e1ccf-9d93-4173-9642-dfa66c6f8b74","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Each candidate is evaluated via 4 stochastic rollouts, producing approximately 2,300 preference pairs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:6d3dbd35e88639056566bfd2e31213a32dfb9898fc7e7ba15528a2c07bbe580a","observation_id":"7fe57116-5bb5-4a8b-983f-701ad2abd940","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:35cfdbef97d120df91ed900f825428e7d76b3406a83ef4b135903000207a23c6","observation_id":"45d9e2e6-c50c-43df-9598-5b30ccc7334c","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"The graph policy is trained by cross-entropy imitation, then continues PPO training to stabilize performance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:d25191af6d69760ba8e3c9225ed2b453f79cd08f30582820cdcf92acbf2ed4b9","observation_id":"1bbe1b2e-162e-4711-805c-fe8c568ca92f","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Role-specific behavioral instructions guide strategy (e.g., Mafia agents are instructed to mislead without implicating teammates)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:bbfd52a8596d15c5b9666962bf5f81d6a1d3b24265285213ea1bb5728599699e","observation_id":"128bace6-f1a5-4f79-9777-f858578ad960","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Win rates by configuration: Base 21.7% → +Prompt Refinement 25.0% → +Memory/Deduc- tion 16.7% → +SFT 45.0%","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:34147ce5f3bacc2c1bf4ec08fb61bd0c663b3706f6ad69a248beb8c54b9cb774","observation_id":"4936010f-7493-4130-b011-0cf90b682c21","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Key failure: Mafia agents frequently leak role information into public responses","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:437ab2ee8a1c9d2e85f9ca2589b2dab0590ef4ca044ee3c88092f3b69aaff90d","observation_id":"4cefb51a-c1e6-4068-8c95-a5a1d7e8b4cd","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"An external harness extracts only the public action portion, architecturally preventing information leakage","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:314a8e3c0e64ffc29b9550d6ffffcb46c8ac43b64143461c96f74d7f2d2ad70b","observation_id":"d5725eb1-007a-45e6-8075-0e423cc6b818","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Key finding: memory without fine-tuning hurtsCounterintuitively, the Remembering agent performedworsethan the Thinking agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:c2d4f02c6d43c3c82225910514d46393ac4e3cace6eb2ddc0fc83567a72676e6","observation_id":"c3a52559-1864-4699-8979-f633898f3a4e","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"build coalition against Player 3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:0910beb630fffdec268ad4647927e0f2c1f36f2b64c871ee0fc2c77a3baeb5d7","observation_id":"c2d02c2f-1828-4828-9f67-3637ae56de5d","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Handles perspective-taking, social simulation, and theory of mind","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:1f5e0e3f7debbb97b200eae7766c99092d10184d02121e5b5765d7139b469272","observation_id":"7d391725-612e-45fe-8400-61c8a41b350f","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Performs hypothesis verification, strategic planning, and vote optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:97fd717fd31d404a849308b2b5041aef8957dad7b11a8c0ea6f09e2d4cbb9c2b","observation_id":"f5097718-1705-44e3-98bc-91626c39e229","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Inspired by neuroscience research on humor and surprise processing, this mode flags inconsistencies as potential deception cues","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:0588660110673879e58303620a3b9bc588c38696da535e804b39407452d7b631","observation_id":"f4083f84-aeab-4723-8b55-4620946d846a","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:b963182de1903d50670e9300d0ec0d4c8fdbcbfee69b3890f4f433d879efb4a3","observation_id":"24b92214-8fd9-47e5-8ca7-4c9a252b4358","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:480d2343d3b799fec3ac0fafc1e24a53dedd22ae28e8eb98397ac31c1d818ad3","observation_id":"60fe23be-7186-45f6-80be-03fbc9122969","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:c631e44a793eaae3f370fe3be2b51785ffb61ef9bb2cb54b2ca87dc65b67790f","observation_id":"574748fe-06f9-45c0-abad-a1211d0979f3","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:11d3b69286775b81a2e726a9e5adae919e28117d31fa0fd5cb7759495029c681","observation_id":"f9bc3ab2-c322-49c8-a9d1-564df3c9f66a","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"as Villager, vote with the majority in early rounds to build credibility","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:8bc2f0776d11c59c9a977b50c40da6175e6f282cc02aaa901249d03ff676cd36","observation_id":"8a5bdbf8-c7f0-4ad1-bed4-79cbec7cd8cf","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:b6eba4d6f62d2904f4388d774445a72323f2f4be2316a88b92445d68bdac815f","observation_id":"c1dad41d-0995-42c2-88ca-2b91f77be242","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"less coupling can yield more robustness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:39b0046d39d1e12839ee30ead8d296da1727a710b58976b6de95cfd6ec5d98ce","observation_id":"1a7d0444-aae1-4095-be5d-c1a5f88ce695","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"This internal review is not shown to other players","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:956096ba0e3cd3c15112110bbf2b542a259e9f7fc40a17843b9f43764fe61c37","observation_id":"63feff48-a441-4782-84ed-95f7e643c643","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"A perfectly logical deduction, if delivered in a dry, robotic, or socially inappropriate manner, will fail to persuade","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:07641f3aab7100fa33bab3732477eab25ff8ed1a5773b091919ef4c66159488c","observation_id":"0fe8fa7f-2582-46d1-aec9-440f0335a57c","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:58d39cf5bdc825b3496ed2be6a350636c8cc72db36e5e815833a7aedc2f0d109","observation_id":"1bce64b2-480b-41af-b20c-504eebf52cd1","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Let’s try for cooperation early and see how the others react","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:bbace55b9e44b174928c97f53c4da0ad7a7bf5bf532a79e07c0298126e37a8b3","observation_id":"ea72f85f-0e4f-4eee-9854-650fd33d8301","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:743d60d45d782ab56814aef0eef5657f06a87c6ae035152a42b384f7a8b6597b","observation_id":"d7cddaf6-86de-42cb-8506-1c09e90881aa","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"They can also ’[pass]’","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:e76ad2257e10a911a2f7aaa23b9441127983addb64f20db32ed620d889bc571c","observation_id":"a875d8fc-7840-4212-96c9-bebaf4e8c0ff","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:d76aec137a0ab4c5af4a5bd543dfe284691d7168bda6114b6b2390f09fb9991b","observation_id":"9306a29a-3907-487e-9a72-7242e70e53e2","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"You are Player 2, the Spymaster for Blue team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:adb08d45bda86df8d30921ee1d30bae70947d2c2b0c689c7bf920f778850b4c9","observation_id":"2edfea28-68b6-4e08-a019-6f0974f1c5d1","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:d3cd6d0222a02ab39a7bae60a78eb41e5f3e305f0ddca7e0f6800c185ca67470","observation_id":"b6aefb68-36b4-4219-84af-b8c8cd9545c7","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:daab1326b9cdf70f2fc44c4b36e254347efa7496501178d2a472062c1b563f56","observation_id":"d7f32075-eb0a-4f50-8ffe-175f3b2d044f","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:b753517295b55fa4a2306085b3f2d6e0f1e75ed2abb3188491ad2fc33d615e7a","observation_id":"b0422215-364b-4fce-933a-9879122065d1","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:2b54d0dd1771fd0a5aec6a816341d71de28f7f8ec0f35b6699b18616c9817a83","observation_id":"ad3494b7-e7ff-46f6-8f13-b01646dde0a7","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"Table 16: Mapping between abbreviated model names used in tables and full model identifiers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:6fcfb0940803fd9a7fccb8b507ead49265e7cb36f2610386d68dde99a1f0c5c9","observation_id":"7397cb24-0f6d-4201-8c9d-dc0faa886c38","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:82a6ab928e6d4f514d80af6fd25823512bc0748254356adb11151a3fe4f2048d","observation_id":"5ac71d92-9bbe-4149-9d81-e1f4a09e32e0","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:15:27.939886Z","title":"NeurIPS subset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.939886Z"},"links":{"citing_paper":"/paper/2605.29512"},"observation_digest":"sha256:4ebb771602ed471e221df168510f15d0d4e6b2a753dccae316beb912e87f586f","observation_id":"a39cf777-d8e1-43df-b9d0-756f7e98dd5e","resolution":{"observed_at":"2026-06-29T07:15:27.939886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.29512","last_updated":"2026-05-28T07:33:47Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:33:47Z","title":"MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":72,"verified_exact":16,"verified_fuzzy":0},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 1 inbound Pith citation observation for arXiv:2605.29512."}