{"as_of":"2026-08-08T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8b6632dc51c52eb7f84907190f24ccdf0ca31b2ff3f8ee4292e38bd2b2e35c0","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T05:37:44.982932Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.22238/citation-record","integrity":"/paper/2605.22238/integrity","json":"/paper/2605.22238/citation-record.json","paper":"/paper/2605.22238"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Science , volume =","venue":null,"work_id":"e502f5a7-a6cc-48e8-b70d-ca77c9dce333","year":2022},"citing_paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-22T05:37:44.982932Z"},"links":{"citing_paper":"/paper/2605.22238"},"observation_digest":"sha256:dc45cbc488ef3ed9d5c65c7c12483af1e395d301085d5e159e3e041e4b78915d","observation_id":"6b3c7bfb-814c-4cef-86ca-bd27026cc3e8","resolution":{"observed_at":"2026-05-22T05:56:09.458656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:17:48.491696Z","title":"2024 , url =","venue":null,"work_id":"0e6d76c0-d234-4dc5-ad9a-dd510d0123e6","year":2024},"citing_paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-22T05:37:44.982932Z"},"links":{"citing_paper":"/paper/2605.22238"},"observation_digest":"sha256:20a363db7af6ea8d822120b9ce19c2cb08e3f8d94841cbcb2decbfe86107b4cd","observation_id":"b352fd9b-bde4-48db-9097-77c2079dc5c5","resolution":{"observed_at":"2026-05-22T05:56:09.462337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1126/science.ade9097","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Human-level play in the game of diplomacy by combining language models with strategic reasoning","venue":"Science","work_id":"2dea1e80-c1f5-4b7c-bdf3-0a48872d62b6","year":2022},"citing_paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-22T05:37:44.982932Z"},"links":{"citing_paper":"/paper/2605.22238"},"observation_digest":"sha256:bda1893f68f518df802d6ec2981734097805e5973accbf8c80c2cc2348ffe7dc","observation_id":"708a3513-9f52-4af9-83c9-a4c96515b264","resolution":{"observed_at":"2026-05-22T05:41:07.034526Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T10:53:44.499352+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T10:53:44.499352+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06613","last_updated":"2024-07-22T14:32:33Z","snapshot_observed_at":"2026-07-06T18:28:24.821865Z","submitted_at":"2024-06-07T00:28:43Z","title":"GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents","version":2},"cited_work":{"arxiv_id":"2406.06613","doi":"10.48550/arxiv.2406.06613","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06613","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gamebench: Evaluating strategic reasoning abilities of llm agents","venue":"arXiv (Cornell University)","work_id":"cdb22e0a-9571-4240-9df5-528000181bf8","year":2024},"citing_paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-22T05:37:44.982932Z"},"links":{"cited_paper":"/paper/2406.06613","citing_paper":"/paper/2605.22238"},"observation_digest":"sha256:82fc8264e4bf5747d62ae59ea56d89a920e79a07c9b2a060815208efa31cfa6b","observation_id":"aaa34980-a9de-4766-81ec-46c655554ffe","resolution":{"observed_at":"2026-05-22T05:41:08.490213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19165","last_updated":"2023-05-30T16:09:19Z","snapshot_observed_at":"2026-07-06T15:35:30.017377Z","submitted_at":"2023-05-30T16:09:19Z","title":"Strategic Reasoning with Language Models","version":1},"cited_work":{"arxiv_id":"2305.19165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.19165","snapshot_observed_at":"2026-07-04T00:39:17.311582Z","title":"Gandhi, D","venue":null,"work_id":"8d0b2824-8733-4c36-9a45-dab1f9a28e4f","year":2023},"citing_paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-22T05:37:44.982932Z"},"links":{"cited_paper":"/paper/2305.19165","citing_paper":"/paper/2605.22238"},"observation_digest":"sha256:1f7cdef2b493ac5dc23bbc0ea9c125512e4e53f0e5a9bf626fe6a19273a3e418","observation_id":"2f52693b-87b6-43c8-ba42-e929196dd843","resolution":{"observed_at":"2026-05-22T05:41:08.486282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-22T05:37:44.982932Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2605.22238"},"observation_digest":"sha256:d58dbbeec3f948193e1326f0fb2d3ce2ffa5d492adcc818b8ec5ffd8f1c30798","observation_id":"1fd2599b-1768-4a2f-878f-c60e6f7610e4","resolution":{"observed_at":"2026-05-22T05:41:08.482224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-22T05:37:44.982932Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2605.22238"},"observation_digest":"sha256:a3d90a51620fa687820c5a857410c12a7be30e8ca45e3c7a6d33a9c572930c42","observation_id":"4248d872-252a-4963-bc25-47c423a5bb63","resolution":{"observed_at":"2026-05-22T05:41:08.473414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":"2308.03688","doi":"10.1109/fllm63129.2024.10852426","metadata_source":"pith","pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AgentBench: Evaluating LLMs as Agents","venue":"cs.AI","work_id":"a37549b4-4c94-412d-acc4-4efeb08509be","year":2023},"citing_paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-22T05:37:44.982932Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2605.22238"},"observation_digest":"sha256:2ea7ecddb22a52faebdeac3868050f04f891a46c512c5640fdd07591d727060d","observation_id":"9c3e1682-da6d-4e13-831d-89dd2c7aa389","resolution":{"observed_at":"2026-05-22T05:41:08.469034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":"2311.12983","doi":"10.48550/arxiv.2311.12983","metadata_source":"pith","pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAIA: a benchmark for General AI Assistants","venue":"cs.CL","work_id":"cf222b33-f7a3-4044-a570-ecfe25edb3f8","year":2023},"citing_paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-22T05:37:44.982932Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2605.22238"},"observation_digest":"sha256:48b0caf66229bef363db70f132e85546454dfac1562147847d988f5779e0ff65","observation_id":"a385a6bf-19c5-4b7f-99fd-95d7e89096fc","resolution":{"observed_at":"2026-05-22T05:41:08.463536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:17.222295+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:17.222295+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":"2206.04615","doi":"10.1162/tacl_a_00688","metadata_source":"pith","pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","venue":"cs.CL","work_id":"bb63abb3-0d50-4362-b97c-b5e725b03b39","year":2022},"citing_paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-22T05:37:44.982932Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2605.22238"},"observation_digest":"sha256:e7488f74d3d26218de6dd1e269b5e392b6503863ee4f80136739e5a601ad1d0a","observation_id":"850250d3-cf0a-41a9-ae37-e18e2fbeca8c","resolution":{"observed_at":"2026-05-22T05:41:08.478010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T11:30:35.242922Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":"2406.12045","doi":"10.48550/arxiv.2406.12045","metadata_source":"pith","pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","venue":"cs.AI","work_id":"6a8d8dc4-0cc0-4052-8109-abbcdcd4a962","year":2024},"citing_paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-22T05:37:44.982932Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2605.22238"},"observation_digest":"sha256:d4a5bbb36d03090b1ce30101d79173e9a5500724fca23f01e42828291a66478e","observation_id":"19e3369b-35d0-40d3-872e-3d0c9fd0433b","resolution":{"observed_at":"2026-05-22T05:41:08.494410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.22238","last_updated":"2026-05-21T09:41:16Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-01T20:38:20.411575Z","submitted_at":"2026-05-21T09:41:16Z","title":"Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":2},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2605.22238."}