{"as_of":"2026-08-08T02:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:db4e4fa1b1140d120cc84b879e8fc80e8b1eb2f2396c9225db6b9bcc4da75b21","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:28.526144Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:40:18.763963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14552","snapshot_observed_at":"2026-08-07T00:40:18.763963Z","title":"Korgym: A dynamic game platform for llm reasoning evaluation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.763963Z"},"links":{"cited_paper":"/paper/2505.14552","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:903bedafd8388fb55d25c717b9f383cdbf3faed74095f5d234e7c4ebaf4e49cf","observation_id":"52deed96-16d2-4713-8ddf-670d7841766c","resolution":{"observed_at":"2026-08-07T00:40:18.763963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":"2505.14552","doi":"10.48550/arxiv.2505.14552","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14552","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Korgym: A dynamic game platform for llm reasoning evaluation.arXiv preprint arXiv:2505.14552","venue":"ArXiv.org","work_id":"34155fdc-1a7c-41ee-8424-a1cae6af673d","year":2025},"citing_paper":{"arxiv_id":"2603.15432","last_updated":"2026-04-08T15:52:59Z","snapshot_observed_at":"2026-07-31T12:22:36.137299Z","submitted_at":"2026-03-16T15:37:07Z","title":"Gym-V: A Unified Vision Environment System for Agentic Vision Research","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T10:05:09.049846Z"},"links":{"cited_paper":"/paper/2505.14552","citing_paper":"/paper/2603.15432"},"observation_digest":"sha256:6c94067abadde912257c77226a3ca25c11711a8e489f26c4822bd07325cc864d","observation_id":"6602a8c0-ded7-4e60-9cf4-681632ada537","resolution":{"observed_at":"2026-05-15T10:05:26.013264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":"2505.14552","doi":"10.48550/arxiv.2505.14552","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14552","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Korgym: A dynamic game platform for llm reasoning evaluation.arXiv preprint arXiv:2505.14552","venue":"ArXiv.org","work_id":"34155fdc-1a7c-41ee-8424-a1cae6af673d","year":2025},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":1},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:24.844859Z"},"links":{"cited_paper":"/paper/2505.14552","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:9fd01f15f85434d93bb2befebdae23b667049f9bc1321ea304b9c955c4b3a61b","observation_id":"a1f9b627-e9ce-4eb9-a724-5371fd7d8615","resolution":{"observed_at":"2026-05-12T03:26:18.956227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":"2505.14552","doi":"10.48550/arxiv.2505.14552","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14552","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Korgym: A dynamic game platform for llm reasoning evaluation.arXiv preprint arXiv:2505.14552","venue":"ArXiv.org","work_id":"34155fdc-1a7c-41ee-8424-a1cae6af673d","year":2025},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":2},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-05-13T06:44:28.552513Z"},"links":{"cited_paper":"/paper/2505.14552","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:0905a84c89d4f9bd9a52893c621b974877d069cb49f82a0dcf9f16d13892ddb3","observation_id":"1ada96b7-545f-4cda-8013-94ce66bfc700","resolution":{"observed_at":"2026-05-13T06:47:27.208171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":"2505.14552","doi":"10.48550/arxiv.2505.14552","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14552","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Korgym: A dynamic game platform for llm reasoning evaluation.arXiv preprint arXiv:2505.14552","venue":"ArXiv.org","work_id":"34155fdc-1a7c-41ee-8424-a1cae6af673d","year":2025},"citing_paper":{"arxiv_id":"2606.06556","last_updated":"2026-06-04T10:43:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T10:43:14Z","title":"Robots Need More than VLA and World Models","version":1},"reference_index":159,"source":"arxiv_source","source_observed_at":"2026-06-28T01:01:33.530167Z"},"links":{"cited_paper":"/paper/2505.14552","citing_paper":"/paper/2606.06556"},"observation_digest":"sha256:198967ecb8b71c8c6d86ed6858b5c6ef8cf6d2fe4c76447ce370a52335b2a354","observation_id":"9f936eca-af66-4500-87bd-e628d5435e1a","resolution":{"observed_at":"2026-06-28T01:11:28.829702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14552/citation-record","integrity":"/paper/2505.14552/integrity","json":"/paper/2505.14552/citation-record.json","paper":"/paper/2505.14552"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:32.228760Z","title":"Claude 3.7 sonnet and claude code, 2025","venue":null,"work_id":"3e9fc013-4e7a-453c-83a2-b4aee4c4fa84","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:24.696005Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:2e09d10837a395401a7e674ee88c12dde32c85145954bbbc258f432e3bbd3b7d","observation_id":"06c09267-6863-4d3b-8544-98c54de1ae9f","resolution":{"observed_at":"2026-08-07T15:36:32.291040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:36:24.766524Z","title":"Qwen2.5-VL Technical Report.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:24.766524Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:6409d2d41e1f99456ff773e92304ac36fc15cb6efe02574f3b828e134cd6df3f","observation_id":"61e04e27-7bf6-441f-b331-05f09af5c82d","resolution":{"observed_at":"2026-08-07T15:36:24.766524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:32.098486Z","title":"Zebralogic: Benchmarking the logical reasoning ability of language models, 2024","venue":null,"work_id":"e0f9d00e-1c29-4c86-aecd-476705418b26","year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:24.858267Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:68b2a13b544f91eb5cac1c311377e0b2cc8596c9cb5907aaa67266fa973de82a","observation_id":"c64c4f69-41e4-401f-935c-8912f3b7b554","resolution":{"observed_at":"2026-08-07T15:36:32.146472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.938274Z","title":"Doubao-vision-pro, 2025","venue":null,"work_id":"60c1cf4e-824a-4af3-abfd-d855f5fbdf30","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:24.927082Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:b54799bbd062d3b1f94f49a74c9167461b918895cb876bf4a974f038ab0e24df","observation_id":"eaadc71c-d655-42f7-8ec6-644812052813","resolution":{"observed_at":"2026-08-07T15:36:32.015367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.811362Z","title":"Doubao-1.5-pro, 2025","venue":null,"work_id":"5255b1b1-7659-40fd-978d-9617adf11e94","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:24.998909Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:afb6b92120d5fd97e7bcbe72417278b9076fa274a35d576a9fb10944df237938","observation_id":"f96d137d-5105-470f-ad19-d8208f3356dc","resolution":{"observed_at":"2026-08-07T15:36:31.864759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-02T19:59:00.409439Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-07T15:36:25.068363Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks.CoRR, abs/2306.13831, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.068363Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:dfb16c1871b76d5c3fd8decd950675ba57b472b1bf89d0ddbb452348be2e009b","observation_id":"fbd77ceb-c0ea-462a-ae9a-d395ec67d38b","resolution":{"observed_at":"2026-08-07T15:36:25.068363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:36:25.162239Z","title":"Training Verifiers to Solve Math Word Problems.arXiv e-prints, art","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.162239Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:3bdc542e564b3ca7e34a047567ea46ceb33ee138dd1705f523e72105bb67c1ee","observation_id":"17adf4fc-e5df-48e1-ac42-aeed1cc19043","resolution":{"observed_at":"2026-08-07T15:36:25.162239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:25.216548Z","title":"Gemini 2.0 flash thinking, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.216548Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:3b8b8b68273ae88530a066ecc3aa15bd293c01d68e3edb545d108c06a4005ed6","observation_id":"49362b4f-08bb-4ecd-b761-3dc80b57eabf","resolution":{"observed_at":"2026-08-07T15:36:25.216548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.686894Z","title":"Gemini 2.5: Our most intelligent ai model, 2025","venue":null,"work_id":"4baa1953-5e19-4ba5-b5da-1a159556b7bf","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.283477Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:4adda159e3f6ce48b97f3e1b0b16828b32d0742b49fa07aeb9514da90e311c59","observation_id":"1a648bd7-c1a6-4b6f-a4b4-a48de7bcbcda","resolution":{"observed_at":"2026-08-07T15:36:31.742211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:25.364222Z","title":"Mindagent: Emergent gaming interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.364222Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:b4f041ac41c2135e0668346839e245571b7b58af0fbb12a37a52284080bd5b38","observation_id":"c22364c2-623d-4fdc-822a-8d8265aac8c3","resolution":{"observed_at":"2026-08-07T15:36:25.364222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11442","last_updated":"2025-05-24T04:10:59Z","snapshot_observed_at":"2026-08-07T16:02:04.304752Z","submitted_at":"2025-04-15T17:55:20Z","title":"TextArena","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11442","snapshot_observed_at":"2026-08-07T15:36:25.443878Z","title":"TextArena.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.443878Z"},"links":{"cited_paper":"/paper/2504.11442","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:88aa5b8aa9e6224cbceab4631d8630836b527d0afc63243e4cb236dcfedaee74","observation_id":"c67f13ed-8412-40c1-b8d3-c0218c6f8d43","resolution":{"observed_at":"2026-08-07T15:36:25.443878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15778","last_updated":"2024-10-12T11:00:25Z","snapshot_observed_at":"2026-07-06T19:07:07.234443Z","submitted_at":"2024-08-28T13:16:41Z","title":"LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15778","snapshot_observed_at":"2026-08-07T15:36:25.488705Z","title":"LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models.arXiv e-prints, art","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.488705Z"},"links":{"cited_paper":"/paper/2408.15778","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:a34aef814c597d5b14aafc134ce16413ea8f1484183fbb6a1e08992324935491","observation_id":"785a96bc-8fa0-4272-9202-7e439a8276d6","resolution":{"observed_at":"2026-08-07T15:36:25.488705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:36:25.576192Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.576192Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:91576cf4c59c6b9f9a0b2dddf639e1be1452764dbb07ab7ca1ffe4b67544aff6","observation_id":"5ca8f435-fefc-481e-b4f0-01eef8010bd0","resolution":{"observed_at":"2026-08-07T15:36:25.576192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00840","last_updated":"2024-10-11T20:08:54Z","snapshot_observed_at":"2026-07-06T13:48:09.566161Z","submitted_at":"2022-09-02T06:50:11Z","title":"FOLIO: Natural Language Reasoning with First-Order Logic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00840","snapshot_observed_at":"2026-08-07T15:36:25.653305Z","title":"Fabbri, Wojciech Kryscinski, Semih Yavuz, Ye Liu, Xi Victoria Lin, Shafiq Joty, Yingbo Zhou, Caiming Xiong, Rex Ying, Arman Cohan, and Dragomir Radev","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.653305Z"},"links":{"cited_paper":"/paper/2209.00840","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:fab8cbb68d24b957aee9d46693d8d46a0dec21065855a6d292b436dad9547cfd","observation_id":"e21f3090-69cb-4441-a937-26476f5fd925","resolution":{"observed_at":"2026-08-07T15:36:25.653305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T15:36:25.695051Z","title":"Measuring Massive Multitask Language Understanding.arXiv e-prints, art","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.695051Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:ad1b313591dfffcb72fbca28897bcef8d8ae55985c12a164fbe3d1bf87d8dd66","observation_id":"4c3de423-2abd-4354-bf75-731cd35682be","resolution":{"observed_at":"2026-08-07T15:36:25.695051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T15:36:25.744056Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.744056Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:0821b19678c67057311ee5c8a4fdfa5358c65a132e6820eea9d392ba8c396b20","observation_id":"d60a46b2-91a1-4466-9e60-646f77eb5b94","resolution":{"observed_at":"2026-08-07T15:36:25.744056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06394","last_updated":"2025-02-15T22:03:16Z","snapshot_observed_at":"2026-08-06T14:14:54.915113Z","submitted_at":"2024-12-09T11:22:59Z","title":"GameArena: Evaluating LLM Reasoning through Live Computer Games","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06394","snapshot_observed_at":"2026-08-07T15:36:25.847549Z","title":"GameArena: Evaluating LLM Reasoning through Live Computer Games.arXiv e-prints, art","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.847549Z"},"links":{"cited_paper":"/paper/2412.06394","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:44f0257f23de464341c84c6ab98222fb76bb7ce5a4b2fc9149ce53f3adac48cc","observation_id":"30692c77-ddd6-4436-9a51-59b1f45ce31e","resolution":{"observed_at":"2026-08-07T15:36:25.847549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-06T02:01:52.978315Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-07T15:36:25.898399Z","title":"Avalonbench: Evaluating llms playing the game of avalon","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.898399Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:b3403ce7b56126df5d239fcbdb5fdf1935ea0ea464f14244172d418a7f13efc2","observation_id":"34943d93-bde3-4456-a1e2-d32ed692a665","resolution":{"observed_at":"2026-08-07T15:36:25.898399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:36:25.931357Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.931357Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:89d6974ef50a911af54899d2fe36ded3b8b22786e801e9cd3261b0b15c58a003","observation_id":"52ff72c7-029b-4f1e-9a56-b601b1d725b7","resolution":{"observed_at":"2026-08-07T15:36:25.931357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-07T15:36:25.977121Z","title":"AgentBench: Evaluating LLMs as Agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.977121Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:943c81ef1223c72a772dcd4c9dfaa8936c819645fa3e2e0a608bf7f9810defea","observation_id":"7b0cadeb-77ee-44b5-b8a5-fdf99487dfc1","resolution":{"observed_at":"2026-08-07T15:36:25.977121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06526","last_updated":"2025-03-01T12:34:10Z","snapshot_observed_at":"2026-08-07T07:07:27.697600Z","submitted_at":"2024-10-09T03:56:50Z","title":"KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06526","snapshot_observed_at":"2026-08-07T15:36:26.040195Z","title":"KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks.arXiv e-prints, art","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.040195Z"},"links":{"cited_paper":"/paper/2410.06526","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:55b5cdbf82a35c10cc5f76c59a4e9ed6000417f74b5a5157901e69106c09fa4f","observation_id":"27c5cf3d-fe22-4478-8d5d-8bbeae278441","resolution":{"observed_at":"2026-08-07T15:36:26.040195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:26.107011Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.107011Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:ae32fa7b015d16e84dce54c834bd7f7e2045db3dcd89fb21a2d272f9fe201b83","observation_id":"9ea2814c-fa27-4ae0-969e-375862834618","resolution":{"observed_at":"2026-08-07T15:36:26.107011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.513760Z","title":"Gpt-4o system card","venue":null,"work_id":"a9d35f55-9011-4379-9e91-93841f6d4442","year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.158524Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:504d7f123a2fe35517ea64697aad0831291efb5188fb5eff37c0c4685be51efb","observation_id":"dd430920-3273-4c6e-97cf-f6be6afeba16","resolution":{"observed_at":"2026-08-07T15:36:31.576336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.315236Z","title":"Learning to reason with llms, 2025","venue":null,"work_id":"31fb5331-f95d-4920-a65c-e17f23c8590b","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.237237Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:45533be3a6bf53a45443f34d2ad19e744dbdbf2851c76e6c4f5cb32b6ea783a0","observation_id":"94d794f0-7200-49ed-91cc-395b891b4b40","resolution":{"observed_at":"2026-08-07T15:36:31.424718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-07T15:36:26.330534Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.330534Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:9d481df71303097fdb4f451b86e0cc195a9e387ee26a96d8004ccd30ca2b0155","observation_id":"42d97dfd-12c3-4939-9300-b48002441423","resolution":{"observed_at":"2026-08-07T15:36:26.330534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:26.428286Z","title":"Suttle, Mengdi Wang, Amrit Singh Bedi, and Dinesh Manocha","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.428286Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:3084f17a6c1b8055aff1ef0a48c196746fed61f51957045a70267585b8250000","observation_id":"eb4bd82a-1258-4ac8-b660-5743f2324925","resolution":{"observed_at":"2026-08-07T15:36:26.428286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T15:36:26.511340Z","title":"Wang, John-Clark Levin, Mstyslav Kazakov, Fiona Feng, Steven Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.511340Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:0c963a0587312199812432d214b76e6e14cc8189af459cee8887403ee0e78ca6","observation_id":"5362a652-7c47-42a1-9c99-e4bea08a1484","resolution":{"observed_at":"2026-08-07T15:36:26.511340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-07T16:00:09.967849Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T15:36:26.588538Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.588538Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:475eb31f6f8ba5f5d653fd3ab1a2bd19675c771ba65387419bc03f3ab7d07a7d","observation_id":"34ceef5a-16a8-4f97-8686-d72cca1ab5ab","resolution":{"observed_at":"2026-08-07T15:36:26.588538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:26.645654Z","title":"Seed-Thinking-v1.5: Advancing Superb Reasoning Models with Reinforcement Learning.arXiv e-prints, art","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.645654Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:55999fc53e3bdbc134fe09e78f9e7616a5b9bc2f15f7ced0f7344d192b92c232","observation_id":"55ab086b-4587-4598-a334-efef2874c8f8","resolution":{"observed_at":"2026-08-07T15:36:26.645654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:31.107967Z","title":"Cryptox : Compositional reasoning evaluation of large language models,","venue":null,"work_id":"c566d582-871d-465b-bbbe-4774dcb9e0cd","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.758939Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:2eb864c9813fca673d5490a28ad84912327272d6958bfc2e32fd1e48cbf67323","observation_id":"deb71e0d-5301-406f-b538-3e69c2cfeb36","resolution":{"observed_at":"2026-08-07T15:36:31.217951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-04T21:50:24.483867Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-07T15:36:26.987937Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.987937Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:a48316ccb5cf293b4de771be8b2c5f6a5615fdb48fbe126ccb57bdcc0fd9d09c","observation_id":"c91341ca-ff33-4a70-8390-a0e84d86120d","resolution":{"observed_at":"2026-08-07T15:36:26.987937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:30.924555Z","title":"Reasonggym","venue":null,"work_id":"22b1fda8-6487-40e0-8e1b-60bb57d0e871","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.072869Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:57c9b4c75f05b09eb62d34a71e92faff16cfef048851709a750cec9b32d34877","observation_id":"50e4d9b4-c505-43fe-8865-ff226a974bbc","resolution":{"observed_at":"2026-08-07T15:36:31.007874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-07-31T03:17:16.042830Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07813","snapshot_observed_at":"2026-08-07T15:36:26.867470Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.867470Z"},"links":{"cited_paper":"/paper/2502.07813","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:8322dea542920f207da7c060a2dabebe490ec0c5254e362f5f59b5a29ca9741f","observation_id":"21535db2-bb2d-4c3f-a2ec-3be81e92849b","resolution":{"observed_at":"2026-08-07T15:36:26.867470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:30.740998Z","title":"Qwen3, 2025","venue":null,"work_id":"de1ce7e6-1ee8-45af-9cc5-44df3ffaf173","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.329175Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:e2bc5f8374323f1973732e5e2b0b00d862dbf4d250761fd196b68498f7c3656f","observation_id":"924c1fd1-cd11-4f80-959f-ed7e886d505d","resolution":{"observed_at":"2026-08-07T15:36:30.840651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:30.529774Z","title":"Qwen-qwq, 2025","venue":null,"work_id":"b5755725-394a-4143-bac7-905cb9255184","year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.436221Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:e4b2ec4d698811146d968ed1a878262016a318d660c48078d30c0e95ad30b13e","observation_id":"c780bb53-f80d-4d1a-a662-10079a746703","resolution":{"observed_at":"2026-08-07T15:36:30.621421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:27.216695Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.216695Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:95d929dfd7f7aba935fdb10d77fcf2b75b39263883cbd3994af10cd26dc2831a","observation_id":"1e34d46f-85a4-4871-a635-de2a514e4af5","resolution":{"observed_at":"2026-08-07T15:36:27.216695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07215","last_updated":"2025-05-12T04:01:03Z","snapshot_observed_at":"2026-08-07T15:48:00.354748Z","submitted_at":"2025-05-12T04:01:03Z","title":"Measuring General Intelligence with Generated Games","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07215","snapshot_observed_at":"2026-08-07T15:36:27.682101Z","title":"Measuring General Intelligence with Generated Games","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.682101Z"},"links":{"cited_paper":"/paper/2505.07215","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:d73a2dd7363ec30e2d84597e93d62d13d536a502455dc3477979416df7d17301","observation_id":"b380370e-9acc-4f3e-a302-b99f85dadf03","resolution":{"observed_at":"2026-08-07T15:36:27.682101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.bea-1.52","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:30.355810Z","title":"Evaluating reading comprehension exercises generated by LLMs: A showcase of ChatGPT in education applications","venue":null,"work_id":"a453f69f-6079-4901-b24e-9ab96a53dd31","year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.748039Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:12cd4afac3ca596c6268c2de5d20f0c3eac535dce940854b6319a8e621c5bff4","observation_id":"1a57d53b-cf90-4b11-9a0c-2e830e259b99","resolution":{"observed_at":"2026-08-07T15:36:30.434502Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-07T15:36:27.571656Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.571656Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:b1a5f84c1535c2f7012ace08cbca0ceff842601553cc209e2378276644939a7a","observation_id":"12dc98fb-b338-4158-be69-e4aeaa26ef59","resolution":{"observed_at":"2026-08-07T15:36:27.571656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04658","last_updated":"2024-05-11T07:08:16Z","snapshot_observed_at":"2026-08-05T22:16:53.109945Z","submitted_at":"2023-09-09T01:56:40Z","title":"Exploring Large Language Models for Communication Games: An Empirical Study on Werewolf","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04658","snapshot_observed_at":"2026-08-07T15:36:27.888031Z","title":"Exploring large language models for communication games: An empirical study on werewolf.arXiv preprint arXiv:2309.04658, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.888031Z"},"links":{"cited_paper":"/paper/2309.04658","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:d02d7beced103d45df2433a59dd5ac69349248a9526d6dd087f7892469ea27f2","observation_id":"7fd0e5d2-d6ce-4b80-ae3a-2cb1f4450964","resolution":{"observed_at":"2026-08-07T15:36:27.888031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:27.945596Z","title":"SPIN-Bench: How Well Do LLMs Plan Strategically and Reason Socially? arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.945596Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:565c31ef2964e47599ab4d1979b3e53e7c63935ab440f519529c3aec104b0b28","observation_id":"d63088b6-d85d-422e-bcfb-f322d7c7aa8b","resolution":{"observed_at":"2026-08-07T15:36:27.945596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01622","last_updated":"2024-10-23T15:02:57Z","snapshot_observed_at":"2026-08-03T17:10:32.264100Z","submitted_at":"2024-02-02T18:39:51Z","title":"TravelPlanner: A Benchmark for Real-World Planning with Language Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01622","snapshot_observed_at":"2026-08-07T15:36:27.825926Z","title":"Travelplanner: A benchmark for real-world planning with language agents.arXiv preprint arXiv:2402.01622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:27.825926Z"},"links":{"cited_paper":"/paper/2402.01622","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:3e6cb978ffe1a1b65cd1336264cd950dc15b649478f7f7253322c87def585b8a","observation_id":"bd4733b0-9070-470a-b16c-076790d5aa46","resolution":{"observed_at":"2026-08-07T15:36:27.825926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:36:28.095327Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.095327Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:7c25c6964273002bd2ddf4fa693e3d11825b38ec72b70d2573c467c0f1723671","observation_id":"cda1f626-b060-455b-89a8-a02f3d16b44e","resolution":{"observed_at":"2026-08-07T15:36:28.095327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:28.037737Z","title":"Spin-bench: How well do llms plan strategically and reason socially?arXiv preprint arXiv:2503.12349, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.037737Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:15c5813c407a7c4ecff6c7d47ada648ad5029b41bb89487656ce80a5422921c4","observation_id":"7ff2f81f-da54-401b-a0d4-6f12a89bf8ac","resolution":{"observed_at":"2026-08-07T15:36:28.037737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:30.199754Z","title":null,"venue":null,"work_id":"bb35c3e2-ad61-41a5-bd9c-b66fd2614204","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.157840Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:f67ac980b98619b3149af19f8655bb2a1a0485268ceb042392326c17848eef20","observation_id":"486d6cb4-8d90-4981-8442-87b25c809cf5","resolution":{"observed_at":"2026-08-07T15:36:30.287513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:29.967152Z","title":null,"venue":null,"work_id":"8fd5e5c4-2e69-4051-9e03-8bf38e970bff","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.221860Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:5fed9a19f1fbb8b2a5c45134d3e43355f639d408b67e429c395c0fc2740acc28","observation_id":"e824cf0e-3958-4ea0-9063-12e665a7e527","resolution":{"observed_at":"2026-08-07T15:36:30.084809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:29.726698Z","title":"P (Q → A | R, K) ≈ P (Q → A | R) ≫ P (Q → A | K)","venue":null,"work_id":"1f7178f1-09d8-48d2-b638-994d0503a1de","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.403723Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:545695de30733d1019627288d2235132fc5e6b7651c83bf79681aff3339be51e","observation_id":"9e0ba033-0a14-4fd0-8542-7879ef4e97c3","resolution":{"observed_at":"2026-08-07T15:36:29.839405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:29.580946Z","title":"P (Q → A | R, K) =P (Q → A | R) · (1 +β) 19 C Detailed Scores on KORGym Table 7 Mathematical and logical reasoning abilities of different models on KORGym","venue":null,"work_id":"1cdf5ad7-907f-41b0-9fde-f5661f5aef1d","year":2024},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.526144Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:03e1b3886874b8c6fac86825337f89d62c0b61ef76d6e3b5481e9c6e55f7ce2e","observation_id":"74904f33-5630-477e-a0f7-ead6468311fc","resolution":{"observed_at":"2026-08-07T15:36:29.632711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2410.03131","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:28.919590Z","title":null,"venue":null,"work_id":"80a430aa-f01e-4bb7-9bf8-5f20d445d2c0","year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.457130Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:3b0d4062329259506b8cabd5fec6f127ab2bb3f693cc092b412054a882cc304d","observation_id":"494c182e-e177-4d2f-8803-949577c538c2","resolution":{"observed_at":"2026-08-07T15:36:29.035805Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:26.714925Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.714925Z"},"links":{"citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:e6108259e22e051e87e1dd90271d7e27142f795323eae694c0b1b02d10c8ca46","observation_id":"dfe2aae8-85be-4162-9a00-4a53893e83c5","resolution":{"observed_at":"2026-08-07T15:36:26.714925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T15:30:04.786859Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 5 inbound Pith citation observations for arXiv:2505.14552."}