{"as_of":"2026-08-09T05:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a76e30538b580306be417fa8153a15f0de347e15963c7151b67a4b9e3198868","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:35:52.198507Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:13:15.414661Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T21:05:04.650707Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21188","snapshot_observed_at":"2026-08-03T10:13:15.414661Z","title":"Mirage or method? how model-task alignment induces divergent rl conclu- sions.arXiv preprint arXiv:2508.21188, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-03T10:12:41.166350Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:15.414661Z"},"links":{"cited_paper":"/paper/2508.21188","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:07c30e2ffbcd72d4a82f761657aba30585a6624004356016ba5d0f15ac693281","observation_id":"efa8a444-62f3-40aa-86a1-443620487913","resolution":{"observed_at":"2026-08-03T10:13:15.414661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"cited_work":{"arxiv_id":"2508.21188","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21188","snapshot_observed_at":"2026-06-30T21:05:04.650707Z","title":"Mirage or method? how model-task alignment induces divergent rl conclusions, 2025","venue":null,"work_id":"f8eaecc2-84bd-45fc-99cd-b34f91d73b68","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2508.21188","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:067fb23792f9255fd19fe61711dfba52b2183ca39f1a55c15e29445b1507fd75","observation_id":"6bf40004-0e52-4f1a-958a-38305042e275","resolution":{"observed_at":"2026-06-30T21:05:04.652492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.21188/citation-record","integrity":"/paper/2508.21188/integrity","json":"/paper/2508.21188/citation-record.json","paper":"/paper/2508.21188"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T14:35:50.599957Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:50.599957Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:5ec6ffa77bd8297a5a6c5edf705964a95dafbebb989f42714a873d68afdf6bae","observation_id":"d91e600d-092a-47f8-aa07-3c2213d50cbb","resolution":{"observed_at":"2026-08-05T14:35:50.599957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-05T14:35:50.713715Z","title":"Mehran Kazemi, Bahare Fatemi, Hritik Bansal, John Palowitch, Chrysovalantis Anastasiou, San- ket Vaibhav Mehta, Lalit K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:50.713715Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:6ecba38e4780534a53a428e4925819ddcda167e140233ccfcc6afa1dfa628a30","observation_id":"4a52c702-ba68-4ee9-9539-dc89e4ac3154","resolution":{"observed_at":"2026-08-05T14:35:50.713715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19187","last_updated":"2025-05-06T15:11:32Z","snapshot_observed_at":"2026-08-07T17:46:00.833139Z","submitted_at":"2025-02-26T14:50:50Z","title":"BIG-Bench Extra Hard","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19187","snapshot_observed_at":"2026-08-05T14:35:50.806216Z","title":"Aitor Lewkowycz, Anders Andreassen, David Dohan, Ethan Dyer, Henryk Michalewski, Vinay Ra- masesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman-Solo, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:50.806216Z"},"links":{"cited_paper":"/paper/2502.19187","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:7451d3bd40f212243411ffce598863a710325c97fb83f4e56a52c7415f0a66a6","observation_id":"920baffd-8102-4ed6-a9a0-9c5665ef8fb3","resolution":{"observed_at":"2026-08-05T14:35:50.806216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19641","last_updated":"2025-06-04T05:08:08Z","snapshot_observed_at":"2026-08-07T14:07:26.838295Z","submitted_at":"2025-05-26T07:59:36Z","title":"SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19641","snapshot_observed_at":"2026-08-05T14:35:50.883516Z","title":"Michael Luo, Sijun Tan, Justin Wong, Xiaoxiang Shi, William Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:50.883516Z"},"links":{"cited_paper":"/paper/2505.19641","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:a545d6781786f1b7c4517a6f53a036da489ef9c16ee2e2db967a1585c506192d","observation_id":"e75d04a6-b8f8-4f1a-b647-0042b164180d","resolution":{"observed_at":"2026-08-05T14:35:50.883516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-08-05T14:35:50.973056Z","title":"Ang Lv, Ruobing Xie, Xingwu Sun, Zhanhui Kang, and Rui Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:50.973056Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:1b5de5e91d8d7df46a4865d4d5b79893679f97dac3146f9f7c66739669c04cd4","observation_id":"44a3cdc7-cb6d-4f98-8329-29478b16b20e","resolution":{"observed_at":"2026-08-05T14:35:50.973056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06526","last_updated":"2025-03-01T12:34:10Z","snapshot_observed_at":"2026-08-08T18:24:11.820620Z","submitted_at":"2024-10-09T03:56:50Z","title":"KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06526","snapshot_observed_at":"2026-08-05T14:35:51.058824Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.058824Z"},"links":{"cited_paper":"/paper/2410.06526","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:0384defb7b6d862fc553c5ec2b87cd1ace6356e1385f40fec3b0e9aca1040941","observation_id":"ba9d74c3-dfff-40d4-a8b7-f1245ac45eb0","resolution":{"observed_at":"2026-08-05T14:35:51.058824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T14:35:51.138696Z","title":"Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.138696Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:422d8a39615e0f59d7da9fef8ac511c5442e40b2f803587079d752c4d3571226","observation_id":"b6f85f85-7ff3-4df7-ac01-01f864a1883f","resolution":{"observed_at":"2026-08-05T14:35:51.138696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T14:35:51.218027Z","title":"Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.218027Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:3a7a981ce5315b3be8e2e9d82b18bde42cff4d1a4fd601e798ac11e6ccb5efb2","observation_id":"360502bb-0bf8-443c-8b4b-c54c739bc552","resolution":{"observed_at":"2026-08-05T14:35:51.218027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-05T14:35:51.290902Z","title":"Rulin Shao, Shuyue Stella Li, Rui Xin, Scott Geng, Yiping Wang, Sewoong Oh, Simon Shaolei Du, Nathan Lambert, Sewon Min, Ranjay Krishna, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.290902Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:40faded5f0531730db15ebaf337b45da7c03562e3a394de67895e496d2f931cf","observation_id":"44f72023-4147-499e-a3ee-f9bc4bef15eb","resolution":{"observed_at":"2026-08-05T14:35:51.290902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-05T14:35:51.350639Z","title":"Mastering chess and shogi by self-play with a general reinforcement learning algorithm, 2017a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.350639Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:7129b2f59b4f29d834bb7bc964035848c61666ba57a372e4a5a7dd698b6b9f96","observation_id":"cde19674-1179-4713-ad61-86d99b27d526","resolution":{"observed_at":"2026-08-05T14:35:51.350639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-05T14:35:51.606028Z","title":"Yiping Wang, Qing Yang, Zhiyuan Zeng, Liliang Ren, Liyuan Liu, Baolin Peng, Hao Cheng, Xuehai He, Kuan Wang, Jianfeng Gao, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.606028Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:a7f0842c4727831e17bdc3237e8ef93464eef015891dd289b099a83d892568bc","observation_id":"8ee51b7f-ac07-47e9-89b6-74018e1af83f","resolution":{"observed_at":"2026-08-05T14:35:51.606028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:35:51.701515Z","title":"Reasoning or memorization? unreliable results of reinforcement learning due to data contamination","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.701515Z"},"links":{"citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:ed3dfba6379061d463c0af68dc3efe4feb309508fba184aa128d61cdea4eae26","observation_id":"dd79800b-fecd-405a-a6fd-aafd6af5ed3f","resolution":{"observed_at":"2026-08-05T14:35:51.701515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T14:35:51.798748Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.798748Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:075706ee26a1367308141bad3f97da287cdb5ed1b17e59d5cf972c783c7cce14","observation_id":"6928d6d9-b19f-44b0-8891-3e26d347ef82","resolution":{"observed_at":"2026-08-05T14:35:51.798748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T14:35:51.888457Z","title":"Xinyu Zhu, Mengzhou Xia, Zhepei Wei, Wei-Lin Chen, Danqi Chen, and Yu Meng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.888457Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:70221b7e4957989e0e10fecf648cd70a8e19b38878f0d8e99720894d4142c90e","observation_id":"77b662ac-1ccc-4f5c-8e8b-06c47cd8619c","resolution":{"observed_at":"2026-08-05T14:35:51.888457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:35:51.980645Z","title":"Daniel M Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B Brown, Alec Radford, Dario Amodei, Paul Christiano, and Geoffrey Irving","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.980645Z"},"links":{"citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:fa273b2f55d42c6da02c183be015950c9cf8582879a85221f9821469e34a7957","observation_id":"f521cb35-0606-48b9-995f-748399cf3d8b","resolution":{"observed_at":"2026-08-05T14:35:51.980645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:35:53.044669Z","title":"The format reward is different from that of Shao et al","venue":null,"work_id":"ec73df89-5096-48cf-af4e-14eb3500c090","year":2025},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:52.102509Z"},"links":{"citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:199214e3801051740cf5535a12ce73376b8b3266b203f8e6a41b02f43e0f74ee","observation_id":"65520dd4-4391-4260-b429-56cd12c0c684","resolution":{"observed_at":"2026-08-05T14:35:53.101114Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:35:52.909840Z","title":null,"venue":null,"work_id":"14a2c743-9d8e-4c8d-9ef6-1a64d9ab79fb","year":2024},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:52.198507Z"},"links":{"citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:b077554f13adab41c90983b3c69e380e9a1d96720a2927b8b8cc2629b7a561c1","observation_id":"3b774ea2-a172-4f3a-91cc-561c70806613","resolution":{"observed_at":"2026-08-05T14:35:52.956984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-05T14:35:51.402781Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.402781Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:d12eecca9de382fa005df87cb00b95d8d027c05149f809035ae99187c1025df1","observation_id":"f0ac64dc-1cd8-42bb-a316-3a8140bbfc4c","resolution":{"observed_at":"2026-08-05T14:35:51.402781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-05T14:35:52.017655Z","title":"Ttrl: Test-time reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:52.017655Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:cd125e24d7d5181684e70df4697a7966316e51d580b05f5f283ee4b294b4389e","observation_id":"505fbb72-68cb-49d4-bd23-1aa857ad6973","resolution":{"observed_at":"2026-08-05T14:35:52.017655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T14:35:50.660785Z","title":"Aaron Jaech, Adam Kalai, Adam Lerer, Adam Richardson, Ahmed El-Kishky, Aiden Low, Alec Helyar, Aleksander Madry, Alex Beutel, Alex Carney, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:50.660785Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:1b68bfc044fb299b2d3dbe2dfa40d8835c22e744f46147be7516720f26194ca5","observation_id":"b25332ec-6417-42d4-a68f-75cfce780dbf","resolution":{"observed_at":"2026-08-05T14:35:50.660785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T14:35:51.511047Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:51.511047Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:7f2420ad8146bd6de2ff38e2019c3bbd5f3b01a5e59179d50b2205d2e62a64ea","observation_id":"7925ea58-f691-467b-9db3-a47591b3db85","resolution":{"observed_at":"2026-08-05T14:35:51.511047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:35:53.191918Z","title":"Jiangjie Chen, Qianyu He, Siyu Yuan, Aili Chen, Zhicheng Cai, Weinan Dai, Hongli Yu, Qiying Yu, Xuefeng Li, Jiaze Chen, Hao Zhou, and Mingxuan Wang","venue":null,"work_id":"ef5715f2-562e-4ef4-bfe1-146e068e641a","year":2025},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:50.447943Z"},"links":{"citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:b7b31247c37066ecfb2840adb94a3d8b53df720bf0d8269a8517005edbc1b01e","observation_id":"92c72353-49a2-4e9c-9e84-ad284e08276f","resolution":{"observed_at":"2026-08-05T14:35:53.294734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:35:53.392314Z","title":null,"venue":null,"work_id":"42a94dec-b7d5-4eda-8673-87eef5e21065","year":2025},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:50.378699Z"},"links":{"citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:2151cd508d354dbb2428773c13e9e383bff3252ff767737058204ff9bbcaef0d","observation_id":"c47a4f8d-25df-4038-a11b-b53762be1fb8","resolution":{"observed_at":"2026-08-05T14:35:53.457163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19914","last_updated":"2025-06-09T07:49:32Z","snapshot_observed_at":"2026-08-07T16:09:17.796555Z","submitted_at":"2025-05-26T12:40:31Z","title":"Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19914","snapshot_observed_at":"2026-08-05T14:35:50.493578Z","title":"Yanjun Chen, Dawei Zhu, Yirong Sun, Xinghao Chen, Wei Zhang, and Xiaoyu Shen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:50.493578Z"},"links":{"cited_paper":"/paper/2505.19914","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:6503fad80c42c772d2546effa48186935ffe2bcae0c0a20f2c452b2dd485c8da","observation_id":"a5b5ccbf-b8d3-43df-b2f1-c22b04f2d239","resolution":{"observed_at":"2026-08-05T14:35:50.493578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T16:09:49.884784Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 2 inbound Pith citation observations for arXiv:2508.21188."}