{"as_of":"2026-08-08T08:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:daa9778b1a88328b400a10247efa471febf7bb582d708d553ff4998769401577","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:53:04.687922Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:51:25.044392Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:30:01.593067Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-08-07T14:34:03.334852Z","title":"Can one domain help others? a data-centric study on multi-domain reasoning via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18499","last_updated":"2025-08-19T01:33:43Z","snapshot_observed_at":"2026-08-08T06:34:29.525332Z","submitted_at":"2025-05-24T04:33:41Z","title":"G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:03.334852Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2505.18499"},"observation_digest":"sha256:fc0dde65c647ab611bf104f0fd8727dfefbd7873f0afc5c9b3d383011d1696a2","observation_id":"fd3b1ad9-d1ca-4d57-b2a2-a2d6d004ee21","resolution":{"observed_at":"2026-08-07T14:34:03.334852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2603.23964","last_updated":"2026-04-13T08:15:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-25T05:56:54Z","title":"From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments","version":2},"reference_index":205,"source":"pdf_text","source_observed_at":"2026-05-15T01:20:03.181903Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2603.23964"},"observation_digest":"sha256:ec73c19c88804b7be11a390941b11ec59da75507cb1c65eaa76e0f4095177a80","observation_id":"9b320f60-a5de-4d56-91f8-c19802459a26","resolution":{"observed_at":"2026-05-15T01:23:27.214745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2604.10480","last_updated":"2026-04-12T06:24:07Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T06:24:07Z","title":"Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:14:38.371700Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2604.10480"},"observation_digest":"sha256:83946372e34cd325dc215c90c99e358157d3a2701bf6d46639f53fb7e4fac9cf","observation_id":"868a42ff-7788-4660-89ec-71efa5ffe279","resolution":{"observed_at":"2026-05-11T09:06:00.589898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2606.11052","last_updated":"2026-06-09T16:17:19Z","snapshot_observed_at":"2026-08-05T14:17:36.486236Z","submitted_at":"2026-06-09T16:17:19Z","title":"Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T13:08:57.218711Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2606.11052"},"observation_digest":"sha256:9336cf1c086722d7c60a53731985a289927082cb2b6a7a2ba2974a229c69e426","observation_id":"a0e06f9f-0451-42f5-839a-a005cbc642e2","resolution":{"observed_at":"2026-07-03T05:37:40.383704Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2606.17682","last_updated":"2026-06-16T08:48:58Z","snapshot_observed_at":"2026-08-01T05:53:08.805029Z","submitted_at":"2026-06-16T08:48:58Z","title":"From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T00:59:50.038405Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2606.17682"},"observation_digest":"sha256:5e09ea66fc3c0fd1be7b3b9ef532268573b2e0ea4cfffae3151e5517efa27cdf","observation_id":"580515ac-9341-46d5-9a85-50c4309ae4a5","resolution":{"observed_at":"2026-07-03T20:58:58.333309Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2606.25178","last_updated":"2026-06-27T02:34:55Z","snapshot_observed_at":"2026-07-30T22:09:19.101343Z","submitted_at":"2026-06-23T21:10:29Z","title":"Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-25T22:47:09.330723Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2606.25178"},"observation_digest":"sha256:22655e48b4a1917ab170f7c6cb4d4d5d72c41a958c2f1423e8aab2e0c6e15141","observation_id":"5b202722-a2a8-4412-82fa-adf9ed5d7520","resolution":{"observed_at":"2026-07-04T18:30:01.594743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2606.25178","last_updated":"2026-06-27T02:34:55Z","snapshot_observed_at":"2026-07-30T22:09:19.101343Z","submitted_at":"2026-06-23T21:10:29Z","title":"Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T09:55:19.804589Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2606.25178"},"observation_digest":"sha256:9ebf816de5a2af5dc497065acbe711fb627218dbfd5cecc86f0315fd78f3bd5e","observation_id":"e3968d58-d029-4d7f-a656-7917cb6cc049","resolution":{"observed_at":"2026-06-30T12:54:40.490774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-08-04T21:54:44.286875Z","title":"arXiv preprint arXiv:2507.17512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T06:30:11.819425Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.286875Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:8906727aae311b7a6f5fa530763e12cfd03159f92fb1bc80382347c9251bbade","observation_id":"b0b85819-9a32-450d-990c-f7710a6cf889","resolution":{"observed_at":"2026-08-04T21:54:44.286875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-08-08T00:51:25.044392Z","title":"arXiv preprint arXiv:2507.17512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-08T07:12:54.035621Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.044392Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:abe0e0bc5519d0dbc88fd56c3f8e0747158481d14f3c161c73266b1301c731a1","observation_id":"c2ae80be-b48c-4a30-8693-dbf3e39bd428","resolution":{"observed_at":"2026-08-08T00:51:25.044392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17512/citation-record","integrity":"/paper/2507.17512/integrity","json":"/paper/2507.17512/citation-record.json","paper":"/paper/2507.17512"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.403637Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.403637Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:c9548fed645ca717048f2033d550bc24428566ca276fde1bac01a5fb6e6694c2","observation_id":"8540c431-317c-4b6c-a656-283e69872171","resolution":{"observed_at":"2026-08-06T14:53:04.403637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:06.227739Z","title":"The logic puzzle baron dataset","venue":null,"work_id":"c3dd7b81-b12c-4e03-810f-55488ea5bc2c","year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.410008Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:f4a6928d718bc8e8ebf0fa30065b6dd150a40bf93a040d8df44a80164466c65d","observation_id":"464c56b1-320b-4356-b72a-904b3294ae01","resolution":{"observed_at":"2026-08-06T14:53:06.233755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T14:53:04.416178Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.416178Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:a1dc1d68b6400d63d69c15b26fbcca5e27a14b947fa23b4e4cce6d32e3c3e9a4","observation_id":"36c4b4ae-a02e-4d87-8706-ad3c159a4e66","resolution":{"observed_at":"2026-08-06T14:53:04.416178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.422667Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.422667Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:d55fa1ff6dee3e1a66b7d8ad613841b9df5332dca93b53790e77440f1b762ebc","observation_id":"aec1e64f-9f69-469d-95c6-bdf1145e592d","resolution":{"observed_at":"2026-08-06T14:53:04.422667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.428206Z","title":"Self-evolving curriculum for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.428206Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:8177ee7e1df2c767e58e46e89869d21f86437261b2a95f27775f3fa6344d05be","observation_id":"50bab17c-3824-428f-bc18-762d56417cda","resolution":{"observed_at":"2026-08-06T14:53:04.428206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-06T14:53:04.433304Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.433304Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:52069dc75bfa7470996d89de773592d538cfefa845d846eb315965d442302783","observation_id":"b9bdd950-b7f5-4e21-a924-d2cb42fa0ff3","resolution":{"observed_at":"2026-08-06T14:53:04.433304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.440151Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.440151Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:07d6b8e9a76263d7817613112aaae721e0ff4ba177e1247120e74559c3dbd170","observation_id":"db7dce01-0a46-45a0-bb37-0a54dfe30f21","resolution":{"observed_at":"2026-08-06T14:53:04.440151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T14:53:04.446447Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.446447Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:9be55506730532c266e2e1950c6f536149af17c64b72f1a6603b9fb7e0fd37be","observation_id":"24e56876-24b6-4871-9f3c-a7b0858efbec","resolution":{"observed_at":"2026-08-06T14:53:04.446447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10541","last_updated":"2024-11-15T19:26:38Z","snapshot_observed_at":"2026-07-06T19:51:09.829522Z","submitted_at":"2024-11-15T19:26:38Z","title":"Does Prompt Formatting Have Any Impact on LLM Performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10541","snapshot_observed_at":"2026-08-06T14:53:04.452317Z","title":"Does prompt formatting have any impact on llm performance?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.452317Z"},"links":{"cited_paper":"/paper/2411.10541","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:08dc784039e60d302fe29b421aac3b5dfd19b812e1bbd7b8c4da53b086d312fd","observation_id":"5e7aed1c-a2a7-43bd-b6f3-d7e3c7508252","resolution":{"observed_at":"2026-08-06T14:53:04.452317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.459338Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.459338Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:e1e9c8fc06dd516b48cbe10b2aaf18b9e197def8748dd7b16d69848ee4df4b4d","observation_id":"b9856231-50db-48a3-b3a6-f705f7c8002f","resolution":{"observed_at":"2026-08-06T14:53:04.459338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T14:53:04.466420Z","title":"Open- reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.466420Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:c6a2fd46d760e8d559b6686d388a600c86899ec5e1d9a1228c549ddd581ebbf3","observation_id":"feed8f47-1a9a-4384-a9c7-ed405b8148db","resolution":{"observed_at":"2026-08-06T14:53:04.466420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:06.156540Z","title":"Curricularface: adaptive curriculum learning loss for deep face recognition","venue":null,"work_id":"ee171894-4aba-4160-b693-3d8c05759807","year":2020},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.472280Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:bebc2295fae30dd84b989e9f48d47259a7f7d2e990f2acac237f38cc4811ca33","observation_id":"51949e84-a341-4780-b585-e1b79be1963d","resolution":{"observed_at":"2026-08-06T14:53:06.164700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12935","last_updated":"2025-01-07T04:42:20Z","snapshot_observed_at":"2026-07-06T18:33:15.701836Z","submitted_at":"2024-06-17T03:03:34Z","title":"ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12935","snapshot_observed_at":"2026-08-06T14:53:04.480460Z","title":"Chatbug: A common vulnerability of aligned llms induced by chat templates, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.480460Z"},"links":{"cited_paper":"/paper/2406.12935","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:8f02f69e4e135be956cbd7ee6868d27ddce0648b5440c605e8caf4913f5e9f73","observation_id":"3b5b79ad-7d6a-4e51-b6ee-a8edd4a7b281","resolution":{"observed_at":"2026-08-06T14:53:04.480460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:06.136851Z","title":"Adaptive curriculum learning","venue":null,"work_id":"661e0a56-286b-4713-a67f-bf72c79f8ce3","year":2021},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.485559Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:1d14eb2c512e6deb87ab11fe4baf6d3b18a869574ad3d87bc4b8d237413b40d0","observation_id":"b249235c-fc04-4432-860f-86db0789011f","resolution":{"observed_at":"2026-08-06T14:53:06.142850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-06T14:53:04.490769Z","title":"Taco: Topics in algorithmic code generation dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.490769Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:33b4aade035f1e4ae65aa60072167d3c42809a21d2f37f21d06d30938680958a","observation_id":"261eacb5-8c18-4f70-be85-b4b4db4152cc","resolution":{"observed_at":"2026-08-06T14:53:04.490769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19093","last_updated":"2025-04-27T03:41:17Z","snapshot_observed_at":"2026-08-07T15:58:53.969652Z","submitted_at":"2025-04-27T03:41:17Z","title":"CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges","version":1},"cited_work":{"arxiv_id":"2504.19093","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.19093","snapshot_observed_at":"2026-08-06T14:53:05.616482Z","title":"CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges","venue":"cs.CR","work_id":"707b4bc7-43f0-4149-b1d4-e85e02c52817","year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.495978Z"},"links":{"cited_paper":"/paper/2504.19093","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:783060389b5c0f9d5cf3253249fec313112230552639c8aef054113571f4a689","observation_id":"5794391c-270b-4b53-994c-3bcafb3f61d8","resolution":{"observed_at":"2026-08-06T14:53:05.622671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01100","last_updated":"2025-07-15T01:14:25Z","snapshot_observed_at":"2026-08-07T15:35:39.413072Z","submitted_at":"2025-02-03T06:44:49Z","title":"ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01100","snapshot_observed_at":"2026-08-06T14:53:04.502280Z","title":"Zebralogic: On the scaling limits of llms for logical reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.502280Z"},"links":{"cited_paper":"/paper/2502.01100","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:24d3ec6c40552aa4defde6df8418891b2017f71f9626c65b2d975671c5b3ddb5","observation_id":"0c02e523-1b76-405a-a274-961ce3ec2b8b","resolution":{"observed_at":"2026-08-06T14:53:04.502280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.507621Z","title":"Code-r1: Reproducing r1 for code with reliable rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.507621Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:ea97aeebb6aed49a6552a066f25288b778e8d5a33add07ff211cb760601872fd","observation_id":"0c83de3e-6965-4c84-83dc-a110bbc069b0","resolution":{"observed_at":"2026-08-06T14:53:04.507621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-06T14:53:04.512694Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.512694Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:7d90d277eb0fb325044a6f69a58fa8d1f56900836f63bded98980b145f8f1571","observation_id":"3dd56042-bd00-4b39-9500-092af60b8646","resolution":{"observed_at":"2026-08-06T14:53:04.512694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T14:53:04.518303Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.518303Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:2a6b33763e072da878526c50d12d37a2e4a4f07b85acae04260df693b9082f63","observation_id":"f4a4d1ef-71e3-4ae2-8d71-3a57ec56a047","resolution":{"observed_at":"2026-08-06T14:53:04.518303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:05.948115Z","title":"Deepscaler: Sur- passing o1-preview with a 1.5b model by scaling rl","venue":null,"work_id":"557f5e36-b53e-4acd-8ce9-058e47582858","year":null},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.524453Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:47baaaedcfa9229613a5385fdd1600a5eef88e9df6bacf59d4456a41364b6b96","observation_id":"27c200c6-d8f8-460b-9b1f-604d7cd6228f","resolution":{"observed_at":"2026-08-06T14:53:05.956790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.529918Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.529918Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:ddee7f755d93748a951dfe15d8bdd2f8bfd6e3cff7320eb684d86d0956e3aeb2","observation_id":"c6d95a42-802e-42a9-9bd9-fdee215ffeaf","resolution":{"observed_at":"2026-08-06T14:53:04.529918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17439","last_updated":"2025-05-30T15:19:51Z","snapshot_observed_at":"2026-08-07T16:45:50.800051Z","submitted_at":"2025-03-21T17:59:10Z","title":"LEMMA: Learning from Errors for MatheMatical Advancement in LLMs","version":2},"cited_work":{"arxiv_id":"2503.17439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17439","snapshot_observed_at":"2026-08-06T14:53:05.522601Z","title":"LEMMA: Learning from Errors for MatheMatical Advancement in LLMs","venue":"cs.LG","work_id":"0695bd15-1101-44e4-b2e3-ea9af7b293e5","year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.535669Z"},"links":{"cited_paper":"/paper/2503.17439","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:9e73c982f539e0978213fe82742423c6ddc9497120d5462b190fd30de3c41f61","observation_id":"7a590a8f-5024-4596-8016-5eadc3dde457","resolution":{"observed_at":"2026-08-06T14:53:05.531253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10541","last_updated":"2025-07-15T06:16:53Z","snapshot_observed_at":"2026-08-07T21:54:43.368485Z","submitted_at":"2025-07-14T17:58:47Z","title":"REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10541","snapshot_observed_at":"2026-08-06T14:53:04.542163Z","title":"Vicky Zhao, Conghui He, and Lijun Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.542163Z"},"links":{"cited_paper":"/paper/2507.10541","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:8227380d0d510499bf4695783359523a01ab9eb82df56e15343314939ba7a07c","observation_id":"b4698c59-ecbb-4409-b14c-54f31f80b53c","resolution":{"observed_at":"2026-08-06T14:53:04.542163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.548107Z","title":"Curriculum reinforcement learning from easy to hard tasks improves llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.548107Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:64080946b3531ce3927777acb2b6652076ff315ac2439bd041ceb7261bbc2ef6","observation_id":"4600ec2e-47c3-431b-93fc-a06241d32518","resolution":{"observed_at":"2026-08-06T14:53:04.548107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16212","last_updated":"2025-06-16T05:58:00Z","snapshot_observed_at":"2026-08-07T16:48:57.884796Z","submitted_at":"2025-03-20T15:00:41Z","title":"MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16212","snapshot_observed_at":"2026-08-06T14:53:04.553391Z","title":"Mathfusion: Enhancing mathematical problem-solving of llm through instruction fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.553391Z"},"links":{"cited_paper":"/paper/2503.16212","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:e1ef2266c0521fa2b725c0cd03a14b970515d64404e164167a05200afc713147","observation_id":"53c1ef05-4ca3-4a33-b9c0-7412ce87bb1c","resolution":{"observed_at":"2026-08-06T14:53:04.553391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T14:53:04.559294Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.559294Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:02d30bba3649317bc93b4973b75d5e329f022e742122ed510000788ce4f9e6ed","observation_id":"077eda26-b9da-431c-8fa9-41f7b564eaea","resolution":{"observed_at":"2026-08-06T14:53:04.559294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-07T23:13:03.546164Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-06T14:53:04.564942Z","title":"Magistral","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.564942Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:1b31e042907f0795c5416af364a54d4fcbdce845eb8835854afee6e877b3a512","observation_id":"47fa10e6-114b-4b08-b746-7b13c998cd2c","resolution":{"observed_at":"2026-08-06T14:53:04.564942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T14:53:04.570905Z","title":"Proximal policy optimiza- tion algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.570905Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:12c8704544a8f91d83c89cfb1d8146e50920687a6f462fa330a357acd39589ef","observation_id":"7957b7bc-3abb-4142-aca0-64e57cae02a1","resolution":{"observed_at":"2026-08-06T14:53:04.570905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T14:53:04.577219Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.577219Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:180375c8a91ccea05a1b94cf04871b475337f27526304b919550a20479eff28e","observation_id":"e594da3a-4ceb-47cd-ba87-bc49fec21a34","resolution":{"observed_at":"2026-08-06T14:53:04.577219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T14:53:04.582727Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.582727Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:7f19d99ec3d1932aa8b7a111fd2eaf3d79c233338dbb7e419e43ce94c78b7752","observation_id":"d22d86bc-084c-4173-b982-0f7168f298a1","resolution":{"observed_at":"2026-08-06T14:53:04.582727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:05.917080Z","title":"Template matters: Understanding the role of instruction templates in multimodal language model evaluation and training","venue":null,"work_id":"746dbf3f-4ddf-4bd1-917c-da6e47e997e5","year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.589065Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:f2a0524ad328dfbe2b7e79eb970f087181e646db79085a0ed7f1013d3fcf313d","observation_id":"4997eec7-ee4f-4ac5-9d6e-a3b5f46a16d6","resolution":{"observed_at":"2026-08-06T14:53:05.922540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.593968Z","title":"Dump: Automated distribution-level curriculum learning for rl-based llm post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.593968Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:3216eded65dc2d7937c95b58c3b593b72762fc9d978a6817d7760a6888f78691","observation_id":"94f85e59-22da-4291-a53f-247c92d11336","resolution":{"observed_at":"2026-08-06T14:53:04.593968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-08T01:11:14.602172Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-06T14:53:04.599526Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.599526Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:d03e07a3b9fca0d61a5685b115cfac5795d0e774e2b1a51750435998cece1199","observation_id":"f940d917-eda9-44d6-8168-e3c54efb1326","resolution":{"observed_at":"2026-08-06T14:53:04.599526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.605833Z","title":"Rlvr-world: Training world models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.605833Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:d94a30784fd24f612f776d45a526824e26b4b28f25a5655351ecce5d1d3bfb89","observation_id":"69731711-117f-4cc1-9a86-23b321ce36c5","resolution":{"observed_at":"2026-08-06T14:53:04.605833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14655","last_updated":"2025-04-20T15:28:16Z","snapshot_observed_at":"2026-08-07T16:00:46.114758Z","submitted_at":"2025-04-20T15:28:16Z","title":"LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14655","snapshot_observed_at":"2026-08-06T14:53:04.611175Z","title":"Leetcodedataset: A temporal dataset for robust evaluation and efficient training of code llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.611175Z"},"links":{"cited_paper":"/paper/2504.14655","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:fb6a03faeda48bbef58cf22f414277b6e63bdd1256b2e7df61d63ddbd0e51f10","observation_id":"a669a212-d3d2-46c4-8b50-39da3cbb3553","resolution":{"observed_at":"2026-08-06T14:53:04.611175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23123","last_updated":"2025-03-04T06:22:40Z","snapshot_observed_at":"2026-07-06T19:42:21.306600Z","submitted_at":"2024-10-30T15:31:54Z","title":"On Memorization of Large Language Models in Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23123","snapshot_observed_at":"2026-08-06T14:53:04.617685Z","title":"On memorization of large language models in logical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.617685Z"},"links":{"cited_paper":"/paper/2410.23123","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:33c1d681112217218de190e5bccbb6d080b91544d87c912162658a0c09220550","observation_id":"6d631812-2c58-4900-962d-551e04168dad","resolution":{"observed_at":"2026-08-06T14:53:04.617685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-06T14:53:04.623265Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.623265Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:92600eda7d56379909c44067317270cf205832a25ae9df16ca90357f13fb4f4a","observation_id":"4b79c033-5867-4008-8c43-bec4f22f60a7","resolution":{"observed_at":"2026-08-06T14:53:04.623265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-06T13:30:45.600197Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-06T14:53:04.629639Z","title":"Redstar: Does scaling long-cot data unlock better slow-reasoning systems? arXiv preprint arXiv:2501.11284, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.629639Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:e09cd7413afefa46cd1e90d9e662557f98067b6c7be8f51d2cd81abd132c8f19","observation_id":"b28d8b18-0fdc-4bd4-b0b3-287c237b2b98","resolution":{"observed_at":"2026-08-06T14:53:04.629639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T14:53:04.635611Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.635611Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:6fe9c980491c39a2233a4329b042e1550c565e2b57bce41220436cca0f08e929","observation_id":"63e26268-c21f-4897-a037-d1ba1f9f364a","resolution":{"observed_at":"2026-08-06T14:53:04.635611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-06T14:53:04.641309Z","title":"Demystifying long chain-of-thought reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.641309Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:568d80e81cf4fdaf48e8abfc0343f688f04531295ac8a4a4981b7cf4e62e4c61","observation_id":"c6b7f1a6-fa47-440d-b4b6-a80fb28074b2","resolution":{"observed_at":"2026-08-06T14:53:04.641309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-08-06T14:53:04.646543Z","title":"Rlpr: Extrapolating rlvr to general domains without verifiers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.646543Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:ac824f4de5b7b0834a6de4042a7dc523a8905c64db61e4a5d4098477df942688","observation_id":"79755e74-e6e5-458f-b5dd-2e89aacd48ca","resolution":{"observed_at":"2026-08-06T14:53:04.646543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15895","last_updated":"2023-10-18T02:07:12Z","snapshot_observed_at":"2026-08-07T01:06:37.669796Z","submitted_at":"2023-06-28T03:31:31Z","title":"Large Language Model as Attributed Training Data Generator: A Tale of Diversity and Bias","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15895","snapshot_observed_at":"2026-08-06T14:53:04.652198Z","title":"Large language model as attributed training data generator: A tale of diversity and bias, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.652198Z"},"links":{"cited_paper":"/paper/2306.15895","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:91b55bb37b30da85c2783f9c575ee0a4f08669f55d2e2512b4da83b2651a6d70","observation_id":"59e5017b-f635-496d-8b23-47ff0b60d0d2","resolution":{"observed_at":"2026-08-06T14:53:04.652198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T14:53:04.657958Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.657958Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:ebee5649398e70bc31d35b0605b10a816ea05bbb4ea9001b4fc105fdaaea07f7","observation_id":"fe1abd00-ca2c-45df-9a78-b2c81c3541b0","resolution":{"observed_at":"2026-08-06T14:53:04.657958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-06T14:53:04.664420Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.664420Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:6ba63cb6422fba0625147cd451e16d5f3adb866a0fcf7fa84674513d73e5b61a","observation_id":"1d29a49b-588a-4212-814d-3619556a7145","resolution":{"observed_at":"2026-08-06T14:53:04.664420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-06T14:53:04.670074Z","title":"R1-zero’s” aha moment” in visual reasoning on a 2b non-sft model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.670074Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:2d95a381cfb86cca4f50ac296b06c5959ec1c936e93fd2c56c8af3514b1c3788","observation_id":"470444a5-3dd0-47fa-9d4b-5ef8075be893","resolution":{"observed_at":"2026-08-06T14:53:04.670074Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:05.899778Z","title":null,"venue":null,"work_id":"9c3952f4-4316-44d6-9cb0-39196928300a","year":null},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.676524Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:000848b8506e2e07ad559052a6d9407fcbe49a3bee7d4c44cc1d22410cf10d55","observation_id":"512ecb7e-3785-48d7-9f99-53c430f3bf9a","resolution":{"observed_at":"2026-08-06T14:53:05.904785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:05.881989Z","title":null,"venue":null,"work_id":"ec4f4f3e-5de6-4ba2-8f18-1c5d242a3e7e","year":null},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.682076Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:299a98bbb7b705ac9738ff7bdec7c3eac4c696649643cfb90a2d9718baae5be2","observation_id":"14022813-be9f-4096-be30-4c9619cce5f5","resolution":{"observed_at":"2026-08-06T14:53:05.887391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:05.864744Z","title":"## Answer to the Example Puzzle { ”reasoning”: ”Given Clue 1, we know Peter is in House 2","venue":null,"work_id":"7bfd40ca-a905-4ca6-a5c4-49fa12b16e86","year":null},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.687922Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:92df30cd4eadde1398bb19f9c4fef896aa3bcfdcc59d182728e94ae850e13817","observation_id":"95e095bf-ebff-4d3b-96b0-f247b1a9de44","resolution":{"observed_at":"2026-08-06T14:53:05.870440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 9 inbound Pith citation observations for arXiv:2507.17512."}