{"as_of":"2026-08-06T22:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c699e9cd84337d52b32aeb3a1d4bf0dff52fb80b87b4e2640dbcd9069924eea","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:13:15.416519Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-06T21:13:15.416519Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-06T21:06:13.281350Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.416519Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:1e0554a2e8959e21bfc137f7ccd21f434281da4afda862fd869020a4fc46c375","observation_id":"cbb9ee45-ebdf-46fe-9dd0-c32d2aec739b","resolution":{"observed_at":"2026-08-06T21:13:15.416519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2507.01679","last_updated":"2026-05-15T06:56:26Z","snapshot_observed_at":"2026-08-02T08:39:49.062624Z","submitted_at":"2025-07-02T13:04:09Z","title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-21T23:39:39.018498Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2507.01679"},"observation_digest":"sha256:4ccc37d2a99884cd0391baa8c3a7479cc58f8cdec64e8c60e4c67ab5dcb85548","observation_id":"928eb557-583d-4526-8c3c-d1d4ea2ada9b","resolution":{"observed_at":"2026-05-21T23:40:46.496771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-06T20:00:55.387382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04072","last_updated":"2025-07-05T15:32:41Z","snapshot_observed_at":"2026-08-06T19:53:52.698745Z","submitted_at":"2025-07-05T15:32:41Z","title":"CTR-Guided Generative Query Suggestion in Conversational Search","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:00:55.387382Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2507.04072"},"observation_digest":"sha256:4aeadcdf76d5766505813f1c69ad6fb7eb6bd10cdffd5492d439c1d6c3f477fe","observation_id":"85c4f4bd-1b2b-4aca-830a-17452bf3b613","resolution":{"observed_at":"2026-08-06T20:00:55.387382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-06T17:52:01.701241Z","title":"Zhou, J., Lu, T., Mishra, S., Brahma, S., Basu, S., Luan, Y ., Zhou, D., and Hou, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10616","last_updated":"2025-07-25T11:09:53Z","snapshot_observed_at":"2026-08-06T17:46:01.198994Z","submitted_at":"2025-07-13T19:04:17Z","title":"Scalpel vs. Hammer: GRPO Amplifies Existing Capabilities, SFT Replaces Them","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:01.701241Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2507.10616"},"observation_digest":"sha256:f256671c53154ef75e91807f4e6e066b0db0482e824ee70955696d0f2dc01cc8","observation_id":"6bc7292e-75cf-4773-bb90-8c07c170c430","resolution":{"observed_at":"2026-08-06T17:52:01.701241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2508.07809","last_updated":"2026-04-20T09:03:51Z","snapshot_observed_at":"2026-08-02T08:22:04.058996Z","submitted_at":"2025-08-11T09:49:01Z","title":"EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T23:56:47.274169Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2508.07809"},"observation_digest":"sha256:580e38f65039b04ef784db117085e4807c84e7439466c805b8cd85cb04f8ce97","observation_id":"1c8fce14-0754-438c-bcef-c2de1fb7f8e5","resolution":{"observed_at":"2026-05-18T23:56:55.052234Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2508.13755","last_updated":"2026-04-12T13:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-19T11:51:40Z","title":"Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration","version":8},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T22:33:01.074518Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2508.13755"},"observation_digest":"sha256:c9663f974cb85c0e932fc84b4ce060140de47ebcf41023407b702428f4302f0f","observation_id":"ce4dbadb-8bdf-48de-bfa1-e2464ee72378","resolution":{"observed_at":"2026-05-18T22:36:53.734614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T10:31:37.961065Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04027","last_updated":"2026-06-09T07:28:31Z","snapshot_observed_at":"2026-08-05T10:31:32.575543Z","submitted_at":"2025-09-04T09:02:16Z","title":"Why Does Reasoning Length Converge? Unveiling the Underfitting-Overfitting Trade-off in Chain-of-Thought","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T10:31:37.961065Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2509.04027"},"observation_digest":"sha256:5a27ddcef72eb5fbb1f08a87abd93293bb6d4c86956b0f6ab89bd5ff65858b98","observation_id":"cbe4cbfe-156e-46e5-874d-4a5c2542018f","resolution":{"observed_at":"2026-08-05T10:31:37.961065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-04T16:07:48.002445Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":235,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:48.002445Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:a3067524f630bcccbbf8ce77323fba6e428ab81eb48b2f344b4df479b35e8e58","observation_id":"956c47bb-bede-428d-b782-c4f032804a4c","resolution":{"observed_at":"2026-08-04T16:07:48.002445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:163667310f4a151506fd71bdbcde7dd0e1fccec67d6a7fddd353b9815fd5a288","observation_id":"f5cb03da-797e-420f-9839-d10cf6717f17","resolution":{"observed_at":"2026-05-18T11:56:19.958923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-04T10:39:29.812004Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09388","last_updated":"2026-06-22T08:02:17Z","snapshot_observed_at":"2026-08-04T10:39:20.309514Z","submitted_at":"2025-10-10T13:42:03Z","title":"Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T10:39:29.812004Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2510.09388"},"observation_digest":"sha256:a59e9e2711d91e19f5537c2a9d6499d9f4173642ef8f9443ef6809cd2438de04","observation_id":"9d30284e-7c29-4951-bac7-482e391095df","resolution":{"observed_at":"2026-08-04T10:39:29.812004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-04T07:21:37.061716Z","title":"Echo chamber: RL post-training amplifies behaviors learned in pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26707","last_updated":"2026-07-15T04:49:02Z","snapshot_observed_at":"2026-08-04T07:10:35.135774Z","submitted_at":"2025-10-30T17:09:09Z","title":"Value Drifts: Tracing Value Alignment During LLM Post-Training","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-04T07:21:37.061716Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2510.26707"},"observation_digest":"sha256:77bbcafd0e2f684c22db4e4b9f6fb9b586966a168005496d7d26a9bdd4afa0d3","observation_id":"822b0dd1-0a95-4955-87e4-6c232c4c4d42","resolution":{"observed_at":"2026-08-04T07:21:37.061716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-03T05:52:38.582979Z","title":"translates","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.01058","last_updated":"2026-05-28T06:23:31Z","snapshot_observed_at":"2026-08-03T05:52:36.155371Z","submitted_at":"2026-02-01T06:53:45Z","title":"Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning","version":2},"reference_index":1378,"source":"pdf_text","source_observed_at":"2026-08-03T05:52:38.582979Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2602.01058"},"observation_digest":"sha256:5feee16c604f87aa5f862bf62ed3ad933905ba05b49ff3ba13d1a46fccdf6f3e","observation_id":"3ca369b3-50c4-4a06-bb76-78579f3f88a7","resolution":{"observed_at":"2026-08-03T05:52:38.582979Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2602.03249","last_updated":"2026-04-09T14:14:01Z","snapshot_observed_at":"2026-08-03T01:16:02.892708Z","submitted_at":"2026-02-03T08:34:20Z","title":"Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T08:27:20.282859Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2602.03249"},"observation_digest":"sha256:5172cb4d37ece47884cdbe5ffc8b55405b7507e2dc887390d477c704515ebc68","observation_id":"4c196a99-ed67-402f-8213-df1727a0d125","resolution":{"observed_at":"2026-05-16T08:27:36.462167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-02T23:11:58.245425Z","title":"M., Pehlevan, C., Jelassi, S., and Malach, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14872","last_updated":"2026-06-29T01:04:09Z","snapshot_observed_at":"2026-08-02T23:11:47.613570Z","submitted_at":"2026-02-16T16:03:08Z","title":"On the Emergence of Implicit Curriculum in RLVR Learning Dynamics","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T23:11:58.245425Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2602.14872"},"observation_digest":"sha256:d4e0c74752f847a09c3205cfb6fcab3fb3e890dc2da37cf0acb908d3e06e024c","observation_id":"48e5d4e4-67be-461b-a6bc-b400c58cffb1","resolution":{"observed_at":"2026-08-02T23:11:58.245425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-07-14T23:46:32.301737Z","title":"Echo chamber: Rl post-training am- plifies behaviors learned in pretraining.arXiv preprint arXiv:2504.07912,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.10263","last_updated":"2026-07-01T06:52:08Z","snapshot_observed_at":"2026-07-14T23:46:28.340932Z","submitted_at":"2026-03-10T22:49:46Z","title":"From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T23:46:32.301737Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2603.10263"},"observation_digest":"sha256:2cfa6296d49454a9f4967f7575d3911ef29772a2704dd6408f1a5cbb0086cb55","observation_id":"06b01db8-7aa0-4d64-b9d3-7cfa93ece865","resolution":{"observed_at":"2026-07-14T23:46:32.301737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-10T04:29:21.897215Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:f2dded548b7b245ef25cbe9064b2bdc9682300493a0c3d1d62c8e334ec22e151","observation_id":"b9ddf425-8719-445e-847c-40d4f1f00e86","resolution":{"observed_at":"2026-05-11T11:56:13.937770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-12T01:17:28.124867Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:ba016ffa01fe6f689918f444eb1b3af0f8ac555f46afd3afbdeffe21d01e1f1a","observation_id":"8b2ea63d-c95a-43b5-80ab-c311e81f9c11","resolution":{"observed_at":"2026-05-12T08:06:31.196542Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T18:07:27.492419Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:9795e1f31a6a0adecdfa0fd49f536c5cdf14c182fbae73c425316b6f6e8bd4f3","observation_id":"a63f88fc-7293-424e-be01-d1f745737a87","resolution":{"observed_at":"2026-05-19T18:07:42.335525Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:d19757467f690d4a13e72cc3dde370720c61176e96cd63911c97aa5ac1fb3a9a","observation_id":"a8ae377b-f8f8-4fa1-9e10-a451ea56ac09","resolution":{"observed_at":"2026-05-12T04:21:22.445555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2605.16874","last_updated":"2026-05-16T08:33:31Z","snapshot_observed_at":"2026-08-01T16:12:13.947960Z","submitted_at":"2026-05-16T08:33:31Z","title":"Reasoning Can Be Restored by Correcting a Few Decision Tokens","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T20:56:48.771058Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2605.16874"},"observation_digest":"sha256:980ac92ab534ed38f8ee5b8d79741a1c8a44b20c4571ac0cb8e6f1ea2cdb7cb8","observation_id":"2409b916-7add-4a41-9b0d-35e670a02646","resolution":{"observed_at":"2026-05-19T20:57:46.848006Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2605.23926","last_updated":"2026-04-21T05:32:02Z","snapshot_observed_at":"2026-07-06T23:34:03.934151Z","submitted_at":"2026-04-21T05:32:02Z","title":"How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-05T10:18:18.717871Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2605.23926"},"observation_digest":"sha256:2994b1f0b602cdd49ef96de156e8ad05f7e35f5b9289ed826552bf5daae8ac44","observation_id":"56707dc9-0357-4dfe-9935-42d6a653c18d","resolution":{"observed_at":"2026-07-05T10:20:57.200486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:70e090a21bb4a27f0df5c42729b7463e29e32d907957b752d2009047e3fa1a18","observation_id":"f67dd987-2349-4996-afd1-ab5850dba0dc","resolution":{"observed_at":"2026-06-27T01:20:20.569507Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:9863e5ec983d233acb1770cc230b35ddfb5254168a60f135c4bb5610116b87ef","observation_id":"e419ae80-2f9d-411a-bc8c-2a8f4b32b3d2","resolution":{"observed_at":"2026-07-09T04:05:55.494223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-02T07:14:53.084480Z","title":"Echo chamber: RL post-training amplifies behaviors learned in pretraining.arXiv:2504.07912, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-06T22:00:19.787725Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:53.084480Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:b8701a19404efa5d5da15ce7c8ff41f2e39ac401a0f211da6aeeeb7db253409e","observation_id":"fa86c831-0274-4832-9eba-19bc8f4e8c0e","resolution":{"observed_at":"2026-08-02T07:14:53.084480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.07912/citation-record","integrity":"/paper/2504.07912/integrity","json":"/paper/2504.07912/citation-record.json","paper":"/paper/2504.07912"},"outbound":[],"paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2504.07912."}