{"as_of":"2026-08-08T03:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a8feb0d3a2903c985bf079f9c0e877d7650d839e308cca84b20c637277336c2","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:54:44.368038Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01743/citation-record","integrity":"/paper/2608.01743/integrity","json":"/paper/2608.01743/citation-record.json","paper":"/paper/2608.01743"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.241277Z","title":null,"venue":null,"work_id":"d7d1ed3a-34b6-484d-8716-d06ad63cf9af","year":2026},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.017940Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:265cbffce71d246732d9404487952c288cac192b1aaa207a2ff559b0fd280d55","observation_id":"df80e58d-a917-48ca-be6d-d8d867e8e48b","resolution":{"observed_at":"2026-08-04T21:54:45.245730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.226709Z","title":null,"venue":null,"work_id":"47deee52-9fee-47b6-ba5c-32cd6f196120","year":2024},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.050129Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:e7e7e41e887112dd28da16fed3aeeea778f5231b5da3ddaf2628683cae5bdf27","observation_id":"c8b89b9c-8b80-427b-bf58-57a1510d7f77","resolution":{"observed_at":"2026-08-04T21:54:45.230777Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.213177Z","title":null,"venue":null,"work_id":"43b8a9c4-feb9-419f-9185-259e3bf6884d","year":2024},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.060067Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:fc836c017518d5a234c3145b42252d7a27fbef623baf727aef3f69a3fed0154f","observation_id":"f20e3a33-f3ed-47aa-af3c-01ea0516b4d9","resolution":{"observed_at":"2026-08-04T21:54:45.217308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.198637Z","title":"H.; Gonzalez, J.; Zhang, H.; and Stoica, I","venue":null,"work_id":"11252b59-a767-4993-9491-8c59141bae6e","year":2023},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.069509Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:3a83f11767b9e839afa570d1f4df382be18281d1aa6bd6a5cf6deeb384bd20a0","observation_id":"d4b0c03d-f000-49f3-a49b-7cb98d1adb80","resolution":{"observed_at":"2026-08-04T21:54:45.202641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.183973Z","title":null,"venue":null,"work_id":"a81885f7-837f-41ee-b17e-cc096d9bab16","year":2024},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.097267Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:3e96e26c919ef7b4d313bcdee8ac0fafac3df7143b94d4c2b159290973697fa0","observation_id":"d9356796-39dd-404c-85a1-c7e61bc5c2d1","resolution":{"observed_at":"2026-08-04T21:54:45.188389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.129231Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.129231Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:66cafc29816a6eaa2b22cc75957916db64b6162297d5f41ce79277f2b4d9b844","observation_id":"65f5e0f5-bb4a-4284-a5a1-c16010cdfcc8","resolution":{"observed_at":"2026-08-04T21:54:44.129231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-04T21:54:44.137374Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.137374Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:ffff425601352c37ea1eb821e873bfffea19d4255b177e077d4f2719890ae76c","observation_id":"74af9aad-919c-4603-a4f7-4284782058ba","resolution":{"observed_at":"2026-08-04T21:54:44.137374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.156754Z","title":null,"venue":null,"work_id":"0892e240-f877-4f70-8830-8457068b8006","year":2020},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.141974Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:4004694c2853581b60982b43f16963a400b33fbff893454dac5c89ba42ad7716","observation_id":"7b0d8687-957a-413b-b072-9ba612e3c9c7","resolution":{"observed_at":"2026-08-04T21:54:45.161193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.142222Z","title":null,"venue":null,"work_id":"01a5d26f-83cb-43d5-a049-1da1e45281c9","year":2025},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.145654Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:53a6292bc9b7751c36710545d874d480aca7b1c5618b74ee66e37a8dc54ee982","observation_id":"959a227d-d93c-4771-a638-169caa91aef7","resolution":{"observed_at":"2026-08-04T21:54:45.146636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.127187Z","title":null,"venue":null,"work_id":"f62eab32-4016-4fc9-8eba-af61a95a45ba","year":2026},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.174384Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:af59f79ad319069b47f9ee9548953f3b70eedfa26698ea503f712de584b116cb","observation_id":"495d56fd-0403-4cdb-a2c7-d82029c5ba61","resolution":{"observed_at":"2026-08-04T21:54:45.132103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.187684Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.187684Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:a5715389c53f7a3a8cae0874fe3b2f1ca5afe5ce84b730b7397fdad6f570fd46","observation_id":"4c92224e-9ff6-4b52-b7dc-a0a876477ea1","resolution":{"observed_at":"2026-08-04T21:54:44.187684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.192272Z","title":"Proceedings of the 29th symposium on operating systems principles , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.192272Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:95de0070e829554a97a695161f4e043ca2a43109dcfb771f1f520f752de7204a","observation_id":"09e37af4-78c6-4be7-863b-ec28a04e474f","resolution":{"observed_at":"2026-08-04T21:54:44.192272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T21:54:44.196474Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.196474Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:218ee65dc949ebb64143f9dad9d6a93c430b274dc4c15d4b385cb0cd729ad1be","observation_id":"f05b61a8-05ed-4c07-954b-c723093d7e39","resolution":{"observed_at":"2026-08-04T21:54:44.196474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-04T21:54:44.200389Z","title":"arXiv preprint arXiv:1909.08593 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.200389Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:47a3613fca1f0eb50b3ecaa3a3513f0ebfdf5e445aec3abd2776af6aff7344ff","observation_id":"81afb144-f8cc-4f4a-be3e-bc8db4b9f015","resolution":{"observed_at":"2026-08-04T21:54:44.200389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.204431Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.204431Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:4ac9d1f7922f10229efde69ac650464f6f01dadb35ac27150f50bb7a69f5cf0c","observation_id":"f77e03be-e80f-4784-8276-969b8fc49b18","resolution":{"observed_at":"2026-08-04T21:54:44.204431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.208940Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.208940Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:6e01f95e65bed3f58a3e6ee575d30178da4dfacbf35de269779b879e35ae4a24","observation_id":"d4614ed2-ffee-4162-a9b8-5f7d2d541dc7","resolution":{"observed_at":"2026-08-04T21:54:44.208940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T21:54:44.213111Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.213111Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:d64bc76471d73e8d3e782c8fbcf6c07d7e3aa1c160be8f990b117fef57529812","observation_id":"c5d7d783-687b-4adf-a1dd-938cddac8947","resolution":{"observed_at":"2026-08-04T21:54:44.213111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.217118Z","title":"arXiv preprint arXiv:2509.07430 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.217118Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:173aaacfe59faf91a5412d3ad06cf0d2b3e3910649dac06454e28135227959fe","observation_id":"2aa3844b-7052-4b9d-9a1e-1610e23bdac9","resolution":{"observed_at":"2026-08-04T21:54:44.217118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.221531Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.221531Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:4f68cee6cc54f49d8f20612253b7f0caf3c37c33b6eb9a61ff0487933230aeca","observation_id":"a98d7c5b-c8f8-4eba-b5bd-07ff69b01084","resolution":{"observed_at":"2026-08-04T21:54:44.221531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18500","last_updated":"2026-05-18T14:54:49Z","snapshot_observed_at":"2026-08-07T22:03:46.168938Z","submitted_at":"2026-05-18T14:54:49Z","title":"Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2605.18500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.18500","snapshot_observed_at":"2026-08-04T21:54:44.507888Z","title":"Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning","venue":"cs.CL","work_id":"dbab7a4b-823b-4d0c-9402-2ab564f8535b","year":2026},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.225531Z"},"links":{"cited_paper":"/paper/2605.18500","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:0cd5a8030afabb5014884556122f5bdb2531d676ba1920f2bd63100ec4ac4a83","observation_id":"2a521534-ce38-4f85-9d5e-09031face8e8","resolution":{"observed_at":"2026-08-04T21:54:44.514401Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03865","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.882241Z","title":"arXiv preprint arXiv:2510.03865 , year=","venue":null,"work_id":"3cfe101a-d32d-45a9-b4f6-8165b98b8bd4","year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.229256Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:11c0d58412795fb8e934756b6a2529d6fd1c4e5e2032e103fb43629804e9e554","observation_id":"4fea440c-0f4f-4aa6-9af2-c869ce602c86","resolution":{"observed_at":"2026-08-04T21:54:44.888734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18864","last_updated":"2026-05-15T07:42:21Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-15T07:42:21Z","title":"SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs","version":1},"cited_work":{"arxiv_id":"2605.18864","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.18864","snapshot_observed_at":"2026-08-04T21:54:44.777533Z","title":"SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs","venue":"cs.LG","work_id":"46b17824-2aa5-4cd8-a67b-70c057064783","year":2026},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.233162Z"},"links":{"cited_paper":"/paper/2605.18864","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:cdb12dbfbd2612cf2e233f0f42eda08006752c1ffe8e783395fe4d88e2419703","observation_id":"51920178-91f2-4f57-aa29-e7275570cb94","resolution":{"observed_at":"2026-08-04T21:54:44.782159Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.237573Z","title":"arXiv preprint arXiv:2510.20817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.237573Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:f69f929c93c6b631649239167f77591e5eb2dff09d6345de9613c8feb79b75dd","observation_id":"c5c3b979-95d4-4927-86f1-31f82e92fb49","resolution":{"observed_at":"2026-08-04T21:54:44.237573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.09923","last_updated":"2026-05-13T06:42:03Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T03:19:04Z","title":"expo: Exploration-prioritized policy optimization via adaptive kl regulation and gaussian curriculum sampling","version":2},"cited_work":{"arxiv_id":"2605.09923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.09923","snapshot_observed_at":"2026-08-04T21:54:44.710079Z","title":"expo: Exploration-prioritized policy optimization via adaptive kl regulation and gaussian curriculum sampling","venue":"cs.AI","work_id":"49cd515a-2590-4f34-b41c-b3478f2bdd70","year":2026},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.241343Z"},"links":{"cited_paper":"/paper/2605.09923","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:0437cb5414a16825cd896ce79632b17893d1cdfad8352485348e689aa721225f","observation_id":"a819ad68-2a25-48bb-ba76-c9fe1bf79dfd","resolution":{"observed_at":"2026-08-04T21:54:44.715269Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15778","snapshot_observed_at":"2026-08-04T21:54:44.245197Z","title":"arXiv preprint arXiv:2507.15778 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.245197Z"},"links":{"cited_paper":"/paper/2507.15778","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:5d5313ae7433df7a6b88eff12661dfc9e559083838f59b14ef558cc3dde6a324","observation_id":"69b0009d-c43c-4ea1-8c06-e629fe386bee","resolution":{"observed_at":"2026-08-04T21:54:44.245197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-04T21:54:44.248752Z","title":"arXiv preprint arXiv:2505.22617 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.248752Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:7fbc93698f8c9666a2b13e1eee3d947f57547c7a92ba7e3f0c5f02fb505b52e0","observation_id":"51f81fca-0199-4d8e-8479-56237d36f1c1","resolution":{"observed_at":"2026-08-04T21:54:44.248752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.065398Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , pages=","venue":null,"work_id":"790b21fc-87f4-4abe-8d61-91b017878403","year":2025},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.252587Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:581b986b469f63324218e37f62fc5270357eb243af19c66790dbecfe9d912719","observation_id":"4b9db30a-cc20-4107-8274-997583ac6163","resolution":{"observed_at":"2026-08-04T21:54:45.069692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T21:54:44.256399Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.256399Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:bc1f7744705c0ec45247c26f8549342a1f45aaacf487e3189f04d1c6763e1e3c","observation_id":"cb170a3c-c32c-4233-8b8a-7deb11a1ecc8","resolution":{"observed_at":"2026-08-04T21:54:44.256399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-04T21:54:44.260001Z","title":"arXiv preprint arXiv:2507.18071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.260001Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:8cdc0286b6c76d53b916eb76cbec4ed054ccc528610cd922ff964d5c21cad622","observation_id":"0008add1-0006-4660-b26c-238db2c742fd","resolution":{"observed_at":"2026-08-04T21:54:44.260001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-07T15:24:21.164792Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02479","snapshot_observed_at":"2026-08-04T21:54:44.263730Z","title":"arXiv preprint arXiv:2509.02479 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.263730Z"},"links":{"cited_paper":"/paper/2509.02479","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:601491598f7f4b8b71383a094bf3b9f6a33d7a440dc77d0c964441679a089df9","observation_id":"0b978fe9-44cc-42d7-996e-074b439cce26","resolution":{"observed_at":"2026-08-04T21:54:44.263730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.267496Z","title":"arXiv preprint arXiv:2509.21826 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.267496Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:19ab8d5b42cda15273b4781d65ad90873a2e8c411197b3c4ab0aa5058f21e639","observation_id":"61c442a8-efe1-4f94-811d-0f65aa07c352","resolution":{"observed_at":"2026-08-04T21:54:44.267496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2605.00380","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00380","snapshot_observed_at":"2026-08-04T21:54:44.689229Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","venue":"cs.LG","work_id":"9ff2f967-b4c3-47f8-beda-d13f4813ddc8","year":2026},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.271066Z"},"links":{"cited_paper":"/paper/2605.00380","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:25af8b447fa52d969291470e20f25e70cd3cd4fd083be3e82b565316594113d6","observation_id":"beb7572e-2aad-4fb6-9fb2-415e538b6b4d","resolution":{"observed_at":"2026-08-04T21:54:44.693998Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08499","last_updated":"2026-05-25T03:06:27Z","snapshot_observed_at":"2026-08-03T03:23:04.431036Z","submitted_at":"2026-02-09T10:51:58Z","title":"Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.08499","snapshot_observed_at":"2026-08-04T21:54:44.275053Z","title":"arXiv preprint arXiv:2602.08499 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.275053Z"},"links":{"cited_paper":"/paper/2602.08499","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:f587e9bdd98b37aa72288b92a82ee2e4ddf93fc963e946a64f2e5cdd21e31a88","observation_id":"1760ee1a-2a76-4fac-b3b8-d602362fe35f","resolution":{"observed_at":"2026-08-04T21:54:44.275053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.051210Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"adc0504d-7c1e-49f8-ba4e-1c99ebbd98f5","year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.279008Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:69645591f115dd9b9504600fe27ef46dcce62b2523c0d73adcac29dc46051897","observation_id":"11a28c1b-8692-4df2-bc0f-b48642f39907","resolution":{"observed_at":"2026-08-04T21:54:45.055465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.282831Z","title":"arXiv preprint arXiv:2507.14783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.282831Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:04997cd49f64eaecb9cbcf61ff6dc3a5d1272e1573af2d8fab29e10e437733e3","observation_id":"513eb1db-d952-4e0c-abc8-c1e864933d55","resolution":{"observed_at":"2026-08-04T21:54:44.282831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-06T14:44:19.604097Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-08-04T21:54:44.286875Z","title":"arXiv preprint arXiv:2507.17512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.286875Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:8e345387df9f6615a8074609ed012dff86c7853f699583381b4db9899038e473","observation_id":"b0b85819-9a32-450d-990c-f7710a6cf889","resolution":{"observed_at":"2026-08-04T21:54:44.286875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.290891Z","title":"arXiv preprint arXiv:2602.12566 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.290891Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:ee12f5696190a3cdc4ca773b9321d5f859b88ae5f8d39a59e5a2523f429c01bf","observation_id":"e48110fa-5932-4e42-a981-6716065cab6a","resolution":{"observed_at":"2026-08-04T21:54:44.290891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.294669Z","title":"arXiv preprint arXiv:2602.02301 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.294669Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:65a42896cc5980166217e4640a5a3334a81a7a29671bf1db32c85a587d28d796","observation_id":"78f8ee3c-a707-4ca5-881b-389d9ef6b591","resolution":{"observed_at":"2026-08-04T21:54:44.294669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.298515Z","title":"arXiv preprint arXiv:2505.17508 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.298515Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:c6f4c23b01f7608a7d33068caf9478716ba5a34a6ff6327bf7932aee40bdc66e","observation_id":"2de762b3-6690-4c75-a29c-ff5df8769829","resolution":{"observed_at":"2026-08-04T21:54:44.298515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.036251Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"7395f7e0-d12d-4550-bd90-80f6803ded94","year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.302583Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:b63e5568d2e123bea6dd0635535a98909b1f239271e03fbd7f50d572e14739b0","observation_id":"f0ab0c6d-c983-4837-ade3-88399ac72e09","resolution":{"observed_at":"2026-08-04T21:54:45.041362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-06T20:31:23.587108Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02259","snapshot_observed_at":"2026-08-04T21:54:44.306632Z","title":"arXiv preprint arXiv:2507.02259 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.306632Z"},"links":{"cited_paper":"/paper/2507.02259","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:09344c38b5887a49c931672ab5b04feb36efe25cf29bfbf3d4eb69fd9642814d","observation_id":"a25a14df-98a3-4de8-be31-241cdd07debb","resolution":{"observed_at":"2026-08-04T21:54:44.306632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:45.019826Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"e82daa9f-3347-493f-85b1-8bbb41e84547","year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.310926Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:1ea5ae3a7cd0775468c87b70de1bea70fa6f4ef79a6f1b79747edc6b6c25a5f6","observation_id":"e66e8458-af75-4c5b-8783-51bc09ccd8b2","resolution":{"observed_at":"2026-08-04T21:54:45.025570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-04T21:54:44.315385Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.315385Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:1a1611a4ae580e09cdadddc15e7aca22883cadaba4127116deb9ccaca888cf87","observation_id":"a5b07d83-b46e-4da2-af82-47e44e99f983","resolution":{"observed_at":"2026-08-04T21:54:44.315385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.319080Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.319080Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:19f750296c3a53fc4de0b5c1575cbc133f95954f57fb24efa39735984783db4c","observation_id":"fefc93de-90e7-4a81-a7e9-de149a2a8cef","resolution":{"observed_at":"2026-08-04T21:54:44.319080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.322742Z","title":"WildChat: 1M Chat","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.322742Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:31250a2cb569be756a8194b3260db2059e051ae0e9269623f63a59304890ca3c","observation_id":"440a5857-0cef-47f0-9e65-01ef9da28d69","resolution":{"observed_at":"2026-08-04T21:54:44.322742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.326437Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.326437Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:62add62833a7be80ac423a3f3ea6b59357195426f041dcf9e18753f20ee26cbc","observation_id":"d85754cd-3a0f-47a7-96bc-de263b245193","resolution":{"observed_at":"2026-08-04T21:54:44.326437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.330165Z","title":"arXiv preprint arXiv:2512.15489 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.330165Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:9b6193554921edfa83f49e0f7492bb17292d6adc31617cef32f88333b1e654f3","observation_id":"6d3c600e-de81-43fc-b9b7-4ad1eebf5f11","resolution":{"observed_at":"2026-08-04T21:54:44.330165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.333909Z","title":"arXiv preprint arXiv:2509.20357 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.333909Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:659ec7d4c23d96512f1e2e90df9937182b5ae62cf3e36987fdd852be77eefcb1","observation_id":"5b129d2e-ab42-4199-8d96-22397aa477a2","resolution":{"observed_at":"2026-08-04T21:54:44.333909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-04T21:54:44.337692Z","title":"arXiv preprint arXiv:2410.18451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.337692Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:bc04485620f530644f79d68ce9ca6092266c802b78c203d859d71b62a46b470d","observation_id":"9f41ce78-a012-42b9-ab64-9f1f61dd0740","resolution":{"observed_at":"2026-08-04T21:54:44.337692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05962","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.799225Z","title":"arXiv preprint arXiv:2512.05962 , year=","venue":null,"work_id":"e0c71f9c-9e77-411f-8e9c-12d32265f021","year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.341274Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:964db0391b64264703a1047c7b4fd623e7a75c4a45eb34bb2a7f1c811ffbc196","observation_id":"bbd38b4d-117c-43b4-81ca-2cbdc185adab","resolution":{"observed_at":"2026-08-04T21:54:44.806705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"cited_work":{"arxiv_id":"2605.00365","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00365","snapshot_observed_at":"2026-08-04T21:54:44.621660Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","venue":"cs.LG","work_id":"69d9856f-c296-4ab9-a0a8-20dea8d3ac08","year":2026},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.345264Z"},"links":{"cited_paper":"/paper/2605.00365","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:1156ebc2eb792b7bb8044d3b079dd8bf92afd79abef5796491cbb53f12d547be","observation_id":"490492f5-7b91-4f81-b8db-d1e281bbd6c6","resolution":{"observed_at":"2026-08-04T21:54:44.626662Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.348703Z","title":"arXiv preprint arXiv:2602.19895 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.348703Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:8a4fe2611e4b4280d927b601c22cea4a98b7cd3d28ced91cc727fa4cd7182fd3","observation_id":"14284321-4222-44e3-864a-f7944fb9fa81","resolution":{"observed_at":"2026-08-04T21:54:44.348703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.352386Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.352386Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:6c3e625dee0df3b32d993342a5eabaaf8e0e9c6112c2d8be23fd148e3916076c","observation_id":"d40d7bb1-73a0-4e5b-804e-e4a11b18e0cf","resolution":{"observed_at":"2026-08-04T21:54:44.352386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.962455Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"8e5c685a-3091-489d-b321-be8a7755d5b7","year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.356061Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:b741fa5a7bd78609a0ac3cd4c9f46fd0577b3156f130dbc0731aeb63cbf93ef5","observation_id":"0309255f-307c-41e5-8890-66f275465eba","resolution":{"observed_at":"2026-08-04T21:54:44.966856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-04T21:54:44.359793Z","title":"arXiv preprint arXiv:2204.05862 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.359793Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:a81d2fc8183a3f2418f12aab922fc6a96d1d08388fe9ac6fec71423f95ea438e","observation_id":"ee7e51f3-7ccf-4a53-b5e3-504e3936633f","resolution":{"observed_at":"2026-08-04T21:54:44.359793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:54:44.363782Z","title":"arXiv preprint arXiv:2507.14843 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.363782Z"},"links":{"citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:b467e58b1a599b6d2bd6839f7f5adc9b1e26dc0e40cb20790adcf3aaa435bd4c","observation_id":"567c4997-dfc7-44bc-90ee-c1b8dd195bdc","resolution":{"observed_at":"2026-08-04T21:54:44.363782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-04T21:54:44.368038Z","title":"arXiv preprint arXiv:2503.20783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.368038Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:7a4f8d73454e58949b2b5ec628b2cf54462ff2900a06b88662813229d1ffa733","observation_id":"4a43e7f0-9217-49ef-97ad-685026069a89","resolution":{"observed_at":"2026-08-04T21:54:44.368038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T02:36:01.953090Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":44,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2608.01743."}