{"as_of":"2026-08-07T18:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86aa604ba20b68e25954febf0c54c808d29254d3ba6c7e7153b5746f4586ada8","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:34:31.715954Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.11297/citation-record","integrity":"/paper/2604.11297/integrity","json":"/paper/2604.11297/citation-record.json","paper":"/paper/2604.11297"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:0484ef05e364debfc5c07d459eb81cc4c8e4240e826bd0171d532ef161ebb9cd","observation_id":"9ea33fd6-dc3d-403b-ba4f-6e4cd7ea5b54","resolution":{"observed_at":"2026-05-11T10:16:05.102223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:d796d6fee71b818ae727413d05cadd14c479d0541fd3854559a06f93061a9b9e","observation_id":"dde50c55-7418-4b3a-a646-fa3c4f5f4ab2","resolution":{"observed_at":"2026-05-10T15:35:32.831908Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-07-06T17:24:16.787573Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:0026597709c4d9914e3bd4590a91560819fd00ba0bc0468ac6f68dc30a111b39","observation_id":"b21c6ace-e1f4-4553-8d50-6b21cb945071","resolution":{"observed_at":"2026-05-10T15:35:32.826796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Execution-basedcodegenerationusingdeep reinforcement learning.Trans","venue":null,"work_id":"f8b06229-fd0d-4143-845f-9767bafd2232","year":2023},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:2ea52a16c96ce9d6587a288412cac53421bc530ba268c3783e0262ccab0764ac","observation_id":"c2d69158-f2b0-4ad5-94c3-01f4f57f2a5b","resolution":{"observed_at":"2026-05-17T19:55:11.460744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Christiano, Jan Leike, and Ryan Lowe","venue":null,"work_id":"c2017cfb-e4c6-4e28-b523-93bf538185c2","year":2022},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:ecbdd0165d6a1ad5128d08d763680523764b0c8356d2acf0e2d97e2184a41aed","observation_id":"d640a3bd-07c7-4972-badd-a7b0503d3907","resolution":{"observed_at":"2026-05-17T19:55:11.464559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.01067","doi":"10.48550/arxiv.2503.01067","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.01067 , year=","venue":"ArXiv.org","work_id":"ee9fa489-4206-496e-b7d1-9203eac41e7e","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:2b18586a0d311cc2117a79c02abd3f4a6b0d3653ec6bb973b0561c3e2f2abbb4","observation_id":"46665d13-9645-4259-a5b0-37c611dc06d0","resolution":{"observed_at":"2026-05-10T15:35:32.816007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:7016af17bb56088b005a38d1e69d7c86204e6d19131da8b62a9bcb24bd722db1","observation_id":"1dd6fcf5-e8da-4ec2-9e1e-f8ca91e0f7d9","resolution":{"observed_at":"2026-05-10T15:35:32.820950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21669","doi":"10.48550/arxiv.2601.21669","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expected return causes outcome-level mode collapse in re- inforcement learning and how to fix it with inverse probability scaling.CoRR, abs/2601.21669","venue":"Open MIND","work_id":"2048dbd1-1faa-49d3-8b36-e61d4d3bbd56","year":2026},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:c584d51efa6798f89ae8bbd0bcfb83426a3eff24213de077188451b54d1edf24","observation_id":"7aa33035-2676-4431-b5d7-fe5e91bf9747","resolution":{"observed_at":"2026-05-10T15:35:32.801473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05837","last_updated":"2026-04-13T12:17:34Z","snapshot_observed_at":"2026-07-06T22:31:53.944103Z","submitted_at":"2025-10-07T12:02:03Z","title":"EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget","version":2},"cited_work":{"arxiv_id":"2510.05837","doi":"10.48550/arxiv.2510.05837","metadata_source":"pith","pith_arxiv_id":"2510.05837","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget","venue":"cs.CL","work_id":"4aaa5ae8-ce96-4214-84a0-75d4a6e9c04c","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2510.05837","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:b9de50129e603cd881b5f6042324b97b32c0303ce426b85c1adbc05bff48e270","observation_id":"7d7b1b52-dcec-47ca-a772-3eab1aab6467","resolution":{"observed_at":"2026-05-10T15:35:32.836910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01347","doi":"10.48550/arxiv.2506.01347","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The surprising effectiveness of negative reinforcement in llm reasoning.arXiv preprint arXiv:2506.01347","venue":"ArXiv.org","work_id":"90fa4c77-dcfb-4253-827e-9bde0d342fcb","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:8d5af26d4a3d33c1462479b1e40286351581785fa32cb11f88923e9d0efeef01","observation_id":"9b09873b-c376-45a9-a2e5-0add5efe78e1","resolution":{"observed_at":"2026-05-10T15:35:32.795743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"422da745-04dc-4617-b166-c52bb55d7e72","year":2018},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:a131e747f646ba0d38df06cfd8a6243c4e8a61e016b517ab400f152ae54a2ac3","observation_id":"92cfaa51-ace3-4881-8f16-8b0abdee0d69","resolution":{"observed_at":"2026-05-17T19:55:11.446227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.19895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:26:27.263812Z","title":"DSDR: Dual-scale diversity regularization for exploration in LLM reasoning.arXiv preprint arXiv:2602.19895","venue":null,"work_id":"a23817e2-7676-45ea-8373-632338a54bc6","year":2026},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:b93d41caf1bf652ea67c8dc1f1b3aa4f7654d807a11c8d855e647ac0a87553c6","observation_id":"1796ad6a-0103-4283-90e8-518143746bb9","resolution":{"observed_at":"2026-05-11T10:16:05.095573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":"f4ad0b19-5dc9-49d5-af29-63f83eb9fd4c","year":2016},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:26b67d68fc01f863eeac59c52753736408169eb966cac16b81108bf50830ba01","observation_id":"50586630-192a-4d37-b726-4078121ca7b1","resolution":{"observed_at":"2026-05-17T19:55:11.438417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1037/0033-295x.109.4.679","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The neural basis of human error processing: Reinforcement learning, dopamine, and the error-related negativity.Psychological Review, 109:679–709, 11 2002","venue":"Psychological Review","work_id":"d898ff9b-4d95-4bdc-a6b5-2a46840e9f2b","year":2002},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:d599226c6e71dd321584c1cb4c9818ee5190dd4831d8bcb988a6d26ea5019b2f","observation_id":"9e15d907-0407-4af1-8e92-1c9507d29ac0","resolution":{"observed_at":"2026-05-10T15:35:32.743232Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21105/joss.00205","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:41.654379Z","title":"The Journal of Open Source Software 2(11) (mar 2017)","venue":"The Journal of Open Source Software","work_id":"f84fab16-bf4f-4c2b-8818-a81a20c16b72","year":2017},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:790f6d667e2afe45915fb02b3eed5adedc75f8a4704e3cbd9c3e8c4a8a8d526e","observation_id":"59b6c280-e1b0-4950-9013-890dcc8272ee","resolution":{"observed_at":"2026-05-10T15:35:32.734582Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-20T19:22:01.845761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-20T19:22:01.845761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:a053551ac1f959e6d338d318fb38fb6622eab65c8f4307243d6b5635819f011b","observation_id":"72752f53-1af9-4691-bfa3-3f3127f297b4","resolution":{"observed_at":"2026-05-10T15:35:32.723851Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.24183","doi":"10.48550/arxiv.2505.24183","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qimeng-codev-r1: Reasoning-enhanced verilog generation.arXiv preprint arXiv:2505.24183","venue":"arXiv (Cornell University)","work_id":"0607453a-b988-4fcd-8669-0993588f67d3","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:b73f7511ac385873ea07e3b419768e61da318a574be07426550eeb00e0f180b4","observation_id":"9ccf4e04-f567-40fb-898c-0cad0c1e04c7","resolution":{"observed_at":"2026-05-11T10:16:05.056443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04416","last_updated":"2025-09-03T07:11:03Z","snapshot_observed_at":"2026-08-06T10:35:42.926353Z","submitted_at":"2025-08-06T13:03:21Z","title":"Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning","version":2},"cited_work":{"arxiv_id":"2508.04416","doi":"10.48550/arxiv.2508.04416","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thinking with videos: Multimodal tool-augmented reinforcement learning for long video reasoning","venue":"arXiv (Cornell University)","work_id":"824594ad-21b0-49b7-88f8-fac8553528e3","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2508.04416","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:b9f983ba0334c1213f9b5dfed50dff1256eca9a9eeae10da21c83721170ffe46","observation_id":"70c70560-a7fa-4a35-906f-cfabf5963d6e","resolution":{"observed_at":"2026-05-10T15:35:32.730359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20766","last_updated":"2025-08-07T09:53:15Z","snapshot_observed_at":"2026-08-07T01:11:37.463830Z","submitted_at":"2025-07-28T12:21:19Z","title":"Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback","version":4},"cited_work":{"arxiv_id":"2507.20766","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20766","snapshot_observed_at":"2026-07-03T13:58:22.283855Z","title":"Learning only with images: Visual reinforcement learning with reasoning, rendering, and visual feedback","venue":null,"work_id":"dfe489af-fb58-407d-b915-de7c7ba10ca0","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2507.20766","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:232b3f2d6e319b9594a441a1c85f6f178c2858d6b47d839a956f4b915e0ed00f","observation_id":"2910a4f1-355f-4a94-8ebf-9d767a333652","resolution":{"observed_at":"2026-05-11T10:16:05.083724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.125","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"REARANK: reasoning re-ranking agent via reinforcement learning","venue":null,"work_id":"b329ccd1-78ee-4a1f-8dfe-655ef5d5710f","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:eee1690c1d2c67d62cad4c5028d34f0a566979587164f560ee98cac1a4bb6440","observation_id":"ea46ed91-eb05-49a5-a9f7-660f2acd8fd1","resolution":{"observed_at":"2026-05-10T15:35:32.748330Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let’s verify step by step","venue":null,"work_id":"2419858f-9185-4029-a804-2411462bd354","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:6f25162a6992df7d60b5536d51017d218ad2b7c710887cccd316d35f556283e3","observation_id":"3995b01b-fa87-4716-b40c-8a51fc70c80a","resolution":{"observed_at":"2026-05-17T19:55:11.396700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":"2211.14275","doi":"10.2196/53233","metadata_source":"pith","pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving math word problems with process- and outcome-based feedback","venue":"cs.LG","work_id":"94492239-b1d5-435e-bea5-7f51992d0614","year":2022},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:e97320d3050c072873a79f31a1e729da16d1f374d92e3f95eb3827840c37ebc7","observation_id":"29894fa3-4f98-402c-bbf6-9272ddeb74cf","resolution":{"observed_at":"2026-05-10T15:35:32.753463Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:a0882556d928091df276d39c30095711eb8cdaed354a45953ede63dbb237caf0","observation_id":"7c326e03-d676-43c8-b538-85efe56b9e3f","resolution":{"observed_at":"2026-05-11T10:16:05.065074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.08763","doi":"10.48550/arxiv.2601.08763","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rewarding the rare: Uniqueness-aware rl for creative problem solving in llms","venue":"arXiv (Cornell University)","work_id":"73ed7dee-8ce9-403b-8514-2c92c626e2d1","year":2026},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:a3a5166678e9e91d8f373f92bbf86a488a96f4beca9a67ad02a3060e8764050e","observation_id":"c099b7f6-9a2e-453e-adf0-ac095ad01702","resolution":{"observed_at":"2026-05-10T15:35:32.739251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:e79ea6d00c6e44a733ae33e1b48afa12ae1d0ac85b77c26e2606c7fd441c0ee4","observation_id":"7f61e66d-647e-4ac4-9bb8-3c2b623fc48a","resolution":{"observed_at":"2026-05-11T10:16:05.109966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:1089fa993ee9223a4c965d79a6afb221267a14b894b4d42ed1f48178643a001a","observation_id":"ec353b52-5182-4790-b97c-e9927c819038","resolution":{"observed_at":"2026-05-10T15:35:32.810462Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2733.2024","doi":"10.1109/cvpr52733.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emogen: Emotional image content generation with text-to-image diffusion models","venue":null,"work_id":"7efbc2dd-b0f2-4f71-bb1c-d2fcf110d805","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:9d0ce80bb43d185ecca3bcc4a404c2347f23dc69910efab73528fea2a769f2d9","observation_id":"176ffacb-3cee-4ccf-8105-48c887858eba","resolution":{"observed_at":"2026-05-10T15:35:32.854791Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i25.34922","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multi-objective evolution of heuristic usinglargelanguagemodel","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"cb49e7f8-9e95-47b6-bce7-058b2c19790b","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:105a9d60dd57ae40ee27fff6823061c92f322bdc5897585e1cf0c8ff367f05d7","observation_id":"80a1572b-eebf-4928-8bc6-9f159a55171c","resolution":{"observed_at":"2026-05-10T15:35:32.805054Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i19.34213","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Latent reward: Llm-empowered credit assignment in episodic reinforcement learning","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"f8ff241e-bc36-45ac-8651-b11212c5a3fc","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:70f8b92aa372b1561e838c0881b5bfe701eaf52565481cb467d25b0f6d9f2e5d","observation_id":"a949e1ae-6f48-48d1-9a7e-922d7fcce932","resolution":{"observed_at":"2026-05-10T15:35:32.840809Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revolve: Reward evolution with large language models using human feedback","venue":null,"work_id":"fb9f43f4-ab7c-462c-b673-de454537e160","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:4561ef88d4d7d6921b4ba3da935af410a4a0ff27dd68e0543249d6655f26d93e","observation_id":"c0beafab-6a79-4067-87b4-80c40e6eec9d","resolution":{"observed_at":"2026-05-17T19:55:11.434285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":"33c96e7b-8d7b-4b49-995c-320ae9018bd1","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:182d776fdd8b7aad02eb108ac15654b8b98a5cb151bb93fbf16af37f7786d44f","observation_id":"31af2722-e6e6-499a-808b-eaf668f1bd25","resolution":{"observed_at":"2026-05-17T19:55:11.417631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8bda15ec-8c86-446b-ba0c-d93e902fff33","year":null},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:c1baa6c5f324c6bcfae937eaf28de5a3f5fc1446c7687e8a596dfb04bc41a0ef","observation_id":"2ae3172b-5fe5-41e2-93fd-551c5931cbc1","resolution":{"observed_at":"2026-05-17T19:55:11.404832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Locating and editing factual associations in GPT","venue":null,"work_id":"5ca18700-d55b-4782-8f09-caabdf77154a","year":2022},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:79c13d06f7286f26fe61b3ae277d8bb32d9673628a15c0bae0266830182cc226","observation_id":"ebfd1f85-9597-4a85-ac28-acc07ae2d4b6","resolution":{"observed_at":"2026-05-17T19:55:11.407839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Daniel Freeman, Theodore R","venue":null,"work_id":"d19bd500-1cf8-4e17-bd84-ba429aef4899","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:3729df6bf834ac05697de5d5195d28a47ebb5a97b5992872ed5087b1543ceccd","observation_id":"59b915ce-fee4-4436-8fb4-f90d7f577115","resolution":{"observed_at":"2026-05-17T19:55:11.410802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In-context learning and induction heads.Transformer Circuits Thread","venue":null,"work_id":"1fd5b7e0-0bab-4e69-9a3f-75caf5cf6293","year":2022},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:cae1bec0eafea272da8abccd0ab5fa8a43b87cba0b43be97ef2ad2bd1ad4aacd","observation_id":"0b0d8499-8447-4727-8b51-1ba97563fe5e","resolution":{"observed_at":"2026-05-17T19:55:11.402128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20938","last_updated":"2025-04-29T17:03:03Z","snapshot_observed_at":"2026-08-07T15:58:08.449973Z","submitted_at":"2025-04-29T17:03:03Z","title":"Towards Understanding the Nature of Attention with Low-Rank Sparse Decomposition","version":1},"cited_work":{"arxiv_id":"2504.20938","doi":"10.48550/arxiv.2504.20938","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.20938","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":"ArXiv.org","work_id":"b806f79c-42b6-4248-ae90-463798e1af34","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2504.20938","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:ef91b11820ec7fcbb8313ee8a93034ec2d09892d4f09870f7e901735db250d3d","observation_id":"c39b9499-16e6-4950-b3df-ba9b0e5c3b20","resolution":{"observed_at":"2026-05-10T15:35:32.846244Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20526","last_updated":"2024-10-27T17:33:49Z","snapshot_observed_at":"2026-08-05T02:09:50.000836Z","submitted_at":"2024-10-27T17:33:49Z","title":"Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":"2410.20526","doi":"10.48550/arxiv.2410.20526","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20526","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Armand Joulin, Edouard Grave, Piotr Bojanowski, Matthijs Douze, Hérve Jégou, and Tomas Mikolov","venue":"arXiv (Cornell University)","work_id":"7aaa8958-6923-46a6-99cd-533ced88a8b2","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2410.20526","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:df1ddf4f9e6afe3fb6787e21aec0b3bc9c1feccaf145dbc44571a0a483cb0e29","observation_id":"01801f0c-9b33-4699-b891-51ecca4002d3","resolution":{"observed_at":"2026-05-10T15:35:32.765091Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09312","doi":"10.48550/arxiv.2510.09312","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Verifyingchain-of-thought reasoning via its computational graph.CoRR, abs/2510.09312","venue":"ArXiv.org","work_id":"11b82d13-b776-41a4-8de2-8323ffe11bc3","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:358e641faa54b6c7dc2dd34a393f7b597bfe6a949befa764bca8cfcd4e820042","observation_id":"7c865a2e-4829-4c33-9139-64133ac26ff9","resolution":{"observed_at":"2026-05-10T15:35:32.759051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.19673","last_updated":"2026-05-29T07:03:10Z","snapshot_observed_at":"2026-08-03T14:41:32.517766Z","submitted_at":"2025-12-22T18:51:48Z","title":"Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Internal Policies","version":3},"cited_work":{"arxiv_id":"2512.19673","doi":"10.48550/arxiv.2512.19673","metadata_source":"pith","pith_arxiv_id":"2512.19673","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bottom-up policy optimization: Your language model policy secretly contains internal policies","venue":"cs.LG","work_id":"8084b3d2-4748-4693-be79-e94b66fdbe9f","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2512.19673","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:51eb25fc249febdda0069423e1b79c1d665065fcc0abb27722c7f6658452aa13","observation_id":"74c4eec3-f643-4301-b029-6ecfe88d43e0","resolution":{"observed_at":"2026-06-01T02:02:23.552990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07372","last_updated":"2026-07-12T07:41:31Z","snapshot_observed_at":"2026-08-06T19:10:40.703812Z","submitted_at":"2026-01-12T09:54:49Z","title":"Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models","version":2},"cited_work":{"arxiv_id":"2601.07372","doi":"10.48550/arxiv.2601.07372","metadata_source":"pith","pith_arxiv_id":"2601.07372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models","venue":"cs.CL","work_id":"942d7453-d7f7-4ad9-8180-e04bd226f6e5","year":2026},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2601.07372","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:661905dbfa9787d36ff7c50ffeeee59dc790f32d906a7eae191352520d0f2795","observation_id":"1f4da862-42a4-4883-92f6-6af5516f5b65","resolution":{"observed_at":"2026-05-16T04:54:49.681471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"851441f0-250a-4a53-b9cc-4d244bb0c481","year":2021},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:5a4233b06a1a0a4e16fa1906e1400fd697cf2916490b7719d341f4c898ebbb00","observation_id":"519e5c6a-547b-473c-88ef-f169412f3fb6","resolution":{"observed_at":"2026-05-17T19:55:11.413835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:ba5504d2be999c744868b32d2c411f8e7321e4ad937de37b3a5916e1f6e25599","observation_id":"17af816a-4cc0-47c4-ba6a-27210a2467d3","resolution":{"observed_at":"2026-05-10T15:35:32.785086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybridflow: A flexible and efficient RLHF framework","venue":null,"work_id":"0e401527-1935-44ef-b903-c905c12dce3e","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:e0c4f0158242a3cb24b7d8b58f394596421aa4a22a5aac1d390b5b5823c3b47b","observation_id":"f26a4de9-4d78-4f9b-809c-ff1a8440c331","resolution":{"observed_at":"2026-05-17T19:55:11.421900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9031.369607","doi":"10.1145/3689031.3696072","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"4909736c-3fe1-4820-b489-cca51669c6d2","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:a6a3d433387206474b7d79e1549bb38359b02c175d60f4b0afd4a1a3ce4efaf1","observation_id":"bcac0cb1-e92d-4dbc-aed3-164c6c91d074","resolution":{"observed_at":"2026-05-10T15:35:32.790653Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":"2506.14758","doi":"10.48550/arxiv.2506.14758","metadata_source":"pith","pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Exploration: An Entropy Perspective","venue":"cs.CL","work_id":"5670d60c-ec64-40eb-93e1-1e51c35e9050","year":2025},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:93992cc84723a0da9383474ddc4bc60d9563fcc19f5d7082bd3afa6d438843e3","observation_id":"de4032af-9a3c-410e-b58e-aabe62879214","resolution":{"observed_at":"2026-05-16T06:20:56.524904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions.Hugging Face repository, 13(9):9","venue":null,"work_id":"8c42ab10-c332-4136-8223-bd012227373a","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:50eb1e619e200e821f87215d9683145cf1eb2d813033e3932b44b97d87df9ecc","observation_id":"f09b3a45-9878-4089-908f-0326eac4c8e8","resolution":{"observed_at":"2026-05-17T19:55:11.429684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ramasesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman-Solo, Yuhuai Wu, Behnam Neyshabur, Guy Gur- Ari, and Vedant Misra","venue":null,"work_id":"8ccfa526-9057-465e-a3a9-16848a6ffa04","year":2022},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:80ed58309054ce162d1dcb8fa8880e319a9582ae8073d45dee5cce4732d75b7c","observation_id":"f9515d54-e8fe-48c1-9bbd-5606c72efdf5","resolution":{"observed_at":"2026-05-17T19:55:11.442217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.211","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"O lympiad B ench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":null,"work_id":"7b3c92e2-292d-4caa-8dbe-e949ccf083a8","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:ac324101166aa48e439e714f09a937e225ff00de7529ed425808a92a71a50c74","observation_id":"9d979fce-46d0-43f8-8d39-f56e3b96a242","resolution":{"observed_at":"2026-05-10T15:35:32.779371Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-13T13:50:25.306557+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T13:50:25.306557+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1 𝐾 𝐾Õ 𝑖=1 min 𝑟𝑖(𝜃)𝐴𝑖 ,clip(𝑟𝑖(𝜃),1−𝜖,1+𝜖)𝐴𝑖 !# −𝛽𝔻KL[𝜋𝜃∥𝜋ref] (1) ℒDAPO(𝜃)=𝔼𝑞∼𝒟","venue":null,"work_id":"b1408ffa-5943-4f38-a027-f21105e185f8","year":2023},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:fc45b203cfc3e54ff1449c3a5f4dc819d458f17bbf2337eaec8ce72382885358","observation_id":"c4e071d3-2b33-455d-ae8e-8d1518f2d3f1","resolution":{"observed_at":"2026-05-17T19:55:11.381815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Since89 2 is closer to 8085, we use it: √ 8085≈89.9166, and thus: 𝑝= −1+89.9166 2 ≈88.9166 2 ≈44.4583, which isn’t an integer","venue":null,"work_id":"dab850e7-5f7a-4657-83f9-2a789ea0cccc","year":2021},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:8e407864e71d848564daf4714c0203ad16c7d0c4a8b2548c27fec2d408c88413","observation_id":"c1a15149-0883-499e-970d-7a5a053e60ee","resolution":{"observed_at":"2026-05-17T19:55:11.388731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The factors of𝑝2 are1, 𝑝, and𝑝 2","venue":null,"work_id":"4651abcd-e12f-4a7f-a7fb-8c9b01b63a48","year":2022},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:2635b3c7f5cb93a4d7093164f5eb3f22b20ec08467fee75d7c3c57e7f8fed785","observation_id":"b9f9fc8c-6c00-424e-8b7e-46cdb7af9e72","resolution":{"observed_at":"2026-05-17T19:55:11.391549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"\"\" Returns a sorted list of all divisors of n","venue":null,"work_id":"9a393d00-0a98-4551-aa9c-78fdd04e1adf","year":2021},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:47e4f934a2f2e02a59b04132f24d4f91f27f86a2d8844fe2ef69f32b7bfa094d","observation_id":"ad69b496-dc57-4420-9395-118cc600c70b","resolution":{"observed_at":"2026-05-17T19:55:11.385106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The sum of these three divisors is1+𝑑+𝑛 𝑑 =2022","venue":null,"work_id":"1d44605c-9900-42dc-a9d6-481edd24983d","year":2022},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:f7a9fe95073ead6d0ca59544d30d582859f2e426c6832385f0451fa2d68dc439","observation_id":"9c47dc01-abe8-490c-90d7-7053fcedcbcb","resolution":{"observed_at":"2026-05-17T19:55:11.394049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"reasoning path","venue":null,"work_id":"080c1812-9c28-4723-bbeb-d10c48cd3f41","year":2021},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:2cb34acd6024a1557f5b1fe9d203ccfd9153b924c07336beaed6b8f620e863af","observation_id":"5b250739-dda4-4d81-8bfe-5265199745fd","resolution":{"observed_at":"2026-05-17T19:55:11.399405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T09:35:43.508314Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":1,"verified_exact":25,"verified_fuzzy":20},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2604.11297."}