{"as_of":"2026-08-05T22:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27812f45d4aa843fd7a4741c7e512c3246f8a7bf14311c1216b473223b91d783","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T11:54:29.955833Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.25424/citation-record","integrity":"/paper/2509.25424/integrity","json":"/paper/2509.25424/citation-record.json","paper":"/paper/2509.25424"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1703.05449","last_updated":"2017-07-01T13:00:06Z","snapshot_observed_at":"2026-07-06T05:33:53.318487Z","submitted_at":"2017-03-16T01:31:33Z","title":"Minimax Regret Bounds for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1703.05449","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.05449","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minimax Regret Bounds for Reinforcement Learning","venue":"stat.ML","work_id":"5539795d-0848-46cc-9d73-f08fabb24699","year":2017},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/1703.05449","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:9fce4eca2dd40c0779c580f97e6907f26a142250b1aae2b6da4783a52f07ee85","observation_id":"0e4122ff-ca3b-4075-a6d5-c739314e406b","resolution":{"observed_at":"2026-05-18T11:56:19.827701Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.automatica.2009.07.008","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sutton, Mohammad Ghavamzadeh, and Mark Lee","venue":"Automatica","work_id":"1e458c8b-f88d-4d14-99b1-ea0af5a5f021","year":2009},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:1e03485ace0cf8fcc1f8b21fd2cc5e32a4b1d1f5123c24b3bf5b25cfe87b3eda","observation_id":"1914c4a8-fa7c-414b-b0ec-14e3df6247d2","resolution":{"observed_at":"2026-05-18T11:56:19.701442Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Babyai: A platform to study the sample ef- ficiency of grounded language learning","venue":null,"work_id":"8aa67743-ee21-46da-b80d-c2f1af179a8f","year":2019},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:61695aab3c25c4c432c6fe4fb860ddc73f8b68e8b33b8ec6fd442f2524698172","observation_id":"b9a0af0a-d0ac-4be2-be05-b257b6ddbf6e","resolution":{"observed_at":"2026-05-18T11:56:20.199891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-02T19:59:00.409439Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:aa0419931c9e1eb0ce38034da96e692b150ec865ec36e99e6291bf8032b4bc5b","observation_id":"c0e503b3-e523-4b8f-a701-ff9a49998555","resolution":{"observed_at":"2026-05-18T11:56:20.033957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.15287","doi":"10.48550/arxiv.2412.15287","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Inference-aware fine-tuning for best-of-n sampling in large language models","venue":"arXiv (Cornell University)","work_id":"827ca722-7f31-4433-8fa9-e3b1596372cb","year":2024},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:8f874299d6d562e47c7aabcb15090fd8fce938610a57144d4027631f344390b3","observation_id":"a28d9f83-96a2-4709-a56a-238ee8093fd0","resolution":{"observed_at":"2026-05-18T11:56:19.894737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:e3d4af74bd7917ce1c7af016b507244f94f7a249e0a96ebac7c5f33390827e46","observation_id":"dd7549a0-eae4-444e-8696-951a6f767169","resolution":{"observed_at":"2026-05-18T11:56:19.994404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:168c91ef985d5856858ff5b0421cf2c108390749bb166f8b067af21bdaa56111","observation_id":"85e8162f-36cd-4e2d-a5b7-0d20e902af26","resolution":{"observed_at":"2026-05-18T11:56:19.833356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1205.4839","last_updated":"2013-06-20T10:53:42Z","snapshot_observed_at":"2026-07-06T02:48:31.745141Z","submitted_at":"2012-05-22T08:36:41Z","title":"Off-Policy Actor-Critic","version":5},"cited_work":{"arxiv_id":"1205.4839","doi":null,"metadata_source":"pith","pith_arxiv_id":"1205.4839","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-Policy Actor-Critic","venue":"cs.LG","work_id":"976253b1-14cf-4e7a-a1c8-78bd9d0c8ad0","year":2012},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/1205.4839","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:19c0f649a720c1b1a58389c89114bfe212958452804de67f95b2f5432bd44b4b","observation_id":"234935e7-595c-47ca-aef3-af07a69a4801","resolution":{"observed_at":"2026-05-18T11:56:19.983519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02410","last_updated":"2023-07-02T22:58:51Z","snapshot_observed_at":"2026-08-03T18:37:49.937699Z","submitted_at":"2022-10-05T17:32:16Z","title":"The Vendi Score: A Diversity Evaluation Metric for Machine Learning","version":2},"cited_work":{"arxiv_id":"2210.02410","doi":"10.48550/arxiv.2210.02410","metadata_source":"pith","pith_arxiv_id":"2210.02410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The vendi score: A diversity evaluation metric for machine learning","venue":"cs.LG","work_id":"bfb3a637-0b6f-40c7-a0df-d21712e30504","year":2022},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2210.02410","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:9ec42eddde0443dc267ab359c6966f5391d93eaff806183540cf0e205d10b933","observation_id":"b04fe9f6-bf56-4d94-a267-a3711a02feae","resolution":{"observed_at":"2026-05-18T11:56:20.028364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:24:51.39774+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:24:51.39774+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.08165","last_updated":"2017-07-21T20:25:54Z","snapshot_observed_at":"2026-07-06T05:31:30.388884Z","submitted_at":"2017-02-27T07:16:41Z","title":"Reinforcement Learning with Deep Energy-Based Policies","version":2},"cited_work":{"arxiv_id":"1702.08165","doi":null,"metadata_source":"pith","pith_arxiv_id":"1702.08165","snapshot_observed_at":"2026-07-02T11:46:56.147924Z","title":"Reinforcement Learning with Deep Energy-Based Policies","venue":"cs.LG","work_id":"dd6540db-b1bf-4758-91f6-549318d15827","year":2017},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/1702.08165","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:74f9b2b4993fce876e944994c326fcccc34c1fe6081f2dd17e5142b2633d9765","observation_id":"28dd0253-8e81-4ca1-9bec-701910b0481a","resolution":{"observed_at":"2026-05-18T11:56:19.864851Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":"1801.01290","doi":"10.48550/arxiv.1801.01290","metadata_source":"pith","pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","venue":"cs.LG","work_id":"6674e5db-4e1c-49c0-b598-c108a0ecadb6","year":2018},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:0d9912e1286e856ec8866fe6c49a114c247acdd8da3efd04e68b5856b906d4b7","observation_id":"8b3fdffd-3dba-4940-8a86-87cb9cda0513","resolution":{"observed_at":"2026-05-18T11:56:19.859035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02355","last_updated":"2025-06-20T04:14:47Z","snapshot_observed_at":"2026-07-06T21:35:27.380132Z","submitted_at":"2025-06-03T01:15:15Z","title":"Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening","version":2},"cited_work":{"arxiv_id":"2506.02355","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02355","snapshot_observed_at":"2026-07-03T20:38:55.917128Z","title":"Rewarding the unlikely: Lifting grpo beyond distribution sharpening","venue":null,"work_id":"349bfcd5-c482-404a-961a-599b6e5813d9","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2506.02355","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:6252301e063a7ded5c56041d7cb18258d4e5b506ac6037d77dd8482d348bd6f4","observation_id":"ba013230-dea9-4666-b986-e95ca2f46054","resolution":{"observed_at":"2026-05-18T11:56:19.854228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Marginalized state distribution entropy regularization in policy optimization","venue":null,"work_id":"3806c715-2462-42d2-9024-803e253dd6ea","year":2019},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:72eaf9a8c975cd7a61dc9e73685a1b4db9123ccabaa2fbc3c57975f4c92b954f","observation_id":"b736e6f2-fc7e-4476-b9b8-fb85ef0ec722","resolution":{"observed_at":"2026-05-18T11:56:20.193050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A natural policy gradient","venue":null,"work_id":"de199cde-0d2a-41b9-8572-902f91c7ffb7","year":null},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:ca9889a1afdb65774a0136655e9ca7b0437e5794aedcb9fde5a1da0fd10df5ac","observation_id":"891ae641-6a20-459c-b44b-17d9b4e287e5","resolution":{"observed_at":"2026-05-18T11:56:20.196096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"923e80f6-bd4b-4f13-bcc2-59a44ed35c89","year":2001},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:3d17d67117c7bc60906e1939768462d3acbbc2825e26c92303d774a11400468d","observation_id":"c31ca28c-2017-47c3-94e0-9fed02aa8782","resolution":{"observed_at":"2026-05-18T11:56:20.189783Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kakade and John Langford","venue":null,"work_id":"1dd542d3-0ad4-4a90-ad9b-67859da52e64","year":2002},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:0f4bd2cb2e33010cbecacff37c26125c3e5c21e9e28433037bd5ecb11c80d415","observation_id":"15c00602-be23-4d54-a125-c55e43d1c737","resolution":{"observed_at":"2026-05-18T11:56:20.177156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:f44e72f65bf1cec6332259ae9794b6f1e40d8da2fd7195b83435cd899d1f8cc6","observation_id":"1fb923ae-a3f1-4e42-be94-8fce0d68c6c1","resolution":{"observed_at":"2026-05-18T11:56:19.879623Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14484","last_updated":"2020-12-07T22:33:16Z","snapshot_observed_at":"2026-07-06T10:09:06.864468Z","submitted_at":"2020-10-27T17:41:57Z","title":"One Solution is Not All You Need: Few-Shot Extrapolation via Structured MaxEnt RL","version":2},"cited_work":{"arxiv_id":"2010.14484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.14484","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One solution is not all you need: Few-shot extrapolation via structured maxent rl","venue":null,"work_id":"c0b68808-3ddf-48ac-aeec-a464953e6446","year":2020},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2010.14484","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:ef281a632edd4175b4a33f6174ba32b27ea4dfc70f0d1d440cacb5a2d977ae2e","observation_id":"e3ec2f14-269f-44eb-8395-1e8070994e67","resolution":{"observed_at":"2026-05-18T11:56:19.844565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18101","last_updated":"2025-05-22T17:50:19Z","snapshot_observed_at":"2026-07-06T20:28:14.293619Z","submitted_at":"2025-01-30T02:47:41Z","title":"Diverse Preference Optimization","version":4},"cited_work":{"arxiv_id":"2501.18101","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18101","snapshot_observed_at":"2026-07-04T21:00:08.369769Z","title":"arXiv preprint arXiv:2501.18101 , year=","venue":null,"work_id":"32d91d47-52bb-4678-927b-df217faa6b8d","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2501.18101","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:b32cee38869ab7108f5c9d1272d868fdbe544b58b57302ad1914d76ca8d5bd1f","observation_id":"1bdbf20f-7ede-4e7f-b3ea-34698fa88b5a","resolution":{"observed_at":"2026-05-18T11:56:19.999530Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02534","last_updated":"2025-09-02T17:38:47Z","snapshot_observed_at":"2026-08-05T11:30:06.956863Z","submitted_at":"2025-09-02T17:38:47Z","title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","version":1},"cited_work":{"arxiv_id":"2509.02534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02534","snapshot_observed_at":"2026-07-04T21:00:08.446955Z","title":"Jointly reinforcing diversity and quality in language model generations","venue":null,"work_id":"8405556c-8f03-4c5d-b431-dc9d044e390b","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2509.02534","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:16921bd8238d6178ba56ba526bace2bc2f9079fb0988abd516972dc383e05572","observation_id":"d0ae5256-a762-42b8-908d-a7886cedb03b","resolution":{"observed_at":"2026-05-18T11:56:20.020157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":"a5d765e6-4a9c-4ccb-85a5-257d3eae0726","year":2016},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:cae30cbeab852aa4be037fbe326b4174cd4487c5a13741c32b19d08454e95ee9","observation_id":"60c55b26-fb85-4d1a-9bf1-31bd405cbe5c","resolution":{"observed_at":"2026-05-18T11:56:20.183627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:12c966fc39f9a2a7618ac9425a861b8a88518396646a9ab66adb5789c252d0f9","observation_id":"a255ff8d-3236-48bd-933c-e4d4ee1114dc","resolution":{"observed_at":"2026-05-18T11:56:20.039145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:4f3936243cbe10a6b7044ff8439f787f8a3ff92e558b83756804568106dd770c","observation_id":"60d0afb0-2839-4ec2-86e3-03d148585d63","resolution":{"observed_at":"2026-05-18T11:56:19.822497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15266","last_updated":"2025-08-28T19:09:57Z","snapshot_observed_at":"2026-07-06T21:12:37.115803Z","submitted_at":"2025-04-21T17:47:46Z","title":"Roll the dice & look before you leap: Going beyond the creative limits of next-token prediction","version":4},"cited_work":{"arxiv_id":"2504.15266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15266","snapshot_observed_at":"2026-07-01T22:16:17.003825Z","title":"Roll the dice & look before you leap: Going beyond the creative limits of next-token prediction.arXiv preprint arXiv:2504.15266","venue":null,"work_id":"be971d12-fe47-4e91-862d-d0342692a83b","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2504.15266","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:9ac294d58a47ccf9493dc7e39ffeb96533ea89e787d916d4c7c1f1614e53c1f7","observation_id":"d6bc9b26-11ab-4028-9d08-77562a8bf11e","resolution":{"observed_at":"2026-05-18T11:56:19.989292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:adc06ac315a11dd6d861955ca7739e143362bd91025c36719ca50dd4c8f5ed56","observation_id":"aa64cf93-90a0-4ba0-851a-a2a8f0997d06","resolution":{"observed_at":"2026-05-18T11:56:19.849526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:798cd0622f01acf4a8ae1f2abe45fa4e3d2646aac97917e247d95c9fe773b7e5","observation_id":"76417b47-4424-4e6d-839e-4fd20980bfe9","resolution":{"observed_at":"2026-05-18T11:56:20.010004Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efros, and Trevor Darrell","venue":null,"work_id":"9a9c536a-efbe-4ad6-8123-a6a1829a1cc8","year":2017},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:179a96f5d4aaaf896ebddba7690fdfb6908c5063e625ae097cd99fa4c3a9a65c","observation_id":"630d9676-82fc-46e6-a947-a643463414ce","resolution":{"observed_at":"2026-05-18T11:56:20.186627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":"efd581e2-54f5-4fc5-8d21-cee096007608","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:e0756b67f660994d5d00aba4af37ae5e20ba525f017baa112a6f503b34dc0a44","observation_id":"6039360e-be90-4733-b6b6-5d194c6b1fa8","resolution":{"observed_at":"2026-05-18T11:56:20.180321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14286","last_updated":"2025-03-19T14:25:30Z","snapshot_observed_at":"2026-08-05T18:17:51.546519Z","submitted_at":"2025-03-18T14:23:37Z","title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","version":2},"cited_work":{"arxiv_id":"2503.14286","doi":"10.48550/arxiv.2503.14286","metadata_source":"pith","pith_arxiv_id":"2503.14286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tapered off-policy REINFORCE: Stable and efficient reinforcement learning for LLMs","venue":"cs.LG","work_id":"885b5bf5-7859-4e5a-af07-52a7da4f25c1","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2503.14286","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:0a977f9f3bd259b57ffe94cd603150f4227acbdae515356a65fe62025caa2d9e","observation_id":"37f7dbc8-c5db-4fbd-84f9-c811685013d1","resolution":{"observed_at":"2026-05-18T11:56:19.889672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":"1502.05477","doi":"10.48550/arxiv.1502.05477","metadata_source":"pith","pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trust Region Policy Optimization","venue":"cs.LG","work_id":"8660ac94-3f8e-474f-967f-98304c415ed7","year":2015},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:2c0ce9cf7be0b61605bd39ae61cdb7968d8c5b4258c7aeeea725740d86b7b312","observation_id":"8bb215ef-ad8b-4635-a89c-be7418a0fa5d","resolution":{"observed_at":"2026-05-18T11:56:19.874820Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:6a1fe018ff0ac620411873f30dbae24bae682d6166871306c3b7e976f36cd10b","observation_id":"76d28e10-b94c-4c31-aaf5-dd2a4298d077","resolution":{"observed_at":"2026-05-18T11:56:19.900579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":"1506.02438","doi":"10.48550/arxiv.1506.02438","metadata_source":"pith","pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","venue":"cs.LG","work_id":"38e3ca94-96f0-4b19-a355-0754931af8be","year":2015},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:8594fbd55f3c6e7ed3aca939be705bb127a7880ba28beea2699ae6340304617b","observation_id":"af8158fc-415f-44d3-86bc-83f44bd71a03","resolution":{"observed_at":"2026-05-18T11:56:19.965871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09430","last_updated":"2021-06-21T04:54:56Z","snapshot_observed_at":"2026-07-06T10:42:35.311302Z","submitted_at":"2021-02-18T15:45:17Z","title":"State Entropy Maximization with Random Encoders for Efficient Exploration","version":4},"cited_work":{"arxiv_id":"2102.09430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.09430","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"State entropy maximization with random encoders for efficient exploration","venue":null,"work_id":"a22878ed-f7c8-4e4c-a01c-a57c543a9a23","year":2021},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2102.09430","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:3d3f0f00ebd1e9ae36c3f2335fddbb073d8b0b7e1ba45367f977a58abbbe9b8f","observation_id":"a692778f-f9a5-4280-9270-d63c135da3be","resolution":{"observed_at":"2026-05-18T11:56:19.978592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deterministic policy gradient algorithms","venue":null,"work_id":"89ed7989-afc8-424e-9962-b8050d6f40de","year":2014},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:866a573f1458ec8c332829753cdb352ddc8671b4d86e3b1bb1e1e78523173bdd","observation_id":"b7bb512f-69f9-4d5d-9625-cb1889f37d94","resolution":{"observed_at":"2026-05-18T11:56:20.161695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:68304b4ea5a7772d5f4f1ce1a3f607672c0d48c117a2596583ece88a6d1d0670","observation_id":"d4ccc6a4-9dbb-47c8-9534-019b9f48bcab","resolution":{"observed_at":"2026-05-18T11:56:19.905594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outcome-based exploration for llm reasoning","venue":null,"work_id":"617921ea-40f9-4c40-9679-0232d4022e74","year":null},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:46a61583e0d510ae5c0103fd0d8c1647bb8280ff53c94e026ea963b74994df42","observation_id":"72fefe37-dd24-4dca-8a40-c7316b8ce585","resolution":{"observed_at":"2026-05-18T11:56:20.168482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-04T22:59:12.129500Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:9291f67b176aebdbda5c3db21a281c88558a6075cd263cfedc36ee19c0e0b2e9","observation_id":"93fc4f7e-c621-4a05-9be5-d73b16ef952b","resolution":{"observed_at":"2026-05-18T11:56:20.005263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sutton and Andrew G","venue":null,"work_id":"071ae916-adfe-4ab7-903b-3e81d5c2509d","year":2018},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:52a41d277d5eb8c706d58d1f3375525d95ddc900912c1ef77c3be9f5a36cbca3","observation_id":"a0f56d34-ea0b-4dbf-8066-aee5c87193a0","resolution":{"observed_at":"2026-05-18T11:56:20.174400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sutton, David McAllester, Satinder Singh, and Yishay Mansour","venue":null,"work_id":"83a5ba3b-9eb5-494b-997d-05ea01fd0f5a","year":1999},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:b49c348e5e5a57b7ee591b352b52e63a3243de866f308225c21b0682c375bc59","observation_id":"cacd5bfc-388b-4140-be75-d63d9f2713f7","resolution":{"observed_at":"2026-05-18T11:56:20.171628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-07-06T20:58:23.695292Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:6bb3168b9f6c378f17c4fad2e7190348671e664d53b78c67df88dd36e7bd2ea9","observation_id":"d88b1852-3a90-4dcb-bae8-f1db68cd280a","resolution":{"observed_at":"2026-05-18T11:56:19.949595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01224","last_updated":"2017-07-10T14:38:10Z","snapshot_observed_at":"2026-08-03T09:09:34.456991Z","submitted_at":"2016-11-03T23:21:32Z","title":"Sample Efficient Actor-Critic with Experience Replay","version":2},"cited_work":{"arxiv_id":"1611.01224","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.01224","snapshot_observed_at":"2026-07-02T02:06:27.479687Z","title":"Sample Efficient Actor-Critic with Experience Replay","venue":"cs.LG","work_id":"e424bccd-03ff-4986-ab5b-893e9ecd7977","year":2016},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/1611.01224","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:17a3f213cde4a6499faf64e624f449e3be134354efe6e9206565cb2f095727fe","observation_id":"e13e429c-6794-42ae-bd0c-04190cecee3f","resolution":{"observed_at":"2026-05-18T11:56:19.973162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/bf00992696","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:47:34.373100Z","title":"Williams","venue":"Machine Learning","work_id":"469b3b81-55f9-4542-9dd7-570a63cfda74","year":1992},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:f6ded0e31d07cca6a67af21613f8e9f73b40af556db3b4deae076cc7bc8a58e8","observation_id":"1c486f10-7be1-4d2e-b8c6-5bcf9cea97fd","resolution":{"observed_at":"2026-05-18T11:56:19.717406Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T14:51:33.972563+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T14:51:33.972563+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.14843","doi":"10.48550/arxiv.2507.14843","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The invisible leash: Why rlvr may or may not escape its origin","venue":"arXiv (Cornell University)","work_id":"71f17397-1cd4-4f68-ab1d-e91bb5f5953d","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:b63a221d8adbba18eed717a8b8c2e7821ab2da006a386a9c550e0a39f1da8f6a","observation_id":"e066ec79-ab5f-434f-bbb9-981820444130","resolution":{"observed_at":"2026-05-18T11:56:19.884243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Younis, Rodrigo Perez-Vicente, John U","venue":null,"work_id":"362b1d93-e1f8-4fd1-8d25-9e9bf6f13d31","year":2024},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:9a5e1bfca6a34e51defb292ab85b1ce907dfd3e432b0fcb0f8f811dea05e7e75","observation_id":"426ee7b8-c965-4566-a4da-0495b0120ce6","resolution":{"observed_at":"2026-05-18T11:56:20.164947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:8d1520e8d952c3d4b3047090d9632f2c0b894243073981bad7dc0cc78b36e6c6","observation_id":"00f8689d-e627-40f2-bc05-57a53958efb7","resolution":{"observed_at":"2026-05-18T11:56:19.839256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:32ba0b343e8b4ce1b42c6edfac2a1e922577dd9307b0bda5d06f7b0d7dacfeaf","observation_id":"00fbc4c2-9c5b-40c1-aa1b-b0aefdd8721c","resolution":{"observed_at":"2026-05-18T11:56:19.869625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05228","last_updated":"2025-08-09T18:33:13Z","snapshot_observed_at":"2026-08-01T15:38:55.010903Z","submitted_at":"2025-04-07T16:14:23Z","title":"NoveltyBench: Evaluating Language Models for Humanlike Diversity","version":4},"cited_work":{"arxiv_id":"2504.05228","doi":"10.48550/arxiv.2504.05228","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.05228","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Noveltybench: Evaluating language models for humanlike diver- sity","venue":"ArXiv.org","work_id":"aba32c56-61d8-4972-9c8b-b852f95b11b0","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2504.05228","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:f4403d186299ff144b822be93d1bb1ece373bb1b471634d924875a0b6c7984ce","observation_id":"41e0bbe0-176c-4be0-b935-3b4d5c574488","resolution":{"observed_at":"2026-05-18T11:56:19.942452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:bc2f7e564a15135c39120ebdcfb313973865e01a3afc9acb414406a197e5d51d","observation_id":"f5cb03da-797e-420f-9839-d10cf6717f17","resolution":{"observed_at":"2026-05-18T11:56:19.958923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:e7a2b94ef13c6981ce1928931913327744fd5cb71a1ef389d79fa230aa8c5547","observation_id":"2c8cc3e7-1bb4-45ac-b3e7-7c18835230f0","resolution":{"observed_at":"2026-05-18T11:56:20.014957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","latest_version":6,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":1,"verified_exact":32,"verified_fuzzy":12},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2509.25424."}