{"as_of":"2026-08-05T15:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f74175832f5f603e62c37f70c00ea9e668f6e4d5b7c97fc32743a12732de81ec","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T22:35:35.287039Z","state":"measured"},{"denominator":131,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":131,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:39:08.244079Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2506.01770","last_updated":"2026-04-18T05:40:12Z","snapshot_observed_at":"2026-08-04T01:20:56.393646Z","submitted_at":"2025-06-02T15:17:38Z","title":"ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T11:34:09.428653Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2506.01770"},"observation_digest":"sha256:ff45f77690c9d217f34d05584d1a5c8cab6def3e41739b831ddbeb144e988f6a","observation_id":"b90d553c-2bc3-4b50-a060-c07269eedf3a","resolution":{"observed_at":"2026-05-19T11:37:16.014516Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2506.12382","last_updated":"2026-04-27T08:32:16Z","snapshot_observed_at":"2026-08-02T04:53:57.144183Z","submitted_at":"2025-06-14T07:31:52Z","title":"Exploring the Secondary Risks of Large Language Models","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T09:40:58.067398Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2506.12382"},"observation_digest":"sha256:56086211ec8ed68fd9931f64b3fe0450f967cfd6b56f3c555a8234c192014c11","observation_id":"4bb4783a-b6b6-4dad-bb60-51766d8a175a","resolution":{"observed_at":"2026-05-19T09:42:13.985529Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2508.16771","last_updated":"2026-07-02T23:23:00Z","snapshot_observed_at":"2026-07-09T23:16:38.895546Z","submitted_at":"2025-08-22T20:08:09Z","title":"EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T20:54:30.449792Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2508.16771"},"observation_digest":"sha256:d22902ff3360925860a716b2a150f5a861975a139c44774a270f3f81819d6402","observation_id":"ebd692bf-faeb-40d8-9d2e-c6ff0bde5d3a","resolution":{"observed_at":"2026-05-18T20:56:51.816772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-08-04T09:31:07Z","snapshot_observed_at":"2026-08-05T14:49:40.918290Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:8fdecc7644046bfae79174bb119719873e289a47e4c1f1c7ba42b475dbc803e9","observation_id":"5f5c0311-173e-4dcc-b796-221408854dff","resolution":{"observed_at":"2026-05-18T20:41:50.436344Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:555bb71e2d54402d74eaaae0bd1870f091d109438bac843f689df588a5aba968","observation_id":"fd962b78-169e-4c63-8873-44cb2333d49d","resolution":{"observed_at":"2026-05-18T19:21:48.376249Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T10:39:08.244079Z","title":"A comprehensive survey of LLM alignment techniques: RLHF, RLAIF, PPO, DPO and more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-05T10:38:56.478715Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":273,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:08.244079Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:432126b28831c8e04b959006e1d67007befcc1195d916d811b04ce73bf8b962b","observation_id":"cf9f655d-a984-48d5-a5e7-b7d55157347a","resolution":{"observed_at":"2026-08-05T10:39:08.244079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T04:50:32.523428Z","title":"A comprehensive survey of llm alignment techniques: Rlhf, rlaif, ppo, dpo and more,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05946","last_updated":"2025-09-07T06:46:03Z","snapshot_observed_at":"2026-08-05T14:52:11.492382Z","submitted_at":"2025-09-07T06:46:03Z","title":"Large Language Models for Next-Generation Wireless Network Management: A Survey and Tutorial","version":1},"reference_index":265,"source":"pdf_text","source_observed_at":"2026-08-05T04:50:32.523428Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2509.05946"},"observation_digest":"sha256:53825dbbe427b70efec7b0e932ee8e85cc5828a9ebb4419249dbe4743e4e0834","observation_id":"e6b7f581-ab53-4d4e-a416-17ebd7aa179b","resolution":{"observed_at":"2026-08-05T04:50:32.523428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-04T23:03:16.345319Z","title":"A com- prehensive survey of llm alignment techniques: Rlhf, rlaif, ppo, dpo and more.arXiv preprint arXiv:2407.16216, jul 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06838","last_updated":"2025-09-08T16:08:31Z","snapshot_observed_at":"2026-08-04T23:03:15.289775Z","submitted_at":"2025-09-08T16:08:31Z","title":"EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:03:16.345319Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2509.06838"},"observation_digest":"sha256:d42e3b52c2a005f131dd5a998f54a03a26b1d10339d771c07d78aedeef99e27e","observation_id":"2a15aba6-4d84-491b-bcb5-292e9565c697","resolution":{"observed_at":"2026-08-04T23:03:16.345319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2509.07794","last_updated":"2026-05-07T13:52:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-09T14:31:11Z","title":"Query Expansion in the Age of Pre-trained and Large Language Models: A Comprehensive Survey","version":3},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:33.612858Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2509.07794"},"observation_digest":"sha256:97ca77a11361c0424072b3cdda7991dbba6ff6ecd44148d0668ca1e754eb9e51","observation_id":"df2adc50-b14f-4bd0-b9ea-a23274a516e8","resolution":{"observed_at":"2026-05-18T18:11:42.974325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-04T16:07:43.117616Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:43.117616Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:dd376f46dad2b6d0ce1a3f59ca78aca95128fe04b06533bc4b7a8c1c221da0c2","observation_id":"f6300611-2eb1-4a5e-a01d-40ed2a7fe2ec","resolution":{"observed_at":"2026-08-04T16:07:43.117616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2510.08141","last_updated":"2026-05-18T14:17:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T12:24:08Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","version":7},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T20:30:17.581842Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2510.08141"},"observation_digest":"sha256:4d7cb3a9d90ea3818b8f66ff61a98e7750c37bca4c897b627784afd2b67bea82","observation_id":"2b16c4e7-1b7c-4756-b793-777bda1359ce","resolution":{"observed_at":"2026-05-21T20:30:35.472865Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-04T09:28:13.001684Z","title":"A comprehensive survey of llm alignment techniques: Rlhf, rlaif, ppo, dpo and more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15514","last_updated":"2026-05-24T15:31:17Z","snapshot_observed_at":"2026-08-04T09:28:11.420694Z","submitted_at":"2025-10-17T10:34:59Z","title":"Voting with the Graph: Stable RLAIF via Topological Consistency Maximization","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T09:28:13.001684Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2510.15514"},"observation_digest":"sha256:df9b1839bedb516f8eb04220e1fb0589aabc69f2e441d572c67dbe1c8fd2bc36","observation_id":"1bfb6bdd-e510-45ea-b57f-d08bcbf58d1a","resolution":{"observed_at":"2026-08-04T09:28:13.001684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-03T22:02:16.789125Z","title":"ArXivabs/2407.16216(2024),https: //api.semanticscholar.org/CorpusID:271334000","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12796","last_updated":"2025-12-01T17:18:39Z","snapshot_observed_at":"2026-08-03T22:02:15.985555Z","submitted_at":"2025-11-16T21:55:59Z","title":"Maximizing the efficiency of human feedback in AI alignment: a comparative analysis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T22:02:16.789125Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2511.12796"},"observation_digest":"sha256:398035bd67af062e7e5f0b34f8e66446037e4a154eb363b8951da08ec93b8a59","observation_id":"206d97fe-d9ff-4a62-b3a1-b31282853cbe","resolution":{"observed_at":"2026-08-03T22:02:16.789125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2602.02280","last_updated":"2026-05-12T03:47:11Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:20:51Z","title":"RACC: Representation-Aware Coverage Criteria for LLM Safety Testing","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:55.296932Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2602.02280"},"observation_digest":"sha256:248d223b1f86a573bb9ad0b4dd70558bfdeccfd6948b01b9ad76008b310ae3dc","observation_id":"ee8de5cb-22a3-44e6-a3c6-92adee7be1f8","resolution":{"observed_at":"2026-05-16T08:17:36.555589Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2602.07892","last_updated":"2026-05-12T03:21:50Z","snapshot_observed_at":"2026-07-06T22:45:00.816348Z","submitted_at":"2026-02-08T09:53:46Z","title":"Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2602.07892"},"observation_digest":"sha256:5fa8300c679da1c9f41ec2c46bf995a92c04522e496717d5dd01fa6402877bfa","observation_id":"57d1d6d9-8bba-4db0-b197-cc43eed7a2ad","resolution":{"observed_at":"2026-05-16T06:40:41.730258Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2603.18113","last_updated":"2026-05-09T03:21:15Z","snapshot_observed_at":"2026-08-02T05:27:37.366682Z","submitted_at":"2026-03-18T14:05:51Z","title":"VC-Soup: Value-Consistency Guided Multi-Value Alignment for Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T09:38:32.977517Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2603.18113"},"observation_digest":"sha256:5a6d65757c2f2ab215f835eca177dede982a52d0c0450be51cf41ac713813474","observation_id":"92febfba-be07-4bce-956e-4459d2f6ea71","resolution":{"observed_at":"2026-05-15T09:39:54.359255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2604.07754","last_updated":"2026-04-09T03:20:29Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T03:20:29Z","title":"The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:56.476698Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2604.07754"},"observation_digest":"sha256:979f278c54b6d4ca29cafb9d6bdb646d88c47394775668460f96e9d921b21656","observation_id":"a87cf072-c53d-482d-9bf8-bd7207b29052","resolution":{"observed_at":"2026-05-11T00:45:50.664592Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2604.11259","last_updated":"2026-04-13T10:12:03Z","snapshot_observed_at":"2026-08-03T00:30:16.982532Z","submitted_at":"2026-04-13T10:12:03Z","title":"Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T16:11:49.149334Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2604.11259"},"observation_digest":"sha256:c2efb14cf51dc5a1b6f43f6fb8765b40554628989f12af5ff03e6cb08ed4e9cc","observation_id":"b479ae6a-3f9f-4648-b20e-7e70fce63411","resolution":{"observed_at":"2026-05-11T09:11:01.113709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2604.19083","last_updated":"2026-04-21T04:52:38Z","snapshot_observed_at":"2026-07-06T23:05:48.885141Z","submitted_at":"2026-04-21T04:52:38Z","title":"ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-10T03:00:34.862711Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2604.19083"},"observation_digest":"sha256:4f2c1f65bf818f646a77a5452d2ee4d02fd067bc6cd7567a3546dbe062b448e9","observation_id":"07619aec-be4c-422f-9420-92393b1334c8","resolution":{"observed_at":"2026-05-11T12:46:05.553273Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2604.23543","last_updated":"2026-04-26T05:41:40Z","snapshot_observed_at":"2026-07-06T23:09:43.659053Z","submitted_at":"2026-04-26T05:41:40Z","title":"Pref-CTRL: Preference Driven LLM Alignment using Representation Editing","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-08T06:28:14.378602Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2604.23543"},"observation_digest":"sha256:465fc415d0f9f080610f989863d76f37529a4b98e9037a91454bfa983d0d26ae","observation_id":"ad446046-50cc-4b8d-aaff-a5c5998ef8af","resolution":{"observed_at":"2026-05-11T21:11:19.342574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2604.24536","last_updated":"2026-04-27T14:33:45Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:33:45Z","title":"Generating Place-Based Compromises Between Two Points of View","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-08T03:36:31.695964Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2604.24536"},"observation_digest":"sha256:ed2627a1ce56ecd431d07242bece8dd505ebfbcdb9a31ce8694864426a37cc49","observation_id":"b5582d48-55c7-485b-9d8f-d0866a6e76b0","resolution":{"observed_at":"2026-05-11T22:01:12.088276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:674551d6ee40fd9084816387712e600ccd3d6598555b78b6c52099e194ed18e2","observation_id":"70210b30-9bb9-4993-a0ae-25a3c5d1a2e2","resolution":{"observed_at":"2026-05-12T10:21:29.964715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:4319c247061614cdc4a992dcaa76307d20df3a514eb711d571d3fcae3d115558","observation_id":"7d51e331-406f-4c13-9633-1e0b2752d58f","resolution":{"observed_at":"2026-05-11T22:11:16.721393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:b5a8a96081b827263b5e86077b3f94e3f91859970bab9b954268d48004c032ed","observation_id":"9e58f133-85e0-40f4-b5a1-a9d462a264cd","resolution":{"observed_at":"2026-05-19T17:02:40.688757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2605.00553","last_updated":"2026-06-30T04:24:39Z","snapshot_observed_at":"2026-07-06T23:13:57.367556Z","submitted_at":"2026-05-01T10:42:08Z","title":"Stable-GFlowNet: Toward Diverse and Robust LLM Red-Teaming via Contrastive Trajectory Balance","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-09T19:29:36.348680Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2605.00553"},"observation_digest":"sha256:b1678fcf79cc75d26c7a5bfd9a33b53bfb42de027e5b164529a8f9b99bb03e9b","observation_id":"8cb754df-3e9a-48c1-9039-97b4dcbdc9ff","resolution":{"observed_at":"2026-05-11T15:41:17.804578Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2605.11516","last_updated":"2026-05-12T04:39:34Z","snapshot_observed_at":"2026-07-06T23:23:21.034839Z","submitted_at":"2026-05-12T04:39:34Z","title":"Agents Should Replace Narrow Predictive AI as the Orchestrator in 6G AI-RAN","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T02:12:21.409833Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2605.11516"},"observation_digest":"sha256:55fdc0d506da6e9cbf61ec210c8eeb47e71ab64d85bc702b5388c47f025717c2","observation_id":"2045f3d6-b30b-407c-adac-2243f11ef719","resolution":{"observed_at":"2026-05-13T02:17:06.980568Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2605.11549","last_updated":"2026-07-09T00:30:05Z","snapshot_observed_at":"2026-07-12T23:17:31.453532Z","submitted_at":"2026-05-12T05:26:09Z","title":"UNIPO: Unified Interactive Visual Explanation for RL Fine-Tuning Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T01:38:16.943754Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2605.11549"},"observation_digest":"sha256:0210e98d7b5f6b9ba90d800ea944aabb4eb3f6b97a098afc429da9faadca1636","observation_id":"ebaa50f6-de7e-4137-8a96-7d14b955712b","resolution":{"observed_at":"2026-05-13T01:42:03.971815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2605.16776","last_updated":"2026-05-16T03:15:35Z","snapshot_observed_at":"2026-08-01T18:28:14.332482Z","submitted_at":"2026-05-16T03:15:35Z","title":"Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-19T21:49:07.440832Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2605.16776"},"observation_digest":"sha256:26a2d293ffb1306baa640b5e82ef54247ffa7ce72d2bfeb47648539b6bd5da70","observation_id":"a5d940f6-bc0f-45d8-9b48-614becafa94a","resolution":{"observed_at":"2026-05-19T21:52:48.235735Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2605.18799","last_updated":"2026-05-11T09:22:39Z","snapshot_observed_at":"2026-08-03T03:54:24.879979Z","submitted_at":"2026-05-11T09:22:39Z","title":"ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T22:51:56.666980Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2605.18799"},"observation_digest":"sha256:db74d89449ffd4dd49b2790d472831b68b7d73015b337d78f2d235a761fc8946","observation_id":"514183ef-2b4a-4335-a865-9861bc6f4aa6","resolution":{"observed_at":"2026-05-20T22:53:49.325337Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2606.07678","last_updated":"2026-06-04T20:23:23Z","snapshot_observed_at":"2026-07-06T23:47:19.773490Z","submitted_at":"2026-06-04T20:23:23Z","title":"DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:28:54.243385Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2606.07678"},"observation_digest":"sha256:0e1a9e5b1e5e3f1ca7c8811218a96423cfc02350855c466f4b64219a2499fa30","observation_id":"1970e252-73e9-4025-abff-429e5b4c6713","resolution":{"observed_at":"2026-07-02T12:06:56.031254Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2606.28998","last_updated":"2026-06-27T16:22:22Z","snapshot_observed_at":"2026-07-07T00:03:02.476882Z","submitted_at":"2026-06-27T16:22:22Z","title":"Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T08:30:37.016856Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2606.28998"},"observation_digest":"sha256:7de33ab026cb5fa403cce75c728335d238789b3f85066f202862a400fa47b588","observation_id":"f6851d24-0f0d-4dbb-9124-28228106628e","resolution":{"observed_at":"2026-06-30T08:34:26.678705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2606.30887","last_updated":"2026-06-29T20:22:25Z","snapshot_observed_at":"2026-07-07T00:04:39.472457Z","submitted_at":"2026-06-29T20:22:25Z","title":"Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-01T01:57:54.065453Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2606.30887"},"observation_digest":"sha256:2f28bb5cda3f4e05c919cff96e463edfe18ac62381a270506634f82935eabdaa","observation_id":"a7acfd67-0f89-4f61-9688-2203b6f2ddcd","resolution":{"observed_at":"2026-07-01T12:35:43.844499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-02T05:36:16.410995Z","title":"A comprehensive survey of llm alignment techniques: Rlhf, rlaif, ppo, dpo and more, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13315","last_updated":"2026-07-21T18:05:20Z","snapshot_observed_at":"2026-08-04T06:42:30.450999Z","submitted_at":"2026-07-14T22:38:39Z","title":"Meta-Learning Preferences for Multilingual LLM Alignment","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T05:36:16.410995Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2607.13315"},"observation_digest":"sha256:e6208c430ae61907bb24535518a9bc599371b76bece9fc76a5ded846e23390ba","observation_id":"8da3d815-7164-449f-9afb-35f55a83bc06","resolution":{"observed_at":"2026-08-02T05:36:16.410995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-01T10:22:41.813908Z","title":"A comprehensive survey of LLM alignment techniques: RLHF, RLAIF, PPO, DPO and more.arXiv preprint arXiv:2407.16216, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20286","last_updated":"2026-07-22T15:31:28Z","snapshot_observed_at":"2026-08-03T07:47:40.528440Z","submitted_at":"2026-07-22T15:31:28Z","title":"Sound Probabilistic Safety Bounds for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T10:22:41.813908Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2607.20286"},"observation_digest":"sha256:66351f3c15b8e7caec49c3ee51ee4773f630ca057072d0d1f547ef2c87b43673","observation_id":"59a1edaa-924c-4831-a5be-ff2c11c0bace","resolution":{"observed_at":"2026-08-01T10:22:41.813908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-07-30T11:44:36.074744Z","title":"Acomprehensivesurveyofllmalignment techniques: Rlhf, rlaif, ppo, dpo and more.arXiv preprint arXiv:2407.16216,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27081","last_updated":"2026-07-29T16:07:19Z","snapshot_observed_at":"2026-08-02T14:52:36.559128Z","submitted_at":"2026-07-29T16:07:19Z","title":"On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T11:44:36.074744Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2607.27081"},"observation_digest":"sha256:6508cd441a93d503256e6c673422bbf8e70c134826af357540af8075e245abd5","observation_id":"d6cadd64-ae02-4da7-8972-71698e65181d","resolution":{"observed_at":"2026-07-30T11:44:36.074744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.16216/citation-record","integrity":"/paper/2407.16216/integrity","json":"/paper/2407.16216/citation-record.json","paper":"/paper/2407.16216"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"a23dc4bf-e5af-45a4-bc2b-3f6add5e0a4a","year":2019},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:b8ccebb93671b0bea05515d9a050b9028c2d4fd36508edc753d432925c3582d9","observation_id":"41ee95c0-ed31-4565-8582-4bec1964d30a","resolution":{"observed_at":"2026-05-23T22:35:51.479044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6638142d-6e8b-44ce-bd31-8f90491553fd","year":2022},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:c9b61bc2e5316abe02322aadbea28538935ec35cc2edacacf6042ce42554c6e1","observation_id":"5ab86491-1f11-4173-8582-3f0e9a83c074","resolution":{"observed_at":"2026-05-23T22:35:51.482409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:03:45.699690Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":"6b9cf002-ab59-4c61-ae20-2d2f7b0eecaf","year":2022},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:5699fe56067351be73624671ed765277c844f8813d6c4d600c73b7b97cca6868","observation_id":"d6f3456d-b78f-48fb-91fe-f27f3bdc1e3b","resolution":{"observed_at":"2026-05-23T22:35:51.486346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c57f3a24-bf3b-4474-8059-09e5bb51cf81","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:e97654bb590d50b0d430e7d7c75f19bc6a1c09b55addeac7b0151872030fe090","observation_id":"8bdeb67b-9621-411b-ac3d-f21b74ef9217","resolution":{"observed_at":"2026-05-23T22:35:51.416492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"8e036718-388a-4fcc-a476-3f1fb9cc1188","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:ac4d547922adcbaf74f1975032ab922073755934e1dca05293121964f053e2ca","observation_id":"a7510842-3eba-4869-9e23-ef019229ee74","resolution":{"observed_at":"2026-05-23T22:35:51.475329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:7f27841a8ebb1044471be172e00d84ec76b03047ece9047a90015b7d27e0e284","observation_id":"710a6eb1-3f02-4ac1-b880-ee18e4d8020b","resolution":{"observed_at":"2026-05-23T22:35:50.304630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":"86ecec93-24e2-4778-834b-4ad4e4439e3a","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:465918f01171509df4da082e1c228e282f89a730e094d206a2d646bc1b4d1f74","observation_id":"df9518d0-8156-496d-a784-1b0110a74a29","resolution":{"observed_at":"2026-05-23T22:35:51.378072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint","venue":null,"work_id":"7fff4296-9e6f-4527-9276-2b38ca8a435a","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:48250262b24eb15d4d4f082f9879dce9a65ebe031a6060885240848a092bb2ac","observation_id":"19cb9fd8-1e69-4193-8b94-52e65e2b02ce","resolution":{"observed_at":"2026-05-23T22:35:51.397901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":"87072128-f477-4e88-b54a-1eb27a8e6e87","year":2022},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:b3985626de36e9a12a29d67edcd0dbef8aaf589a009e2cdebd6651e3d7b19ee3","observation_id":"a5bedc3d-3223-4c19-9b81-8134f8cca61a","resolution":{"observed_at":"2026-05-23T22:35:51.639341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rlaif: Scaling reinforcement learning from human feedback with ai feedback","venue":null,"work_id":"f7ea8f72-a9f3-43e1-a350-382e6ef6b448","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:0e6fa11bdb2f2832e6d96759da36ec138b50195e44da7aed551425bd0227f826","observation_id":"737657c7-ad21-433e-883a-e52a6140e94e","resolution":{"observed_at":"2026-05-23T22:35:51.573067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e898f9fc-601a-4f27-86d8-57df6e689818","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:10fc9c28431e13510c325c806b80668fa7a6ab3ede3f05a54f5860c755fd9128","observation_id":"5bad53b0-48e8-417a-b203-af6f6f171569","resolution":{"observed_at":"2026-05-23T22:35:51.583731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":"3e3eb55c-07f8-4db7-9442-7895384ede16","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:e39171896891477321eca0c7a939396e0aa11a57757fc7e2648b368c8d636d13","observation_id":"f9169425-faf9-488b-a6c6-bb694d11a966","resolution":{"observed_at":"2026-05-23T22:35:51.545251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive","venue":null,"work_id":"73866b11-bf6d-4f1c-9f0d-3f7dff450fb3","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:1666bfa440a6424ce1c63f274e80b0c3737cd9fd744e264d8fe5284981cd08a3","observation_id":"90bfbf4d-0a77-4b8f-ac5e-338a80697b01","resolution":{"observed_at":"2026-05-23T22:35:51.539904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"β-dpo: Direct preference optimization with dynamic β","venue":null,"work_id":"aa37221f-7cf2-4f14-8de7-fde2ade32e7e","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:48dbee8f479608d96cc6dcc38a3a1a1c87b47b42aef7c9815918d7776c103742","observation_id":"12833e43-3931-4d83-814e-a1eb31bcf212","resolution":{"observed_at":"2026-05-23T22:35:51.549126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":"1566c4f1-846f-4750-8161-dc5cd585eee0","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:9b3b73e5ca527a2044f4cf36f4bca97f849660d688ecec75b7a24f4946b83bb2","observation_id":"74acbde2-9219-46fb-bbbd-3f62361eb642","resolution":{"observed_at":"2026-05-23T22:35:51.565905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"sdpo: Don’t use your data all at once","venue":null,"work_id":"23112592-93e5-4206-89ed-f8b3135e5f2d","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:814009cd1b79eeb3a1361f53272f0611e563a0ef0bbd8a0f23b0d58bf063d04a","observation_id":"ee29a6ea-2640-41c1-bd86-8919971c360d","resolution":{"observed_at":"2026-05-23T22:35:51.615981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From r to q∗: Your language model is secretly a q-function","venue":null,"work_id":"f465a6b6-9c25-4260-be20-3bdbc7248191","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:94222939520122ad8f3027aecfaf56b86bfc451e97412425ba1dc21a07d025e0","observation_id":"f2cd99c0-c23d-4eae-bca1-fdd7cb9a4f4f","resolution":{"observed_at":"2026-05-23T22:35:51.693376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token-level direct preference optimization","venue":null,"work_id":"c788a79e-4f11-4700-b97b-6b938e4a5e85","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:58ddde902e5cb5bf6fdabd28d52cb5d88f817b3584969bd840a73a6b0c435a41","observation_id":"37068e4e-f7d9-4b17-8516-1620c2cff80c","resolution":{"observed_at":"2026-05-23T22:35:51.493725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.342100Z","title":"Self-rewarding language models","venue":null,"work_id":"82c18977-9919-4b3d-acb0-9213ff528c17","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:faf08d34c75a015565967bea2c14f22b5e60187ae1454fe04e01e4c1b504c2a4","observation_id":"2e864275-507d-4ae1-9998-22abf3fcbc60","resolution":{"observed_at":"2026-05-23T22:35:51.470156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Some things are more cringe than others: Iterative preference optimization with the pairwise cringe loss","venue":null,"work_id":"d1952cc2-e0f9-4037-9f16-85aded2f485b","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:76bca700ff6c708e9558af9fa64314e8183b42646601953a02de05e3699a82dc","observation_id":"5ab8bc47-8da8-4d3e-99f2-450e8633bd52","resolution":{"observed_at":"2026-05-23T22:35:51.498202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":"fb528acb-6a1f-4a20-8678-6aed24021545","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:cca2f4b80487c50abc2c86116e59153bd2328f747f885299430a47ed03f887e5","observation_id":"14e27ea6-a84f-445e-8675-73cda460eed1","resolution":{"observed_at":"2026-05-23T22:35:51.531924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Offline regularised reinforcement learning for large language models alignment","venue":null,"work_id":"65190fa5-afa5-48f4-9da3-afc34890fb9f","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:8a2dfa1b2cbb3be470e2657daea62862d24ad334b493c7b08492f225909d6ac7","observation_id":"eb2c37f0-9d2b-40a5-bde0-424cc1cc69a9","resolution":{"observed_at":"2026-05-23T22:35:51.514400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orpo: Monolithic preference optimization without reference model","venue":null,"work_id":"2db51ac0-eea3-4666-b3a9-6bcff3f26583","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:18fde4cc8f3bab4a6f7f59bf7a9b1c038f25a8b98632f1b4399be7474503bc4c","observation_id":"2dc7bb51-2f68-439e-bc2a-7eec04505a71","resolution":{"observed_at":"2026-05-23T22:35:51.507139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paft: A parallel training paradigm for effective llm fine-tuning","venue":null,"work_id":"a54f35e3-e6b0-41ed-b376-5282318162df","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:fc89285aea6433418757aa463f69969b12bad584b585c3868ca9b5df2a34c7b8","observation_id":"3a15b19e-901b-4da0-895f-1ff4d2d85cad","resolution":{"observed_at":"2026-05-23T22:35:51.462277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":"fde656b5-8fda-4060-8c29-41add70cbca2","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:3a8b41d608dad1b3244fc0e988dc1cad03006cc0737769dee18f9afe775c670b","observation_id":"2c05bf88-20f3-4fd2-854a-c08d4b8f7cc1","resolution":{"observed_at":"2026-05-23T22:35:51.489672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":"d7b3d298-d04a-4afb-8b01-154e325df19f","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:fe9ca5bd7ea58145aa40f6657cc65f3c4488de317d3a866e0c8b8577124d345a","observation_id":"cba4f34d-36e6-4e27-8479-93be185c267e","resolution":{"observed_at":"2026-05-23T22:35:51.524829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":"65bd13f6-c36f-448c-86fb-2feb9f02e93d","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:4e82781681090625d19bd11505c13f42ef0bc198f305dd2e49ce52712e0af4be","observation_id":"d7983a5b-7419-4b44-949b-68ce7060fac5","resolution":{"observed_at":"2026-05-23T22:35:51.441352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liu, and Xuanhui Wang","venue":null,"work_id":"e2bf3069-52ee-40f4-8193-a5657877e0aa","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:d370a32096baab6b60d992db546bbcb81f862ff69c0fcf03e86fddb5bdca1770","observation_id":"ff98a8ae-3b4e-4d9f-aaf1-44c676d78743","resolution":{"observed_at":"2026-05-23T22:35:51.559480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rrhf: Rank responses to align language models with human feedback without tears","venue":null,"work_id":"3bfc6802-e296-4fe6-9ceb-10f340575f2a","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:ff16cbe7d3c1af7b8e5e55444ab0b40c30acc03846d5ee897547c9beff546daf","observation_id":"d4d7fde4-792c-4b0d-b6a0-3cddc5a58f94","resolution":{"observed_at":"2026-05-23T22:35:51.580163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preference ranking optimization for human alignment","venue":null,"work_id":"1766e5b7-1dfa-408d-ae08-423de531a520","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:dadd8c6377299161620bc862d9b3a05299fae9001167903850acd8bc8b2f6ef1","observation_id":"11a31772-b1e4-4f5d-b2c1-99ac4f709805","resolution":{"observed_at":"2026-05-23T22:35:51.503370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Negating negatives: Alignment without human positive samples via distributional dispreference optimization","venue":null,"work_id":"40479fd1-24e1-4bcd-8f34-d8b616afc377","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:9e09b95037b85781a6c55a9520afbecbc9b6be5b1fe634213cfb07753d477607","observation_id":"e0b4a298-5c89-452c-b199-8df7ba70b1a6","resolution":{"observed_at":"2026-05-23T22:35:51.419438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Negative preference optimization: From catastrophic collapse to effective unlearning","venue":null,"work_id":"50cb50a5-692b-4a5f-94e5-998b643781d5","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:9658c8a5b0807584f5f394018ad9ccac3dfb1d9b2ae4a640d901abba81a224c9","observation_id":"e143ba21-90f9-4991-871d-9f73a25da5c9","resolution":{"observed_at":"2026-05-23T22:35:51.511504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contrastive preference optimization: Pushing the boundaries of llm performance in machine translation","venue":null,"work_id":"fa328105-6617-42d2-abd0-6eb7219c387b","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:35a1373a7bb14c65357c85a5422ee6c4d2abb06f355d542ad1ee0b0256ebd6b0","observation_id":"aea6477c-9704-42a0-b7ed-bd91fc5afd24","resolution":{"observed_at":"2026-05-23T22:35:51.536251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mankowitz, Doina Precup, and Bilal Piot","venue":null,"work_id":"9d42b861-0150-4afc-8447-663de53aa35e","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:3503a10cbb5adad01ea16e2a076fbe4336c264c381870fd6cee863dc62e9a5d9","observation_id":"81382c5c-effc-4216-bb54-8f9c4e55463e","resolution":{"observed_at":"2026-05-23T22:35:51.510618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A minimaximalist approach to reinforcement learning from human feedback","venue":null,"work_id":"670630be-1b11-43bc-9120-98263d25a2b0","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:6dbae8b7f2982853aae5b44730544b257cc93906472cd527b4ca6ce1533a6ad3","observation_id":"a4f2e5ab-84a8-4f7b-8232-be7600e3cb30","resolution":{"observed_at":"2026-05-23T22:35:51.415463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"0dd3d9e0-ef26-4a2c-824c-5e5b828f004d","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:471a6fecd3757e101b6805728049748f4ac1e06fc1ce58df5a7b5624041e34ee","observation_id":"d32da5e4-3c98-43c7-ba72-639be4d84958","resolution":{"observed_at":"2026-05-23T22:35:51.401392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":null,"work_id":"9f52a46d-92ab-4b39-88fa-6f6dd42ba82b","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:ee47bf97c597239171e7aac90186bfd0de5e87a55423623936c946f108304391","observation_id":"a8b485f9-bed1-48bb-b1a1-db9f3f5814d1","resolution":{"observed_at":"2026-05-23T22:35:51.408714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0e4043c1-f9db-49d4-991f-f8ac9da49444","year":1952},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:398e075dacb7ade5856c24f8f50ff7d50a804ad927f7b7c7a5b045a7e708bc7c","observation_id":"7456c3d9-499d-4871-9292-2ecdbe5a8a2b","resolution":{"observed_at":"2026-05-23T22:35:51.391681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A markovian decision process","venue":null,"work_id":"93d29c63-57f4-42d2-bedb-a014b01c34bc","year":1957},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:c2e4f58be7489f966f93ea191ee839a8668e01e99cc85f2292fd4eb8fc11c4c5","observation_id":"a57386fa-1f0c-4055-976e-6be0bc487193","resolution":{"observed_at":"2026-05-23T22:35:51.388440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashimoto","venue":null,"work_id":"88aad9bb-739c-495c-b021-f1977fc82172","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:01ff15165fed5679321a905ae00b542fb5cd57d47eb318221c9946e0dc0cf54f","observation_id":"8ab25870-c9a6-46db-82e5-00fd6a328bc9","resolution":{"observed_at":"2026-05-23T22:35:51.394727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"61d34a5f-3525-4046-b217-7110c889eb7a","year":2002},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:551cbdc20335b73509d4de332c062f9a3d7277b2a5a43a348d97a55adb77fce1","observation_id":"a1778653-468c-4c57-ae85-77d0e4da3496","resolution":{"observed_at":"2026-05-23T22:35:51.412117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"aca82218-b8a0-4043-b62c-27903d55a13f","year":2004},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:3e20b0798e5c8340d4c6ae0895d5594c1e6c99b52e8555c11517745d3248eac8","observation_id":"32f7872b-193f-4e3c-b8f5-2b2cb02ff5ce","resolution":{"observed_at":"2026-05-23T22:35:51.482168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T06:46:03.461304Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":"2c254ca1-839b-4f7e-856a-a5addd6d2b77","year":2020},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:618b3f1a053c01a28bc78e9f09af801d854b023e5a544efc6acb7ee2f0370d79","observation_id":"7a2547ee-ce4c-427e-bdf1-793bd3cf4150","resolution":{"observed_at":"2026-05-23T22:35:51.661237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:53:27.559536Z","title":null,"venue":null,"work_id":"752eeedd-799a-4452-bb5f-cb0a89cc04e4","year":2020},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:aa16329e1c59dfcae2e69302c978fd9b069d3627b10caba7766886e70cc99f86","observation_id":"83c152fe-d6fe-4aa6-8797-04e68279cce9","resolution":{"observed_at":"2026-05-23T22:35:51.429877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":"66c287a5-ac6b-4acf-b207-6703a9d3274d","year":2022},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:7ad8e3c0eb96d21ef7090a3f2dee1bcdc2bfd450ed97d3842ae1cd9a92b96b42","observation_id":"696cf556-b69d-47cd-905b-9a70a9bd247f","resolution":{"observed_at":"2026-05-23T22:35:51.442972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"3032372e-20c0-40fa-9f11-866e1a2d183e","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:330eefd34b54f8c1e533b176a1d784195d58bc6772775bdf4cfa0793f30c8dea","observation_id":"4d46e208-6801-4766-a3ec-de799503b78d","resolution":{"observed_at":"2026-05-23T22:35:51.446993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:03:45.764155Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":"08274941-8f3d-4c25-90be-9e794e0090f0","year":2022},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:eb8fe33ff23ebef860a54dd61739220047a4615fa1e4fc44de0144ad6f859c46","observation_id":"611436f5-ae08-47ce-84a4-aa10272c94d3","resolution":{"observed_at":"2026-05-23T22:35:51.665586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dai, Orhan Firat, Melvin Johnson, Dmitry Lepikhin, Alexandre Passos, Siamak Shakeri, Emanuel Taropa, Paige Bailey, Zhifeng Chen, Eric Chu, Jonathan H","venue":null,"work_id":"a5551721-ff5f-42ef-ba14-9a65afb23225","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:e41756e5216ab66a2c78bc16e30f7445f724a6e2348d8ad5121a0196fdd2e34e","observation_id":"b89e7f9e-2706-4d0b-b0f6-dac876fbcc1f","resolution":{"observed_at":"2026-05-23T22:35:51.576240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":"1506.02438","doi":"10.48550/arxiv.1506.02438","metadata_source":"pith","pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","venue":"cs.LG","work_id":"38e3ca94-96f0-4b19-a355-0754931af8be","year":2015},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:651b7977f33a1813d09014ce2676702055695829e64fb69a1bb826442f605808","observation_id":"48144c6b-97a2-42f1-a558-51791ce80eea","resolution":{"observed_at":"2026-05-23T22:35:50.309976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, and Peter J","venue":null,"work_id":"3e691271-d3ce-4bbb-b989-112a94cbab8a","year":2019},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:88a86f806d046c8b02c1de8b1492675f5cec79871ca257678c2554ca00f9d2a4","observation_id":"6e5b5ed8-83a9-4526-bca2-2fd5350c0a3b","resolution":{"observed_at":"2026-05-23T22:35:51.444955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liu, and Jialu Liu","venue":null,"work_id":"24b3ceee-f40b-46a5-ad91-473ae8d6559a","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:0b3fd819b27f504bc5a912cd990afd7cf02a54ea9a04973566861aa28d0be722","observation_id":"985f1914-c302-4e1d-b75d-366da530af38","resolution":{"observed_at":"2026-05-23T22:35:51.696964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-07-06T18:01:05.698046Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":"2404.10719","doi":"10.48550/arxiv.2404.10719","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study","venue":"arXiv (Cornell University)","work_id":"5ce8ff19-c68c-4255-bf4a-32ac6849467d","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:d61ce0e5a95e8c21a67138328c8cadb69ec339af9d0b526e2750bbed7398d53b","observation_id":"ebebe5be-521a-4bce-bf94-a49137173aa8","resolution":{"observed_at":"2026-05-23T22:35:50.282923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maas, Raymond E","venue":null,"work_id":"5354fb9f-9333-4e1f-bc9f-37a10e103c3d","year":2011},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:a914e8b2c87f79b8028e2fcbdf75ab67277fe0d16cc90f95531493a8ae176e0d","observation_id":"914132a8-46b6-498b-93ee-1e777a015ab2","resolution":{"observed_at":"2026-05-23T22:35:51.689798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:504122048da6331e63d4af3f5f372eb47792cb914bdb29c51835778a711fccc8","observation_id":"44b9fd79-d89e-4ca1-88e4-5c4a81c67f8f","resolution":{"observed_at":"2026-05-23T22:35:50.294514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hellaswag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics","venue":null,"work_id":"9e99d6d5-623e-44a0-a374-42fba8fce0a4","year":2019},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:b3fe56d2e55edf093b3f61253e228ef059f5d61ae3d0306d9924caf1d6b6fcf3","observation_id":"c127a630-88c7-4e30-9455-117dd01e7e21","resolution":{"observed_at":"2026-05-23T22:35:51.712970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kwok, Zhenguo Li, Adrian Weller, and Weiyang Liu","venue":null,"work_id":"20ed07e1-5ae4-4966-9b41-a7aa817ac25b","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:2d3dd6b1403b5a0a393b2d71e9f48584eac82eb5efc1af707f30e155edb1cb18","observation_id":"6220a988-6323-437a-a3a2-8994ac19879a","resolution":{"observed_at":"2026-05-23T22:35:51.652034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:55:54.580081Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"89f47745-d276-4d5d-a0da-97ceaabae3d1","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:e0b5f1b7365d8ab12a9aa1908b13714a70a2c16c6addb67573008c4dfec897e0","observation_id":"93e86d94-962d-42d4-91ad-ad6bb5319b60","resolution":{"observed_at":"2026-05-23T22:35:51.671441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:34:32.274562Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"c90318f2-cefc-4ac4-9046-a2b661db3695","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:8dee046999cafe14c5f3c5503b60309f6cd81688d4d2cacdbadc2fd33a9a9784","observation_id":"45c694d0-ef68-4c86-b975-89963006acf4","resolution":{"observed_at":"2026-05-23T22:35:51.679386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solar 10.7b: Scaling large language models with simple yet effective depth up-scaling","venue":null,"work_id":"5c38a79b-01ca-4b90-b574-2988e20f0b64","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:bb95941b0d187f3a013fc7b9dcaea2b8dd6d8e4150afb7d9e87c88538e0cbd05","observation_id":"af334596-b044-46de-a42a-9ed0357a83bd","resolution":{"observed_at":"2026-05-23T22:35:51.619674Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orca: Progressive learning from complex explanation traces of gpt-4","venue":null,"work_id":"d10452ab-ba80-4f09-8593-b7619e8954ba","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:a611e686e0280a6955227123d4768ec94c35a1ca7e39d9c67ac7497b39633fb3","observation_id":"7dffecc0-3606-4704-8e5d-56b776ea295d","resolution":{"observed_at":"2026-05-23T22:35:51.605131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ultrafeedback: Boosting language models with high-quality feedback","venue":null,"work_id":"2bcc9414-d433-4ac9-a0f5-e9d100f8da4d","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:5632da0ce5f6404a034077715d8121e46b662fb5bb06a3d62b0d3e3ba6d9a8f8","observation_id":"cbbc87f2-12e0-40f3-81a2-9b5a366cc81a","resolution":{"observed_at":"2026-05-23T22:35:51.590154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.047800Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"919cb2d6-3af1-449e-bdb7-3701fe2984a4","year":2021},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:d2d69661ab5e3fc3f9880570d6a2a551d86abc2c186cda5e77cbe49cc6fe658f","observation_id":"6cac6db5-fd88-47cc-8280-b276c08dc9aa","resolution":{"observed_at":"2026-05-23T22:35:51.593896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":"570ec341-04bc-4f28-9e5c-4aa791810623","year":2019},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:8c902dffe1ddf58d005760d9e784d069354312f555c23cf6d9844799119bbee9","observation_id":"e9d142e5-78ac-4ab3-845a-ec23f0747172","resolution":{"observed_at":"2026-05-23T22:35:51.609644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:a881da14d7bd002b6e93a453c1b49d387ead20372f6e29b945ec2e125889241e","observation_id":"bf26ad90-ca31-454c-9f01-ca8cd4f79f12","resolution":{"observed_at":"2026-05-23T22:35:50.288719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized preference optimization: A unified approach to offline alignment","venue":null,"work_id":"5eba149e-7e6e-4069-8458-5f5509c2a9ff","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:960a04ea50205fef1016f6b3a2fbe48d44f904286772df020da160a27f84baa5","observation_id":"737de695-d107-44c9-89d1-eac482791dbf","resolution":{"observed_at":"2026-05-23T22:35:51.570012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"d32fd3de-b200-47e1-823f-c47e9019f299","year":2019},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:fe586571e1662404aab6cf68fd9a0a2b31755c013a6fb26e56a6d438cfc4bc7d","observation_id":"b3ea4c40-b1e4-47f9-9a82-ea6c2e86583e","resolution":{"observed_at":"2026-05-23T22:35:51.580449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":"3b02a65e-5963-491c-9011-6c7ddbf15e54","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:d59706237cf90ff780cabd0bb98e13f636a30357f8f09d72ba7d2d2562cb1e82","observation_id":"7bb92faf-99cb-49ac-a7d1-4fb093f39379","resolution":{"observed_at":"2026-05-23T22:35:51.587175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The cringe loss: Learning what language not to model","venue":null,"work_id":"e74868d1-3ea7-4464-900a-24973401ce15","year":2022},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:27ad0bc6d1538f110997ce5ae5dab6ecc93b677bd6b7828a7ef1f49dc22c9529","observation_id":"829acdd5-5433-4a4f-bc7c-8e798de4b516","resolution":{"observed_at":"2026-05-23T22:35:51.630359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashimoto","venue":null,"work_id":"38e635dd-027f-484e-ae4b-96dbbcd1df2c","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:bb15f17bb3e7fd13ce9acf09a5919a56349c4457a5a4cc04c7e7da2f43b78caa","observation_id":"d2973944-a7d3-47e5-adff-5e0316f35255","resolution":{"observed_at":"2026-05-23T22:35:51.529270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in prospect theory: Cumulative representation of uncertainty","venue":null,"work_id":"50c530d2-baa9-4459-8d9b-a6027726dce0","year":1992},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:3ccb8915826626f7a75f7fdbd4e301e7258386177bf92d18a8ef6e3b338a9079","observation_id":"07ea3b54-dd38-4bb9-ab20-65e19538d55a","resolution":{"observed_at":"2026-05-23T22:35:51.526071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:06:10.239871Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":"3fd006b3-ce9f-4777-887c-2e1b5edfdf04","year":2017},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:b6489fd28043026aedd0d412b40c7a1c31e3ac74e1fc2c7ea7e09525112f7c5b","observation_id":"66fabb02-424f-437d-9bf7-87525f861d18","resolution":{"observed_at":"2026-05-23T22:35:51.532606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:08.153518Z","title":null,"venue":null,"work_id":"fbf5883a-dc87-439f-a0ae-fcc99bbb1643","year":2021},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:d7ad552f1f12c7fd7f68d3735452afc360219679e3a4b0115f626bc2a388993a","observation_id":"577b2d2d-1ae5-46ed-8d3f-1497d9cb6209","resolution":{"observed_at":"2026-05-23T22:35:51.633995Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":"2210.09261","doi":"10.48550/arxiv.2210.09261","metadata_source":"pith","pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","venue":"cs.CL","work_id":"513eb205-04ca-4722-9a43-a74e8cbe7e85","year":2022},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:4d7c12ad356fbd75a3b58bb16a5fd18ee9057134faec795958a1a28fd9818fa6","observation_id":"07bff1ea-da89-472d-ad0b-613b07be387b","resolution":{"observed_at":"2026-05-23T22:35:50.299816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"87d8af73-cdd9-4d6a-8d96-bc3aa5c38191","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:f37144d3f9676ea3f17bb1dddd23eab3bb48a6053f3b310a3c93e66c4a426e04","observation_id":"1c6b788f-266b-496c-97aa-6397074e733c","resolution":{"observed_at":"2026-05-23T22:35:51.563796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b97339ca-d73b-4a1d-8583-e1d3268a7895","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:7c5ac8e7a92a960501912af0574218bfbdb1e17068ac10632eff4c08cc2728a4","observation_id":"f7ef9e94-119e-42f1-a00e-468bdeafab0f","resolution":{"observed_at":"2026-05-23T22:35:51.514946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":"a9d6be15-5658-4f9f-8733-d5990fb08d58","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:be740918740490f535d2e09d4bd710dbd1b42ff9e89bcbdb4b2aa91c63fdcbfb","observation_id":"daeb35c3-6af9-41c4-9bfc-1681de57d7b2","resolution":{"observed_at":"2026-05-23T22:35:51.518764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:03:45.683486Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"213db0b4-bdde-4aaa-a387-c3dbb1dfc07b","year":2021},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:48495eaa56bbcf8b02bcbd99e689ac7e6d88f2e40cee34b275e89922aad6d586","observation_id":"a63075f8-1aa7-4c43-a0a0-a6a0848b2539","resolution":{"observed_at":"2026-05-23T22:35:51.545512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":"cf15436c-1984-4277-ae18-31a2612d0c20","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:60f3943d9e58a72eb4ca57bc65627971da60fd500916ae4b676dee6b8e86da60","observation_id":"17579027-2b4a-43c1-bcc2-7dcb0935f694","resolution":{"observed_at":"2026-05-23T22:35:51.518033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":"ee8983d2-24a0-4fd8-81f4-335b9590b8ca","year":1992},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:0b3d29cf6da264dc37f3e097272bb44758adf7cf2763d6e54f335bbb12d601f0","observation_id":"3df9b7fd-5e9e-4321-a88c-f726d6c706ac","resolution":{"observed_at":"2026-05-23T22:35:51.683292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Buy 4 REINFORCE samples, get a baseline for free!","venue":null,"work_id":"7b934b69-533a-49de-b63a-fe0942f2e260","year":2019},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:5763f41e6e4817c02c54715187ca78ab74aa0be323129400cece6a581b14a6a3","observation_id":"0d944cac-3c8d-46d5-a075-87e31d2ec18c","resolution":{"observed_at":"2026-05-23T22:35:51.552696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to rank for information retrieval","venue":null,"work_id":"4499e05f-486b-4af4-a262-d2833360132b","year":2009},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:df72e0c16abb858a66c5848268589f77f4f3373a9a646f4a2df3d6b6612e1d11","observation_id":"2db9056c-7483-4753-8b60-19302329c864","resolution":{"observed_at":"2026-05-23T22:35:51.553126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:45:59.161503Z","title":null,"venue":null,"work_id":"bc3e020b-3f4c-4945-9cb5-b17e54dfa7d7","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:3dab42d96f3785eeacf532c5e84e58596d1cbbcceaa51cff626772d4287f0b7e","observation_id":"5d0e78e9-0a98-4bc1-8f8f-ccdf8b8776a1","resolution":{"observed_at":"2026-05-23T22:35:51.642809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:02:41.700035Z","title":"Openassistant conversations – democratizing large language model alignment","venue":null,"work_id":"2cd7bd55-5a97-4884-96a6-0ab03ebd161e","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:042bd17817235935e68df093c092390439c09dd34abe5cabd85f5eb26b059cbd","observation_id":"b00bca99-5099-4c51-b2f5-c087e9a0f940","resolution":{"observed_at":"2026-05-23T22:35:51.528599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashimoto","venue":null,"work_id":"bf3517b5-0f2c-4f46-bff1-8d74220ebc3f","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:7f759b77157bef9e09c7f931d30f2c863bda5378e5b9a4a93970d6313011a0e2","observation_id":"caa32368-772c-4fac-aa0e-8d37c2064eb6","resolution":{"observed_at":"2026-05-23T22:35:51.559788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Secrets of rlhf in large language models part ii: Reward modeling","venue":null,"work_id":"dd5f5c68-8ec8-4ce8-9d25-36641577397b","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:3e9ef42258006ebd8de02863d6cca1e5acb1f42f935ce780fa071f3cf1f1daca","observation_id":"f41a71fb-eece-4c83-bb8b-db9a8deef6e5","resolution":{"observed_at":"2026-05-23T22:35:51.571733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":"88815d55-44b3-4a5d-a566-ffcc29c40a8b","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:3fec352fbbd6bad1d7046738cc7bf56c48c181c8df19eb8ad8d83c383b107d0f","observation_id":"732b60fd-bad0-4dd5-b241-e2d2243d738d","resolution":{"observed_at":"2026-05-23T22:35:51.657844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lipton, and J","venue":null,"work_id":"0568a842-4475-4de6-bba1-5b0c65d9f6e4","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:d1b73f4377134115a2730fb178ced0c23865bcfd547619b7522607b076e07e39","observation_id":"a3466e86-ac7c-4a7d-a803-3cfa805308bf","resolution":{"observed_at":"2026-05-23T22:35:51.648279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A paradigm shift in machine translation: Boosting translation performance of large language models","venue":null,"work_id":"02bf78f4-4ba6-4156-a39f-72d5d4442267","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:54752e7bdebf3d9450d795e0ca03398824ee8d9335f487722cb26e88be20bf1a","observation_id":"9ead4ea7-08ef-4c83-b1c6-b5622e5e4d4a","resolution":{"observed_at":"2026-05-23T22:35:51.701061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the limitations of the elo, real-world games are transitive, not additive","venue":null,"work_id":"5cbddb7a-9733-4603-b605-ad578423f832","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:ae4a2d084b9a616ae700f1e63c24e9ff275e9c1a4b316b41dd5e16f2b313e08a","observation_id":"29ad9da9-968d-42cf-934d-f2077af82f7a","resolution":{"observed_at":"2026-05-23T22:35:51.705266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-play preference optimization for language model alignment","venue":null,"work_id":"ae11c2b1-ca4a-4ccd-8874-dfcefebe9ded","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:a93aab949fbcb3323def3e490df91f7294774fe0e0e53ddea26e7183581a339a","observation_id":"35116a69-8d42-4971-b104-f0274d074a9c","resolution":{"observed_at":"2026-05-23T22:35:51.577157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schapire","venue":null,"work_id":"b828260d-eadf-4dd7-87d4-423fddca0bcf","year":1999},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:c6a3aeb4a6947742501742512255bde9b603ba379fa2e4e13e0f6e182c35f73e","observation_id":"e6375735-596d-49b2-b62b-63f99fa40c54","resolution":{"observed_at":"2026-05-23T22:35:51.622936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm-blender: Ensembling large language models with pairwise ranking and generative fusion","venue":null,"work_id":"af918f04-ed0f-49f3-96e4-7b1528b93aa3","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:e00072d0cd3a004458a2b1acc85b691140d892f3f8d9db7110e1965d053bba0a","observation_id":"e2eb508d-fac0-49e5-9c80-046ac23e41ea","resolution":{"observed_at":"2026-05-23T22:35:51.716609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orca 2: Teaching small language models how to reason","venue":null,"work_id":"2cc0da2a-7235-47e7-8b6f-7559bd263283","year":2023},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:f1615b6c664dc7658f5aec8cc64dd7bc3d9dd7736fadab08a1b4d871e5cff8aa","observation_id":"a58d8c4c-8b7f-4c89-8fbe-e47710ed9aa2","resolution":{"observed_at":"2026-05-23T22:35:51.521463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On decoding strategies for neural text generators","venue":null,"work_id":"bbb32e4e-90b3-4aee-8ece-ff87382a0158","year":2022},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:2815f1f4d0076f585dcd5f6a35487cb41663957b1623b64e5d353b5ea51d6c12","observation_id":"10e9967c-47a8-4a89-a04e-dd069ca98ca6","resolution":{"observed_at":"2026-05-23T22:35:51.501985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Insights into alignment: Evaluating dpo and its variants across multiple tasks","venue":null,"work_id":"7a9fac30-144b-4429-bc06-ef3d7362d8cc","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:b9a8bc69ef4ab024ac5632e946c88af85e30783724c8df09dc88f60d99ce2f09","observation_id":"6892be44-c36d-4e92-b3c9-77c487ee1612","resolution":{"observed_at":"2026-05-23T22:35:51.522881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study","venue":null,"work_id":"c37b4d9a-6f57-4bf0-987a-182e453a2660","year":2024},"citing_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-23T22:35:35.287039Z"},"links":{"citing_paper":"/paper/2407.16216"},"observation_digest":"sha256:e71cd05a9b2f3563ce16a92b234474d91e970eea38c285e2e441c690519e7b30","observation_id":"422cf210-88ee-448d-9e2c-acbc1f761e69","resolution":{"observed_at":"2026-05-23T22:35:51.563056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":6,"verified_fuzzy":81},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 35 inbound Pith citation observations for arXiv:2407.16216."}