{"as_of":"2026-08-07T23:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7fceb8ffce0c9f26ef88a0e9d85b21ef2c6d65133fd4c50d79597afa8a64d46","coverage":[{"denominator":117,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:34:25.301260Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:17:36.742733Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:40.152268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13158","snapshot_observed_at":"2026-08-04T11:17:36.742733Z","title":"Inverse reinforcement learning meets large language model post-training: Basics, advances, and opportunities.arXiv preprint arXiv:2507.13158,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06096","last_updated":"2026-06-26T18:48:41Z","snapshot_observed_at":"2026-08-07T07:17:08.647250Z","submitted_at":"2025-10-07T16:25:14Z","title":"The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T11:17:36.742733Z"},"links":{"cited_paper":"/paper/2507.13158","citing_paper":"/paper/2510.06096"},"observation_digest":"sha256:7a83625011656cb86f8b80db0136aedf297f0e18fa4780b36bbf536b5c3b5932","observation_id":"58ce233a-7689-4a88-977a-8ab27b2358d0","resolution":{"observed_at":"2026-08-04T11:17:36.742733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"cited_work":{"arxiv_id":"2507.13158","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13158","snapshot_observed_at":"2026-07-04T07:59:40.152268Z","title":"arXiv preprint arXiv:2507.13158 (2025) 50 Elias Malomgré and Pieter Simoens","venue":null,"work_id":"b2807788-5ebb-4c12-b5fe-972f005f57e0","year":2025},"citing_paper":{"arxiv_id":"2603.02259","last_updated":"2026-04-29T14:17:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-28T00:48:06Z","title":"The Alignment Flywheel: A Governance-Centric Hybrid MAS for Architecture-Agnostic Safety","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T19:05:15.708770Z"},"links":{"cited_paper":"/paper/2507.13158","citing_paper":"/paper/2603.02259"},"observation_digest":"sha256:742926cee5a586e6666c214cd0763b7947c1882005a31e6f13ca264996b4fcfa","observation_id":"2654dec6-ac02-4a04-9249-fd87fe4db4ce","resolution":{"observed_at":"2026-05-15T19:06:30.621395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"cited_work":{"arxiv_id":"2507.13158","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13158","snapshot_observed_at":"2026-07-04T07:59:40.152268Z","title":"arXiv preprint arXiv:2507.13158 (2025) 50 Elias Malomgré and Pieter Simoens","venue":null,"work_id":"b2807788-5ebb-4c12-b5fe-972f005f57e0","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":188,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2507.13158","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:c88a035a61210b060ebb65ba15121745a950e560ec0283545637a8e54e074fb7","observation_id":"72c87fdd-80a0-4329-9873-91904335d9f2","resolution":{"observed_at":"2026-07-04T07:59:40.153902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13158/citation-record","integrity":"/paper/2507.13158/integrity","json":"/paper/2507.13158/citation-record.json","paper":"/paper/2507.13158"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T16:34:24.929368Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.929368Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:a1678ae94a13c392d60a1d661265d313517b4412d616b9d5ff017885f624f350","observation_id":"77084717-f2be-497f-8d93-392cf620e010","resolution":{"observed_at":"2026-08-06T16:34:24.929368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:24.949183Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.949183Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:b79b2f63da3dfd9abfb5f50c7ad72a691c7f5c3cc586b3f6c6043561e32aba51","observation_id":"a422fa13-9e47-499a-a907-8db37dd31b07","resolution":{"observed_at":"2026-08-06T16:34:24.949183Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:24.952418Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.952418Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ceb4910d8886d1ca74a0640c61d04949cade5fd8b2fa5c3a9af0c54d2ebc67d6","observation_id":"e1257466-8376-4141-82e0-9e481af8b394","resolution":{"observed_at":"2026-08-06T16:34:24.952418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04070","last_updated":"2025-03-13T13:37:57Z","snapshot_observed_at":"2026-07-06T19:28:18.775189Z","submitted_at":"2024-10-05T08:00:55Z","title":"PAD: Personalized Alignment of LLMs at Decoding-Time","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04070","snapshot_observed_at":"2026-08-06T16:34:24.962376Z","title":"Pad: Personalized alignment of llms at decoding-time.arXiv preprint arXiv:2410.04070, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.962376Z"},"links":{"cited_paper":"/paper/2410.04070","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:bb035b22c76fe3c9322fac34d6179aafbb5a52f77459caeb89e45b40dc2764d7","observation_id":"77be57c1-9825-4171-a4c3-dca895a4b655","resolution":{"observed_at":"2026-08-06T16:34:24.962376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-07T07:16:18.050175Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-06T16:34:24.968234Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.968234Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ec55d1064a1b2459ed2dfabded7c681293a920ba2e78b2dc7681dd2d96a20f77","observation_id":"12d4acc6-c2fe-47e3-8ed9-3c0a9e4d5f3e","resolution":{"observed_at":"2026-08-06T16:34:24.968234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11347","last_updated":"2025-07-12T20:31:55Z","snapshot_observed_at":"2026-08-05T00:49:37.799646Z","submitted_at":"2024-02-17T17:47:10Z","title":"SEE: Strategic Exploration and Exploitation for Cohesive In-Context Prompt Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11347","snapshot_observed_at":"2026-08-06T16:34:24.971232Z","title":"Phaseevo: Towards unified in-context prompt optimization for large language models.arXiv preprint arXiv:2402.11347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.971232Z"},"links":{"cited_paper":"/paper/2402.11347","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:47458d9cecaf3b4b995baba701ffadca8873fa020ace3f4f1f97c5370c36ca62","observation_id":"91495224-4271-46dd-b6f0-d9345a56b743","resolution":{"observed_at":"2026-08-06T16:34:24.971232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18746","last_updated":"2025-07-12T20:39:40Z","snapshot_observed_at":"2026-08-07T17:48:29.484541Z","submitted_at":"2025-02-26T01:42:08Z","title":"A Survey of Automatic Prompt Optimization with Instruction-focused Heuristic-based Search Algorithm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18746","snapshot_observed_at":"2026-08-06T16:34:24.975337Z","title":"Automatic prompt optimization via heuristic search: A survey.arXiv preprint arXiv:2502.18746,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.975337Z"},"links":{"cited_paper":"/paper/2502.18746","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:9480c4c07b72e692a35a0e7e793a65d6ab81a9909ea3b830613c95c1815c653b","observation_id":"6761f935-4f6b-4abd-97c8-6a9572c0cc0d","resolution":{"observed_at":"2026-08-06T16:34:24.975337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:24.981480Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.981480Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:9a2d3e180eb6783149d34ef302d2f680c4ee8365e022b5a23a0a5bcabbad8494","observation_id":"02831b20-4cac-4fee-97a0-fbe7e43d64c8","resolution":{"observed_at":"2026-08-06T16:34:24.981480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-06T16:34:24.985050Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.985050Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:5857b49a432b3de82fdbb33223ca13ad8844caf99c2c1181a46d6009394c4d68","observation_id":"1e79d17c-964f-441e-b61a-0d03c59a8ba3","resolution":{"observed_at":"2026-08-06T16:34:24.985050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:24.988098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.988098Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:b785873d3c25f4227bf0aa9b8fad1f6a2e6bb1f43cf7c1f6639a508717b49117","observation_id":"234ef8e0-e046-41dc-8a62-bd88d24ab84a","resolution":{"observed_at":"2026-08-06T16:34:24.988098Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T16:34:24.991170Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.991170Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ea0965c4d7f4366d67777fcdc2515fb24de81fbc59c0a152c7aa59cc01047911","observation_id":"c99d0c59-2b0a-4352-94b3-00b75f366909","resolution":{"observed_at":"2026-08-06T16:34:24.991170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-06T16:34:24.994147Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators.arXiv preprint arXiv:2404.04475,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.994147Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:6d11c9598f291c695c4bebd32cb61c9100b246a475c9cea402d110eac74c7543","observation_id":"3c01026a-8ea6-45ac-b721-2b1569ef96ae","resolution":{"observed_at":"2026-08-06T16:34:24.994147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-06T16:34:24.997269Z","title":"Kto: Model alignment as prospect theoretic optimization.arXiv preprint arXiv:2402.01306,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.997269Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:2dea87a82ec6c68945f60e833c9d0cfdf1c96d601c847de58c2ddd946c69b4a1","observation_id":"3fa477cb-68ae-4a5e-a4f9-a9649ee2ea25","resolution":{"observed_at":"2026-08-06T16:34:24.997269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.08027","last_updated":"2019-11-22T14:22:44Z","snapshot_observed_at":"2026-08-03T12:51:18.277147Z","submitted_at":"2019-07-18T13:02:16Z","title":"Self-Attentional Credit Assignment for Transfer in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.08027","snapshot_observed_at":"2026-08-06T16:34:25.003524Z","title":"Self-attentional credit assignment for transfer in reinforcement learning.arXiv preprint arXiv:1907.08027,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.003524Z"},"links":{"cited_paper":"/paper/1907.08027","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:e1999f66e5e054910853da9346be32160bad03c881a1912d6cd699362e33c0a6","observation_id":"e90adc2d-d0b0-4c82-816c-7f3fad3051e9","resolution":{"observed_at":"2026-08-06T16:34:25.003524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.11248","last_updated":"2018-08-13T18:33:24Z","snapshot_observed_at":"2026-07-06T06:06:54.331476Z","submitted_at":"2017-10-30T21:22:28Z","title":"Learning Robust Rewards with Adversarial Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.11248","snapshot_observed_at":"2026-08-06T16:34:25.007040Z","title":"Learning robust rewards with adversarial inverse reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.007040Z"},"links":{"cited_paper":"/paper/1710.11248","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:1e334e704d679a5efc4c0cfcbb11c0a2e6cd729287b000b67c7fb8eb87bdcdf0","observation_id":"6f8a58f3-a49d-42a4-b821-d9b72e930c01","resolution":{"observed_at":"2026-08-06T16:34:25.007040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00832","last_updated":"2024-11-01T20:02:32Z","snapshot_observed_at":"2026-08-04T16:20:42.997639Z","submitted_at":"2024-06-02T18:42:57Z","title":"BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00832","snapshot_observed_at":"2026-08-06T16:34:25.013301Z","title":"Bonbon alignment for large language models and the sweetness of best-of-n sampling.arXiv preprint arXiv:2406.00832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.013301Z"},"links":{"cited_paper":"/paper/2406.00832","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8622270f451fdda343bd395e3aae8c8f35b947fe73e7ce9a6c52663c396fb71b","observation_id":"93ddae34-6421-4d2e-a4a4-6e5dfa256901","resolution":{"observed_at":"2026-08-06T16:34:25.013301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T16:34:25.016230Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.016230Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:c064380788597bf55451099a6936880f6d82a90ff92a73df1a7e457647a05ce4","observation_id":"4cd38935-20b2-47eb-a5ba-8fa46c2c118a","resolution":{"observed_at":"2026-08-06T16:34:25.016230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08532","last_updated":"2025-05-01T11:56:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-15T16:50:09Z","title":"EvoPrompt: Connecting LLMs with Evolutionary Algorithms Yields Powerful Prompt Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08532","snapshot_observed_at":"2026-08-06T16:34:25.018916Z","title":"Connecting large language models with evolutionary algorithms yields powerful prompt optimizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.018916Z"},"links":{"cited_paper":"/paper/2309.08532","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:837ae926dfcbd751e27604be16977173a7fea1fee042e95f5e25fca8af373d43","observation_id":"5b868f90-ea30-4833-9110-e319d1f4a64d","resolution":{"observed_at":"2026-08-06T16:34:25.018916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-07T05:40:44.041304Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-06T16:34:25.021993Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.021993Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:132e7387f7b420c8620f055b09df2c0f0a55b852a6a3bf01adf9dcabab4fc70c","observation_id":"2e45fe2a-0649-4a2e-88a4-cf1875fbf5d2","resolution":{"observed_at":"2026-08-06T16:34:25.021993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.025118Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.025118Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8d2bce22ac939c0aee6d951838da34c710ba25c02fcec8732b55977dbd3989a1","observation_id":"ad89a21f-894c-43aa-beaa-cc1ad8ea8a61","resolution":{"observed_at":"2026-08-06T16:34:25.025118Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-06T16:34:25.028758Z","title":"Soft actor-critic algorithms and applications.arXiv preprint arXiv:1812.05905,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.028758Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:7104881232801141f93852ea4c61bf6ca2cea15a4569acb89bd60a8483c93591","observation_id":"f633d741-1147-4b73-8843-2e5ae5178b08","resolution":{"observed_at":"2026-08-06T16:34:25.028758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T16:34:25.034750Z","title":"Prompt-to- prompt image editing with cross attention control.arXiv preprint arXiv:2208.01626,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.034750Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:088703eaf7188c32903915bea08e68c9d4b6a8dd2a373141eaa1d6db4d674794","observation_id":"db3d3eb6-22a5-47aa-a7d5-f9f1b50f5ccd","resolution":{"observed_at":"2026-08-06T16:34:25.034750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01085","last_updated":"2025-09-04T02:14:46Z","snapshot_observed_at":"2026-07-06T18:39:24.513351Z","submitted_at":"2024-07-01T08:37:41Z","title":"Explaining Length Bias in LLM-Based Preference Evaluations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01085","snapshot_observed_at":"2026-08-06T16:34:25.041656Z","title":"Explaining length bias in llm-based preference evaluations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.041656Z"},"links":{"cited_paper":"/paper/2407.01085","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:e12b4b0830880f3c86ac75aa193c8895e289849b50fac75f16dae2b800f21474","observation_id":"9ab5c693-073c-41f4-b2ef-6d36a1654708","resolution":{"observed_at":"2026-08-06T16:34:25.041656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-06T16:34:25.044668Z","title":"Large language models cannot self-correct reasoning yet.arXiv preprint arXiv:2310.01798,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.044668Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:cb36deda93b4857c7906aab97c5106c66507d9e1a880acdc357abfdf40cf6b7b","observation_id":"da8b9743-caaa-4d03-9a5d-143f401474c0","resolution":{"observed_at":"2026-08-06T16:34:25.044668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09279","last_updated":"2024-10-07T21:24:59Z","snapshot_observed_at":"2026-07-06T18:30:28.421247Z","submitted_at":"2024-06-13T16:17:21Z","title":"Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09279","snapshot_observed_at":"2026-08-06T16:34:25.048128Z","title":"Unpacking dpo and ppo: Disentangling best practices for learning from preference feedback.arXiv preprint arXiv:2406.09279,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.048128Z"},"links":{"cited_paper":"/paper/2406.09279","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:1a2c53215f5eb54664c96b190871867b1b699e4181781b07b294951bb0621b30","observation_id":"028f2908-3e8d-4bfa-a97f-5e506b9f1667","resolution":{"observed_at":"2026-08-06T16:34:25.048128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T16:34:25.051356Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.051356Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:818a8f7a4eb81a4d8f199c86f026f057a15ed661d3b58b81a9eb39343c5d677e","observation_id":"f457f343-d5d0-4591-86e8-36c7a6fa49e7","resolution":{"observed_at":"2026-08-06T16:34:25.051356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00856","last_updated":"2024-06-05T08:15:12Z","snapshot_observed_at":"2026-07-06T17:23:55.166594Z","submitted_at":"2024-02-01T18:51:54Z","title":"Towards Efficient Exact Optimization of Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00856","snapshot_observed_at":"2026-08-06T16:34:25.054186Z","title":"Towards efficient exact optimization of language model alignment.arXiv preprint arXiv:2402.00856,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.054186Z"},"links":{"cited_paper":"/paper/2402.00856","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:2a01cb864b20a4f5979dbabefa3fab5916b58d4f3f321fb24e9f38c73c527729","observation_id":"93a3a016-32f8-40a2-a29d-41d011bc36ec","resolution":{"observed_at":"2026-08-06T16:34:25.054186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T16:34:25.057213Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.057213Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:6eee07d76afcb9adf2574439ee529149845d3df01a3d637320f735e42b9d2a11","observation_id":"7045ef3e-baf2-4297-88d2-97e11e689a8d","resolution":{"observed_at":"2026-08-06T16:34:25.057213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-07-06T17:24:29.001170Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-06T16:34:25.063586Z","title":"Args: Alignment as reward-guided search.arXiv preprint arXiv:2402.01694,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.063586Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:384391c748cef6d86bb7ccaf401b5ec2ca5f001fb795621d74c35e385f917592","observation_id":"50e73708-3b7d-4fc0-90bc-a99fa3c9ceb4","resolution":{"observed_at":"2026-08-06T16:34:25.063586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02406","last_updated":"2023-04-11T19:39:17Z","snapshot_observed_at":"2026-07-06T14:00:01.450718Z","submitted_at":"2022-10-05T17:28:20Z","title":"Decomposed Prompting: A Modular Approach for Solving Complex Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02406","snapshot_observed_at":"2026-08-06T16:34:25.066495Z","title":"Decomposed prompting: A modular approach for solving complex tasks.arXiv preprint arXiv:2210.02406,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.066495Z"},"links":{"cited_paper":"/paper/2210.02406","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:343ea5c1b702a9991e83046fecda78f3f2b1d7a48b997799c909cf43fca33439","observation_id":"3d1a173a-0a9d-4c7c-90be-1b997d674bd9","resolution":{"observed_at":"2026-08-06T16:34:25.066495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13998","last_updated":"2024-12-18T16:14:59Z","snapshot_observed_at":"2026-07-06T20:09:24.415233Z","submitted_at":"2024-12-18T16:14:59Z","title":"Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes","version":1},"cited_work":{"arxiv_id":"2412.13998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13998","snapshot_observed_at":"2026-08-06T16:34:26.163405Z","title":"Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes","venue":"cs.LG","work_id":"9727aa20-a241-4c29-a2cb-38c286108ac6","year":2024},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.069706Z"},"links":{"cited_paper":"/paper/2412.13998","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8dbfeaf906536642a30f6f9e96800fe19f4fef6a53bb84a2d32bf76c465c5a17","observation_id":"4e12ffca-9b85-4c25-ba3e-61cd0bbcb210","resolution":{"observed_at":"2026-08-06T16:34:26.167583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-06T16:34:25.073347Z","title":"Diffwave: A versatile diffusion model for audio synthesis.arXiv preprint arXiv:2009.09761,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.073347Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:3ca521c2cc43139cd7fde86b60b50e431fe74ffbb9db2fee43959ac162a09250","observation_id":"0251ed79-ed5f-4d75-a2e3-93e6133dc99c","resolution":{"observed_at":"2026-08-06T16:34:25.073347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10383","last_updated":"2024-09-30T11:58:27Z","snapshot_observed_at":"2026-08-03T23:12:05.533433Z","submitted_at":"2023-10-16T13:23:54Z","title":"Privacy in Large Language Models: Attacks, Defenses and Future Directions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10383","snapshot_observed_at":"2026-08-06T16:34:25.076609Z","title":"Privacy in large language models: Attacks, defenses and future directions.arXiv preprint arXiv:2310.10383, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.076609Z"},"links":{"cited_paper":"/paper/2310.10383","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:3fa61d404d9409e9e4a9bc25aea614873e31e09f72b39b3fbc401b41563556b9","observation_id":"87e7605d-5449-4237-87ed-abfbf8fe873e","resolution":{"observed_at":"2026-08-06T16:34:25.076609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05133","last_updated":"2024-12-09T04:21:08Z","snapshot_observed_at":"2026-08-06T13:42:00.057517Z","submitted_at":"2024-02-06T04:18:58Z","title":"Personalized Language Modeling from Personalized Human Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05133","snapshot_observed_at":"2026-08-06T16:34:25.079612Z","title":"Personalized language modeling from personalized human feedback.arXiv preprint arXiv:2402.05133, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.079612Z"},"links":{"cited_paper":"/paper/2402.05133","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:09c32ae730d63d9a1617bce24f5b162aececba06284fe4092687c46b4fd6f591","observation_id":"5cd7afb4-fe5b-495e-9338-84609153062c","resolution":{"observed_at":"2026-08-06T16:34:25.079612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19324","last_updated":"2025-06-26T03:14:46Z","snapshot_observed_at":"2026-07-06T20:29:07.258163Z","submitted_at":"2025-01-31T17:19:57Z","title":"Reward-Guided Speculative Decoding for Efficient LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19324","snapshot_observed_at":"2026-08-06T16:34:25.083207Z","title":"Reward-guided speculative decoding for efficient llm reasoning.arXiv preprint arXiv:2501.19324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.083207Z"},"links":{"cited_paper":"/paper/2501.19324","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ff3c96ec5234a285930222fca1b9a6db59a6e3ec5d6a6a0db1b24e6eff5e21b6","observation_id":"bbf519a6-9680-4607-8070-a3251649d9d9","resolution":{"observed_at":"2026-08-06T16:34:25.083207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01941","last_updated":"2023-08-08T01:41:22Z","snapshot_observed_at":"2026-08-04T23:34:00.991258Z","submitted_at":"2023-06-02T22:51:26Z","title":"AI Transparency in the Age of LLMs: A Human-Centered Research Roadmap","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01941","snapshot_observed_at":"2026-08-06T16:34:25.086302Z","title":"Ai transparency in the age of llms: A human-centered research roadmap","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.086302Z"},"links":{"cited_paper":"/paper/2306.01941","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8bf0a5deda3b8f0261b2c2e8cccae369eeffe31d26d0912bc71c472565ffb94a","observation_id":"4a006a67-de87-4587-9da6-2604c988b059","resolution":{"observed_at":"2026-08-06T16:34:25.086302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.089378Z","title":"24 (AAAI 2025 and ACL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.089378Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8592e87fac8f13c29632129af7cd3f7636eb771d61a702e7bdbead94ed0d1704","observation_id":"ddd944c0-7925-4e6a-9efe-88cafb060228","resolution":{"observed_at":"2026-08-06T16:34:25.089378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-07-31T03:53:01.450978Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-06T16:34:25.092262Z","title":"Statistical rejection sampling improves preference optimization.arXiv preprint arXiv:2309.06657,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.092262Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:43692a0b1f85fd0fbcfcabcaaa5be896a5cb6237dadb31e133d81ea86a5c38e6","observation_id":"8345db02-524c-42cc-9e93-99dfba1bf963","resolution":{"observed_at":"2026-08-06T16:34:25.092262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13156","last_updated":"2025-02-27T16:30:42Z","snapshot_observed_at":"2026-07-06T19:18:27.644746Z","submitted_at":"2024-09-20T01:46:07Z","title":"RRM: Robust Reward Model Training Mitigates Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13156","snapshot_observed_at":"2026-08-06T16:34:25.095336Z","title":"Rrm: Robust reward model training mitigates reward hacking.arXiv preprint arXiv:2409.13156,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.095336Z"},"links":{"cited_paper":"/paper/2409.13156","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:1b0da3e965dceaa13279b9600aa57ca9cce0bbb784f6ecd1da150c110ceb78a2","observation_id":"9236ba57-eb05-42d2-a5e3-a1d44d921573","resolution":{"observed_at":"2026-08-06T16:34:25.095336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T16:34:25.098649Z","title":"Roberta: A robustly optimized bert pretraining approach.arXiv preprint arXiv:1907.11692,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.098649Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:fd7334c6fa32d37398b9fb0d5c4cc6e4119065b2d682bdd59784003795bc6a35","observation_id":"e7399c96-4795-48db-842d-c9751bf8efca","resolution":{"observed_at":"2026-08-06T16:34:25.098649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.101848Z","title":"Inference-time scaling for generalist reward modeling.arXiv preprint arXiv:2504.02495,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.101848Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:87a11d1a8bee2689b831934c2e6eae8c4ea6df60159391070c86835f29ed0c2f","observation_id":"7b49c1be-5347-4cca-825b-e4b3fba7e550","resolution":{"observed_at":"2026-08-06T16:34:25.101848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13131","last_updated":"2025-06-11T05:43:13Z","snapshot_observed_at":"2026-08-07T18:07:30.283883Z","submitted_at":"2025-02-18T18:55:26Z","title":"Rethinking Diverse Human Preference Learning through Principal Component Analysis","version":2},"cited_work":{"arxiv_id":"2502.13131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.13131","snapshot_observed_at":"2026-08-06T16:34:26.014981Z","title":"Rethinking Diverse Human Preference Learning through Principal Component Analysis","venue":"cs.AI","work_id":"175e89d2-e0a7-4323-9212-040ec0bce92d","year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.104669Z"},"links":{"cited_paper":"/paper/2502.13131","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ac26a7bf6c66e46b871cacffbcd957de206c5f0c96480ef2aa24d3c372330713","observation_id":"28372cfb-437c-4cf6-9e3c-4a6219d7a720","resolution":{"observed_at":"2026-08-06T16:34:26.018857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-06T16:34:25.107700Z","title":"Generative reward models.arXiv preprint arXiv:2410.12832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.107700Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:4a3f580a0da62e1a5c3bda6cbeffe44aa14d3bd419aae4c93d2bb921862818bd","observation_id":"f60977e9-086c-499f-b5b7-6954f51060d3","resolution":{"observed_at":"2026-08-06T16:34:25.107700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08434","last_updated":"2022-02-17T03:45:09Z","snapshot_observed_at":"2026-07-06T12:38:40.991910Z","submitted_at":"2022-02-17T03:45:09Z","title":"A Survey of Explainable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08434","snapshot_observed_at":"2026-08-06T16:34:25.111313Z","title":"A survey of explainable reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.111313Z"},"links":{"cited_paper":"/paper/2202.08434","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:babdca929f3d88b149435b8b44c160ca2941214e171f2fa6a34713d064e746bc","observation_id":"4186af3e-c5b1-429b-aa9a-2686c2ec0536","resolution":{"observed_at":"2026-08-06T16:34:25.111313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-06T16:34:25.114353Z","title":"Playing atari with deep reinforcement learning.arXiv preprint arXiv:1312.5602,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.114353Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:7c07e25d20266abd32c446a70a4e5882a5ec45f8afbd4b9c7b670096a5e05dce","observation_id":"1710d386-8bfe-4cb3-a838-d648fcb7b511","resolution":{"observed_at":"2026-08-06T16:34:25.114353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08114","last_updated":"2024-06-28T08:22:01Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T23:09:00Z","title":"Active Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08114","snapshot_observed_at":"2026-08-06T16:34:25.117469Z","title":"William Muldrew, Peter Hayes, Mingtian Zhang, and David Barber","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.117469Z"},"links":{"cited_paper":"/paper/2402.08114","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:6bd20dd4cdf7bd0dba2e1727d408f2b541f3a12eab3ca7bbfcbadb22b6349275","observation_id":"ac4fc5df-b4c9-4000-9c7b-a74f276d7b1e","resolution":{"observed_at":"2026-08-06T16:34:25.117469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.120526Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.120526Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:7e5de0a76db6686dcd029dba90212da0ea3ca52ee512498161ed8813a441e639","observation_id":"10f4b0a1-0457-4552-9c92-2537507d433a","resolution":{"observed_at":"2026-08-06T16:34:25.120526Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.124084Z","title":"Deep Research is a new agentic AI capability integrated within ChatGPT that autonomously conducts multi-step web research and synthesizes comprehensive reports","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.124084Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:4c2123a4c63073d6cc4f3f97fe8bd9e08e91cb358d2fc5afdafe83ca9c3c55d8","observation_id":"c6516752-655b-4a0b-9193-adbdc6190678","resolution":{"observed_at":"2026-08-06T16:34:25.124084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-06T16:34:25.126927Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.arXiv preprint arXiv:1910.00177,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.126927Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ece38eef620924cfe8f65fe089475cffdf02a5947c0fe31b0b6052521ed545a2","observation_id":"87571df1-77b6-48be-be6f-6d30f6d46119","resolution":{"observed_at":"2026-08-06T16:34:25.126927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T16:34:25.133720Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.133720Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:590e2f702b07feb5e05db4c9e9a10774a7bd4d9e14968b0957ec0a4eabb367c2","observation_id":"2993deae-6611-47ef-b968-555e2a0ce527","resolution":{"observed_at":"2026-08-06T16:34:25.133720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03495","last_updated":"2023-10-19T04:37:25Z","snapshot_observed_at":"2026-08-06T03:31:54.947656Z","submitted_at":"2023-05-04T15:15:22Z","title":"Automatic Prompt Optimization with \"Gradient Descent\" and Beam Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03495","snapshot_observed_at":"2026-08-06T16:34:25.139637Z","title":"gradient descent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.139637Z"},"links":{"cited_paper":"/paper/2305.03495","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ba69c25e11b03c810b7b340d7feb040f501333b86e6894ac6dbf822226fcbe40","observation_id":"78ea5e32-c17c-4513-a199-c79c0c6fdb00","resolution":{"observed_at":"2026-08-06T16:34:25.139637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06665","last_updated":"2025-08-29T04:07:26Z","snapshot_observed_at":"2026-07-06T14:17:30.922581Z","submitted_at":"2022-11-12T13:52:06Z","title":"A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06665","snapshot_observed_at":"2026-08-06T16:34:25.143438Z","title":"A survey on explainable reinforcement learning: Concepts, algorithms, challenges.arXiv preprint arXiv:2211.06665,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.143438Z"},"links":{"cited_paper":"/paper/2211.06665","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:76066638d8f6b3e2fae9f4847117449e847e30a86f443422473e90eed0c91061","observation_id":"05ccdabb-33dd-469e-9c2c-2d05c4d0ea58","resolution":{"observed_at":"2026-08-06T16:34:25.143438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-06T16:34:25.146449Z","title":"Direct preference optimization: Your language model is secretly a reward model.arXiv preprint arXiv:2305.18290,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.146449Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:fd7abb9fe842b65712858c41c08b9edc41d3634159f74aede9b0665f871b1368","observation_id":"bcec6494-167d-4b74-a35b-9e7ab6db4d5e","resolution":{"observed_at":"2026-08-06T16:34:25.146449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.149674Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.149674Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:0af84cbbac7508b7a0aaaa28fa3874a88ac9507126d4786255bd7da122b4e776","observation_id":"1ceb9cd7-bbbc-49c6-a586-76b6bd52e915","resolution":{"observed_at":"2026-08-06T16:34:25.149674Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T16:34:25.152709Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.152709Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:cea1b4d0a1f3684e88abf3ad3d162c2e682cae0fde0bde509eca0fe829710df1","observation_id":"87501923-c62b-4545-b5ef-5c4fd60de35e","resolution":{"observed_at":"2026-08-06T16:34:25.152709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.155797Z","title":"A critical look at tokenwise reward-guided text generation.arXiv preprint arXiv:2406.07780,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.155797Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:df867731acb645604bd926d0c022dd6d31a56064efd2b9dbe3a4d896fbfa5023","observation_id":"cd2fe72f-dacb-4593-a527-847122627c44","resolution":{"observed_at":"2026-08-06T16:34:25.155797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-06T16:34:25.159876Z","title":"A generalist agent.arXiv preprint arXiv:2205.06175,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.159876Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:0cea4f68f6896717573c9cd73eebe6355b929c3ed885d551a527486860d10bb6","observation_id":"8e80c9d6-ee00-4950-b41e-170613f0611b","resolution":{"observed_at":"2026-08-06T16:34:25.159876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13485","last_updated":"2022-03-17T07:01:28Z","snapshot_observed_at":"2026-07-06T12:12:25.898094Z","submitted_at":"2021-11-26T13:23:36Z","title":"Learning Long-Term Reward Redistribution via Randomized Return Decomposition","version":2},"cited_work":{"arxiv_id":"2111.13485","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.13485","snapshot_observed_at":"2026-08-06T16:34:25.815039Z","title":"Learning Long-Term Reward Redistribution via Randomized Return Decomposition","venue":"cs.LG","work_id":"00aa9170-bef2-4714-a594-8ff23db955d3","year":2021},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.163198Z"},"links":{"cited_paper":"/paper/2111.13485","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:58918222c6a8f58699ceb9115ca806c07cf98d21f68782d9a9e703e2687c0703","observation_id":"a2502d7e-e280-42d3-b361-6ba68091870a","resolution":{"observed_at":"2026-08-06T16:34:25.818920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T16:34:25.170316Z","title":"High-dimensional continuous control using generalized advantage estimation.arXiv preprint arXiv:1506.02438,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.170316Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ab0220be2de0cd553ea9e64ac1bc0de51d6b653f6b918f7e85dcbc10a510d651","observation_id":"21ae2890-0204-44ba-b4bf-2b3cff27a916","resolution":{"observed_at":"2026-08-06T16:34:25.170316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T16:34:25.176219Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.176219Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8d85a176976459c27ea5cc10affe59393db72f3a57901e8441419d0f1a9cac43","observation_id":"c615db8a-b98d-4bb0-aa2a-419d1f96996b","resolution":{"observed_at":"2026-08-06T16:34:25.176219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T16:34:25.179391Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.179391Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:b9a2b7c65eafc67baa3481291a12db69425c4cd8a75d6346b61768a45523bd19","observation_id":"86484ea3-4055-4753-a933-a2e3a05de87c","resolution":{"observed_at":"2026-08-06T16:34:25.179391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-07T17:24:01.025873Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"cited_work":{"arxiv_id":"2502.04354","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04354","snapshot_observed_at":"2026-08-06T16:34:25.763556Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","venue":"cs.CL","work_id":"5cbc144c-8813-42d6-925b-36fb5934db87","year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.182215Z"},"links":{"cited_paper":"/paper/2502.04354","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:e4a78cdf4dd5fd69e991e47977a7c696e0e6aee185a8e706c85d41f5e6d4643d","observation_id":"6f256eb6-64ed-4697-934f-42d9e1153fb3","resolution":{"observed_at":"2026-08-06T16:34:25.767096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19770","last_updated":"2026-05-12T01:02:19Z","snapshot_observed_at":"2026-07-06T21:30:28.303379Z","submitted_at":"2025-05-26T09:54:02Z","title":"Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19770","snapshot_observed_at":"2026-08-06T16:34:25.185554Z","title":"Understanding the performance gap in preference learning: A dichotomy of rlhf and dpo.arXiv preprint arXiv:2505.19770,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.185554Z"},"links":{"cited_paper":"/paper/2505.19770","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:2c106ad1a5e2db3eb736e2f0181ef1572773de8d7001f8cf3ac642e1cec802da","observation_id":"08498943-cdf1-4c8e-a21a-b4efbf1bb866","resolution":{"observed_at":"2026-08-06T16:34:25.185554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15893","last_updated":"2022-10-28T04:57:21Z","snapshot_observed_at":"2026-07-06T14:11:32.120383Z","submitted_at":"2022-10-28T04:57:21Z","title":"When Life Gives You Lemons, Make Cherryade: Converting Feedback from Bad Responses into Good Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15893","snapshot_observed_at":"2026-08-06T16:34:25.188545Z","title":"When life gives you lemons, make cherryade: Converting feedback from bad responses into good labels.arXiv preprint arXiv:2210.15893,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.188545Z"},"links":{"cited_paper":"/paper/2210.15893","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:c84de8949be0e304da0fd4a3cdae2b6c976e354de76ad1d8b7ce5abefb6b6d02","observation_id":"b622793b-3d91-4a6e-b0db-24460636a79a","resolution":{"observed_at":"2026-08-06T16:34:25.188545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.192087Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.192087Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:d2a740e634eae5b74eca1a669ab8a6657a79babad7f1c65f0f291aab70028822","observation_id":"ae7730dd-9eb7-48e4-a4de-b85e157906e8","resolution":{"observed_at":"2026-08-06T16:34:25.192087Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-06T16:34:25.194886Z","title":"Mastering chess and shogi by self-play with a general reinforcement learning algorithm.arXiv preprint arXiv:1712.01815,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.194886Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:6a2fb866fdb2b691972196c3fea874be3884ca08ff0d847e8b0ccb3712fe0bec","observation_id":"c36e4d87-d47b-44e8-8317-feb967e0fa88","resolution":{"observed_at":"2026-08-06T16:34:25.194886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08358","last_updated":"2024-04-17T01:58:09Z","snapshot_observed_at":"2026-07-06T17:01:13.998131Z","submitted_at":"2023-12-13T18:51:34Z","title":"Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08358","snapshot_observed_at":"2026-08-06T16:34:25.197977Z","title":"Distributional preference learning: Understanding and accounting for hidden context in rlhf.arXiv preprint arXiv:2312.08358,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.197977Z"},"links":{"cited_paper":"/paper/2312.08358","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:378b3d4df2c8b60df8f258d89a46e070665c909c4c4dce164cd706a6207472f1","observation_id":"129db947-a33a-4513-93e2-67f981934587","resolution":{"observed_at":"2026-08-06T16:34:25.197977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17371","last_updated":"2024-07-18T05:18:14Z","snapshot_observed_at":"2026-08-06T15:40:06.757182Z","submitted_at":"2023-11-29T05:54:41Z","title":"Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17371","snapshot_observed_at":"2026-08-06T16:34:25.201081Z","title":"Should we be going mad? a look at multi-agent debate strategies for llms.arXiv preprint arXiv:2311.17371,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.201081Z"},"links":{"cited_paper":"/paper/2311.17371","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:2897c64d4a6f942099ba1c426167ff46c0e45f50f22f4200194e59b041b8ece6","observation_id":"6e9d55e6-b139-4cc8-a47c-3cd574ed1282","resolution":{"observed_at":"2026-08-06T16:34:25.201081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05070","last_updated":"2024-08-20T19:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-07T18:21:17Z","title":"A Roadmap to Pluralistic Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05070","snapshot_observed_at":"2026-08-06T16:34:25.204086Z","title":"A roadmap to pluralistic alignment.arXiv preprint arXiv:2402.05070,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.204086Z"},"links":{"cited_paper":"/paper/2402.05070","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:c3291807e62be665f18abb8a0bae6199d58f4c92f6ca493f0627988e3d1412fd","observation_id":"49f8f937-525f-4198-9dfc-d182860057d2","resolution":{"observed_at":"2026-08-06T16:34:25.204086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15624","last_updated":"2025-01-25T11:10:39Z","snapshot_observed_at":"2026-08-02T18:32:46.919947Z","submitted_at":"2024-05-24T15:13:53Z","title":"Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15624","snapshot_observed_at":"2026-08-06T16:34:25.210425Z","title":"Inverse-rlignment: Inverse reinforcement learning from demonstrations for llm alignment.arXiv preprint arXiv:2405.15624,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.210425Z"},"links":{"cited_paper":"/paper/2405.15624","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ef124dd8e7693fd3a5020949fdbb976b8b0edaa2f01531a5e17fb42445ab0349","observation_id":"299da6d6-f1b3-43da-9533-97f5226241fe","resolution":{"observed_at":"2026-08-06T16:34:25.210425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-06T16:34:25.213454Z","title":"Query-dependent prompt evaluation and optimization with offline inverse rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.213454Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:5018949a37bc1f715130c256b01ddfeb3feeb0daaa18dc95ff1da7e0739e480b","observation_id":"1b8a5cf1-704d-4ee7-9611-ac9b10123401","resolution":{"observed_at":"2026-08-06T16:34:25.213454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09737","last_updated":"2022-05-09T19:02:27Z","snapshot_observed_at":"2026-07-06T12:20:05.607892Z","submitted_at":"2021-12-16T07:01:28Z","title":"Learning to Repair: Repairing model output errors after deployment using a dynamic memory of feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09737","snapshot_observed_at":"2026-08-06T16:34:25.220429Z","title":"Learning to repair: Repairing model output errors after deployment using a dynamic memory of feedback.arXiv preprint arXiv:2112.09737,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.220429Z"},"links":{"cited_paper":"/paper/2112.09737","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:12151f5dc413b189bb2e4d5352c1abdd607ff532dd00cb381d219668aa7a19ee","observation_id":"36944cbd-6b9a-4553-9207-488a235ed765","resolution":{"observed_at":"2026-08-06T16:34:25.220429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T16:34:25.223363Z","title":"Deepmind control suite.arXiv preprint arXiv:1801.00690,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.223363Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:0e82846dfa0305fee493bfcb5584cb8d6f2cc68d959f53cea93f20509bec2405","observation_id":"bbeeeba4-80c0-4693-9d85-79b85eef1422","resolution":{"observed_at":"2026-08-06T16:34:25.223363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.226345Z","title":"Grpo: Generalized reinforcement preference optimization.arXiv preprint arXiv:2405.00000,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.226345Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:2b0729467ff73185b60df5748406da19f7d016334d0aa9e4b1aa280855d033bc","observation_id":"5c3029af-049b-429f-a029-722c15b9e226","resolution":{"observed_at":"2026-08-06T16:34:25.226345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T16:34:25.230052Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.230052Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:de1ac21d3a0e242e405b6d63cf4a59766a9d5ecbc7c1ea6ced1fe100c09f8a6a","observation_id":"2fef2af8-216f-45a4-9f61-02b0e6243bcd","resolution":{"observed_at":"2026-08-06T16:34:25.230052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.233479Z","title":"Gram: A generative foundation reward model for reward generalization.arXiv preprint arXiv:2506.14175, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.233479Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:48d5d3c5753c3d1bf47ac36a8505e7ee88fc224ec19446d64c84d4817d5240d9","observation_id":"83ad950e-a994-42d4-a596-dd77890634e7","resolution":{"observed_at":"2026-08-06T16:34:25.233479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T16:34:25.236262Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.236262Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:f67f6f9ee26c1e9444a2c136cb64a345f7459e9b23b60e176b766086cb8265d1","observation_id":"02dac0dd-db99-4c97-ae6b-d9eee97d771c","resolution":{"observed_at":"2026-08-06T16:34:25.236262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-06T16:34:25.239464Z","title":"Reinforcement learning for reasoning in large language models with one training example","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.239464Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:a857d33a2fabc46ec35d50e099bdcf4a29efb9c27cd0e0ecc8c7cb8f4b2c1808","observation_id":"f0519097-48ef-4274-8731-66dc94072c1e","resolution":{"observed_at":"2026-08-06T16:34:25.239464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10093","last_updated":"2024-10-14T02:21:29Z","snapshot_observed_at":"2026-07-06T19:32:46.742766Z","submitted_at":"2024-10-14T02:21:29Z","title":"How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective","version":1},"cited_work":{"arxiv_id":"2410.10093","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10093","snapshot_observed_at":"2026-08-06T16:34:25.466718Z","title":"How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective","venue":"cs.CL","work_id":"2c2381d3-00ff-4ebf-91c3-7fedb298aabe","year":2024},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.246579Z"},"links":{"cited_paper":"/paper/2410.10093","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ef7a1437a3f79f6ea69cd4b01bc1bd89df600a4cb5162347868c4c23f329e4c8","observation_id":"b81d8143-0d29-4284-9d02-6ba928991711","resolution":{"observed_at":"2026-08-06T16:34:25.472318Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-02T03:59:22.576409Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-06T16:34:25.249776Z","title":"Gibbs sampling from human feedback: A provable kl-constrained framework for rlhf.arXiv preprint arXiv:2312.11456,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.249776Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:9d17b7fa5966368a59bf635b16471f77b329afa306f8c93074b370061662d1d5","observation_id":"caa7a167-a786-40b8-ad11-8e33e6c466dd","resolution":{"observed_at":"2026-08-06T16:34:25.249776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-07T16:02:06.428060Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-06T16:34:25.253465Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.253465Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:5c0e939490a589f59e8db5b09d467ec465e3250e4003cd141281dce42e485761","observation_id":"11c90913-72bb-4836-a257-2e2879251b27","resolution":{"observed_at":"2026-08-06T16:34:25.253465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-06T16:34:25.256725Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models.arXiv preprint arXiv:2501.09686,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.256725Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:20b5c72a8b32b4e429562aba3b6ad1994aab724d819a2db9c6dbc913039a16a6","observation_id":"34aa152a-be09-43ba-852b-232695cee304","resolution":{"observed_at":"2026-08-06T16:34:25.256725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-07-06T18:01:05.698046Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-06T16:34:25.260209Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study.arXiv preprint arXiv:2404.10719,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.260209Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:14316a97c96ebaab06b78c6ace97d2c297b2477370324d759b1e7d6b60da3f23","observation_id":"5809d262-c85c-43f6-ae1f-2ecea71cf6bc","resolution":{"observed_at":"2026-08-06T16:34:25.260209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03409","last_updated":"2024-04-15T07:50:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-07T00:07:15Z","title":"Large Language Models as Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03409","snapshot_observed_at":"2026-08-06T16:34:25.263190Z","title":"Large language models as optimizers.arXiv preprint arXiv:2309.03409,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.263190Z"},"links":{"cited_paper":"/paper/2309.03409","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:f1342698bd61f0a29fe9b160c36d8a6c6c123d0c946762b8750788ae602ee64c","observation_id":"738a22bb-d8db-4848-92be-c26a1f7ba4ff","resolution":{"observed_at":"2026-08-06T16:34:25.263190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04478","last_updated":"2022-02-14T04:26:50Z","snapshot_observed_at":"2026-07-06T12:36:04.284368Z","submitted_at":"2022-02-09T14:17:05Z","title":"Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04478","snapshot_observed_at":"2026-08-06T16:34:25.266194Z","title":"Rethinking goal-conditioned supervised learning and its connection to offline rl.arXiv preprint arXiv:2202.04478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.266194Z"},"links":{"cited_paper":"/paper/2202.04478","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:5292f4c6d96d686200de2a52e05f1cfb81d10d3688a011a4ea1a7747225f04e6","observation_id":"a357dcd6-bad0-41da-8319-1a491f2a2c77","resolution":{"observed_at":"2026-08-06T16:34:25.266194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10216","last_updated":"2024-10-23T08:22:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:49:59Z","title":"Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10216","snapshot_observed_at":"2026-08-06T16:34:25.269350Z","title":"Regularizing hidden states enables learning generalizable reward model for llms.arXiv preprint arXiv:2406.10216,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.269350Z"},"links":{"cited_paper":"/paper/2406.10216","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:9ba0e885cee8071966865614d9d97b7223bb30bfca077b63fa3e00b2d8fe010e","observation_id":"b248e687-6a40-4976-a20b-c4b0a2463933","resolution":{"observed_at":"2026-08-06T16:34:25.269350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10958","last_updated":"2024-05-27T20:05:03Z","snapshot_observed_at":"2026-07-06T17:31:21.158599Z","submitted_at":"2024-02-12T22:47:57Z","title":"Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10958","snapshot_observed_at":"2026-08-06T16:34:25.272362Z","title":"Relative preference optimization: Enhancing llm alignment through contrasting responses across identical and diverse prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.272362Z"},"links":{"cited_paper":"/paper/2402.10958","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:cca658977d9ab765a5a52f45c0e9487cdbf8a325094b5509faf0adecccddf7e9","observation_id":"ac69e7f0-10ed-4d9b-8ad0-9b06eba55910","resolution":{"observed_at":"2026-08-06T16:34:25.272362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T16:34:25.276239Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.276239Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:dac62591ad5738b3c36a24eb3cfadb0e2070e4626357ca3bde5d97a90b2784c0","observation_id":"0daaf2f3-714b-4697-b4c1-8ef1564e3f8b","resolution":{"observed_at":"2026-08-06T16:34:25.276239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-04T23:38:14.844517Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-06T16:34:25.279111Z","title":"Rrhf: Rank responses to align language models with human feedback without tears.arXiv preprint arXiv:2304.05302,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.279111Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:259b55b66d537826cdff80a956591b127bab52622e9c9d6164d724f025aa9f65","observation_id":"26a849c7-7e62-4a1a-9237-5698fd209cb9","resolution":{"observed_at":"2026-08-06T16:34:25.279111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09175","last_updated":"2024-07-31T13:55:49Z","snapshot_observed_at":"2026-07-06T16:07:26.202458Z","submitted_at":"2023-08-17T20:27:33Z","title":"Diversifying AI: Towards Creative Chess with AlphaZero","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09175","snapshot_observed_at":"2026-08-06T16:34:25.282653Z","title":"Diversifying ai: Towards creative chess with alphazero","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.282653Z"},"links":{"cited_paper":"/paper/2308.09175","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:986aa18499ab3dedd83cb005750c168e107cf5856832a59f1cf5e5158a2aa8d8","observation_id":"c79daecb-c563-4a67-b965-4f7e470b53a2","resolution":{"observed_at":"2026-08-06T16:34:25.282653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:25.285823Z","title":"When scaling meets LLM finetuning: The effect of data, model and finetuning method","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.285823Z"},"links":{"citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:c21cbe9fe6937b9836d032469d008d860355bd16aab561eee3d201f974dce6b8","observation_id":"1b131a45-5c49-4f61-b78d-06947941fe55","resolution":{"observed_at":"2026-08-06T16:34:25.285823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-06T16:34:25.288762Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search.Advances in Neural Information Processing Systems, 37:64735–64772, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.288762Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:dc5905cfb88987405b44060bc6439e38c61c6df8b0f57c5b49c8d980cc498f29","observation_id":"963c5887-8ece-4b8d-8c6c-f0a2e45def27","resolution":{"observed_at":"2026-08-06T16:34:25.288762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05171","last_updated":"2024-07-09T13:17:36Z","snapshot_observed_at":"2026-08-03T16:32:31.666416Z","submitted_at":"2024-03-08T09:20:12Z","title":"Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05171","snapshot_observed_at":"2026-08-06T16:34:25.291921Z","title":"Xiaoying Zhang, Jean-Francois Ton, Wei Shen, Hongning Wang, and Yang Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.291921Z"},"links":{"cited_paper":"/paper/2403.05171","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:512647a29ea6363a41ee0e258c758ffe9c15640438401de9c4b64572e2f57593","observation_id":"d3396fdf-285c-4f06-9ab9-8ce1b7348ab2","resolution":{"observed_at":"2026-08-06T16:34:25.291921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-07T18:08:01.409989Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-08-06T16:34:25.294914Z","title":"Secrets of rlhf in large language models part i: Ppo.arXiv preprint arXiv:2307.04964,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.294914Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:6098474134449e51dbe02a158284998c59ebe46ea5e624ee1eeb47f13cc9eb6a","observation_id":"4730a3b9-3f73-48fe-bbaa-275bc9827592","resolution":{"observed_at":"2026-08-06T16:34:25.294914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-06T16:34:25.297970Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.297970Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:779fe062e132eed7b01eb0069a4b970f37a673f2a816fa9fb07e2842024f3255","observation_id":"99c591d9-b88d-4fbb-b681-f880534ff6fc","resolution":{"observed_at":"2026-08-06T16:34:25.297970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-06T16:34:25.301260Z","title":"Lima: Less is more for alignment.Advances in Neural Information Processing Systems, 36:55006–55021, 2023a","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.301260Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:7e78f00311cbc3d2de987651c3db199570a2cceb60924d9c4867ffa76565ece5","observation_id":"ccac6194-08ff-4523-a40f-e40eac577756","resolution":{"observed_at":"2026-08-06T16:34:25.301260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T16:34:24.945869Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":1952,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.945869Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:8e95bbf8e5569c0d7e82870bfe2cf5c82429ef02ec47a365fc2d5353277a2bc6","observation_id":"90b10786-5de4-4378-88bc-07dde36cb0ba","resolution":{"observed_at":"2026-08-06T16:34:24.945869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-06T16:34:25.207451Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models.arXiv preprint arXiv:2206.04615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":1973,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.207451Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:59c4464dfccf8c7a4be896242c592067b022d0c1a5b1b09406e0f4fac4bb6c66","observation_id":"3f63be04-b7ef-4d04-826a-b31d7e63bd06","resolution":{"observed_at":"2026-08-06T16:34:25.207451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07812","last_updated":"2024-08-07T18:27:59Z","snapshot_observed_at":"2026-07-06T17:29:00.943463Z","submitted_at":"2024-02-12T17:17:50Z","title":"Retrieval Augmented Thought Process for Private Data Handling in Healthcare","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07812","snapshot_observed_at":"2026-08-06T16:34:25.136743Z","title":"Retrieval-augmented thought process as sequential decision making.arXiv preprint arXiv:2402.07812,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.136743Z"},"links":{"cited_paper":"/paper/2402.07812","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:377e7855a32fdf089b7d01a84816deea2308cbf980af4306116fa83322cd9c08","observation_id":"3889c48b-10e2-4ab4-bbfb-46d8a41f0f78","resolution":{"observed_at":"2026-08-06T16:34:25.136743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03025","last_updated":"2023-11-12T06:25:32Z","snapshot_observed_at":"2026-07-06T15:51:04.777897Z","submitted_at":"2023-07-06T14:42:01Z","title":"Style Over Substance: Evaluation Biases for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03025","snapshot_observed_at":"2026-08-06T16:34:25.242829Z","title":"Style over substance: Evaluation biases for large language models.arXiv preprint arXiv:2307.03025,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.242829Z"},"links":{"cited_paper":"/paper/2307.03025","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:1204197293045f4bdc00024f391a14c1bc350c06c256f7820488e646120db68c","observation_id":"f8c77f3b-3746-4371-abd6-e3bb2c761ef8","resolution":{"observed_at":"2026-08-06T16:34:25.242829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":6,"unresolved":89,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":117},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 117 outbound references and 3 inbound Pith citation observations for arXiv:2507.13158."}