Pith. sign in

Paper Citation Record · LEDGER

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities

As of 7 August 2026, this Paper Citation Record lists 100 of 117 outbound references and 3 inbound Pith citation observations for arXiv:2507.13158.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.13158 v1

Coverage vector

measured 100 of 117 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T16:34:25.301260Z

measured 103 of 103 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T11:17:36.742733Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T07:59:40.152268Z

Reference resolution

100 of 117 outbound references displayed

  • verified exact5
  • verified fuzzy0
  • unresolved89
  • parse uncertain6
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 77084717-f2be-497f-8d93-392cf620e010 · outbound

This paper cites GPT-4 Technical Report.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.929368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.929368Z digest=sha256:a1678ae94a13c392d60a1d661265d313517b4412d616b9d5ff017885f624f350

Observation a422fa13-9e47-499a-a907-8db37dd31b07 · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 7

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:24.949183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.949183Z digest=sha256:b79b2f63da3dfd9abfb5f50c7ad72a691c7f5c3cc586b3f6c6043561e32aba51

Observation e1257466-8376-4141-82e0-9e481af8b394 · outbound

This paper cites Language models are few-shot learners.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Language models are few-shot learners

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.952418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.952418Z digest=sha256:ceb4910d8886d1ca74a0640c61d04949cade5fd8b2fa5c3a9af0c54d2ebc67d6

Observation 77be57c1-9825-4171-a4c3-dca895a4b655 · outbound

This paper cites PAD: Personalized Alignment of LLMs at Decoding-Time.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities PAD: Personalized Alignment of LLMs at Decoding-Time

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.962376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.962376Z digest=sha256:bb035b22c76fe3c9322fac34d6179aafbb5a52f77459caeb89e45b40dc2764d7

Observation 12d4acc6-c2fe-47e3-8ed9-3c0a9e4d5f3e · outbound

This paper cites Reward Model Ensembles Help Mitigate Overoptimization.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Reward Model Ensembles Help Mitigate Overoptimization

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.968234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.968234Z digest=sha256:ec55d1064a1b2459ed2dfabded7c681293a920ba2e78b2dc7681dd2d96a20f77

Observation 91495224-4271-46dd-b6f0-d9345a56b743 · outbound

This paper cites SEE: Strategic Exploration and Exploitation for Cohesive In-Context Prompt Optimization.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities SEE: Strategic Exploration and Exploitation for Cohesive In-Context Prompt Optimization

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.971232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.971232Z digest=sha256:47458d9cecaf3b4b995baba701ffadca8873fa020ace3f4f1f97c5370c36ca62

Observation 6761f935-4f6b-4abd-97c8-6a9572c0cc0d · outbound

This paper cites A Survey of Automatic Prompt Optimization with Instruction-focused Heuristic-based Search Algorithm.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Survey of Automatic Prompt Optimization with Instruction-focused Heuristic-based Search Algorithm

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.975337Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.975337Z digest=sha256:9480c4c07b72e692a35a0e7e793a65d6ab81a9909ea3b830613c95c1815c653b

Observation 02831b20-4cac-4fee-97a0-fbe7e43d64c8 · outbound

This paper cites Bert: Pre-training of deep bidirectional transformers for language understanding.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Bert: Pre-training of deep bidirectional transformers for language understanding

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.981480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.981480Z digest=sha256:9a2d3e180eb6783149d34ef302d2f680c4ee8365e022b5a23a0a5bcabbad8494

Observation 1e79d17c-964f-441e-b61a-0d03c59a8ba3 · outbound

This paper cites RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.985050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.985050Z digest=sha256:5857b49a432b3de82fdbb33223ca13ad8844caf99c2c1181a46d6009394c4d68

Observation 234ef8e0-e046-41dc-8a62-bd88d24ab84a · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 19

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:24.988098Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.988098Z digest=sha256:b785873d3c25f4227bf0aa9b8fad1f6a2e6bb1f43cf7c1f6639a508717b49117

Observation c99d0c59-2b0a-4352-94b3-00b75f366909 · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities PaLM-E: An Embodied Multimodal Language Model

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.991170Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.991170Z digest=sha256:ea0965c4d7f4366d67777fcdc2515fb24de81fbc59c0a152c7aa59cc01047911

Observation 3c01026a-8ea6-45ac-b721-2b1569ef96ae · outbound

This paper cites Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.994147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.994147Z digest=sha256:6d11c9598f291c695c4bebd32cb61c9100b246a475c9cea402d110eac74c7543

Observation 3fa477cb-68ae-4a5e-a4f9-a9649ee2ea25 · outbound

This paper cites KTO: Model Alignment as Prospect Theoretic Optimization.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities KTO: Model Alignment as Prospect Theoretic Optimization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.997269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.997269Z digest=sha256:2dea87a82ec6c68945f60e833c9d0cfdf1c96d601c847de58c2ddd946c69b4a1

Observation e90adc2d-d0b0-4c82-816c-7f3fad3051e9 · outbound

This paper cites Self-Attentional Credit Assignment for Transfer in Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Self-Attentional Credit Assignment for Transfer in Reinforcement Learning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.003524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.003524Z digest=sha256:e1999f66e5e054910853da9346be32160bad03c881a1912d6cd699362e33c0a6

Observation 6f8a58f3-a49d-42a4-b821-d9b72e930c01 · outbound

This paper cites Learning Robust Rewards with Adversarial Inverse Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Learning Robust Rewards with Adversarial Inverse Reinforcement Learning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.007040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.007040Z digest=sha256:1e334e704d679a5efc4c0cfcbb11c0a2e6cd729287b000b67c7fb8eb87bdcdf0

Observation 93ddae34-6421-4d2e-a4a4-6e5dfa256901 · outbound

This paper cites BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.013301Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.013301Z digest=sha256:8622270f451fdda343bd395e3aae8c8f35b947fe73e7ce9a6c52663c396fb71b

Observation 4cd38935-20b2-47eb-a5ba-8fa46c2c118a · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.016230Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.016230Z digest=sha256:c064380788597bf55451099a6936880f6d82a90ff92a73df1a7e457647a05ce4

Observation 5b868f90-ea30-4833-9110-e319d1f4a64d · outbound

This paper cites EvoPrompt: Connecting LLMs with Evolutionary Algorithms Yields Powerful Prompt Optimizers.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities EvoPrompt: Connecting LLMs with Evolutionary Algorithms Yields Powerful Prompt Optimizers

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.018916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.018916Z digest=sha256:837ae926dfcbd751e27604be16977173a7fea1fee042e95f5e25fca8af373d43

Observation 2e45fe2a-0649-4a2e-88a4-cf1875fbf5d2 · outbound

This paper cites Direct Language Model Alignment from Online AI Feedback.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Direct Language Model Alignment from Online AI Feedback

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.021993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.021993Z digest=sha256:132e7387f7b420c8620f055b09df2c0f0a55b852a6a3bf01adf9dcabab4fc70c

Observation ad89a21f-894c-43aa-beaa-cc1ad8ea8a61 · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 31

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:25.025118Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.025118Z digest=sha256:8d2bce22ac939c0aee6d951838da34c710ba25c02fcec8732b55977dbd3989a1

Observation f633d741-1147-4b73-8843-2e5ae5178b08 · outbound

This paper cites Soft Actor-Critic Algorithms and Applications.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Soft Actor-Critic Algorithms and Applications

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.028758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.028758Z digest=sha256:7104881232801141f93852ea4c61bf6ca2cea15a4569acb89bd60a8483c93591

Observation db3d3eb6-22a5-47aa-a7d5-f9f1b50f5ccd · outbound

This paper cites Prompt-to-Prompt Image Editing with Cross Attention Control.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Prompt-to-Prompt Image Editing with Cross Attention Control

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.034750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.034750Z digest=sha256:088703eaf7188c32903915bea08e68c9d4b6a8dd2a373141eaa1d6db4d674794

Observation 9ab5c693-073c-41f4-b2ef-6d36a1654708 · outbound

This paper cites Explaining Length Bias in LLM-Based Preference Evaluations.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Explaining Length Bias in LLM-Based Preference Evaluations

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.041656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.041656Z digest=sha256:e12b4b0830880f3c86ac75aa193c8895e289849b50fac75f16dae2b800f21474

Observation da8b9743-caaa-4d03-9a5d-143f401474c0 · outbound

This paper cites Large Language Models Cannot Self-Correct Reasoning Yet.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Large Language Models Cannot Self-Correct Reasoning Yet

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.044668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.044668Z digest=sha256:cb36deda93b4857c7906aab97c5106c66507d9e1a880acdc357abfdf40cf6b7b

Observation 028f2908-3e8d-4bfa-a97f-5e506b9f1667 · outbound

This paper cites Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.048128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.048128Z digest=sha256:1a2c53215f5eb54664c96b190871867b1b699e4181781b07b294951bb0621b30

Observation f457f343-d5d0-4591-86e8-36c7a6fa49e7 · outbound

This paper cites OpenAI o1 System Card.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities OpenAI o1 System Card

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.051356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.051356Z digest=sha256:818a8f7a4eb81a4d8f199c86f026f057a15ed661d3b58b81a9eb39343c5d677e

Observation 93a3a016-32f8-40a2-a29d-41d011bc36ec · outbound

This paper cites Towards Efficient Exact Optimization of Language Model Alignment.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Towards Efficient Exact Optimization of Language Model Alignment

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.054186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.054186Z digest=sha256:2a01cb864b20a4f5979dbabefa3fab5916b58d4f3f321fb24e9f38c73c527729

Observation 7045ef3e-baf2-4297-88d2-97e11e689a8d · outbound

This paper cites Scaling Laws for Neural Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Scaling Laws for Neural Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.057213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.057213Z digest=sha256:6eee07d76afcb9adf2574439ee529149845d3df01a3d637320f735e42b9d2a11

Observation 50e73708-3b7d-4fc0-90bc-a99fa3c9ceb4 · outbound

This paper cites ARGS: Alignment as Reward-Guided Search.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities ARGS: Alignment as Reward-Guided Search

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.063586Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.063586Z digest=sha256:384391c748cef6d86bb7ccaf401b5ec2ca5f001fb795621d74c35e385f917592

Observation 3d1a173a-0a9d-4c7c-90be-1b997d674bd9 · outbound

This paper cites Decomposed Prompting: A Modular Approach for Solving Complex Tasks.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Decomposed Prompting: A Modular Approach for Solving Complex Tasks

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.066495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.066495Z digest=sha256:343ea5c1b702a9991e83046fecda78f3f2b1d7a48b997799c909cf43fca33439

Observation 4e12ffca-9b85-4c25-ba3e-61cd0bbcb210 · outbound

This paper cites Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:26.167583Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T16:34:25.069706Z digest=sha256:8dbfeaf906536642a30f6f9e96800fe19f4fef6a53bb84a2d32bf76c465c5a17

Observation 0251ed79-ed5f-4d75-a2e3-93e6133dc99c · outbound

This paper cites DiffWave: A Versatile Diffusion Model for Audio Synthesis.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DiffWave: A Versatile Diffusion Model for Audio Synthesis

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.073347Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.073347Z digest=sha256:3ca521c2cc43139cd7fde86b60b50e431fe74ffbb9db2fee43959ac162a09250

Observation 87e7605d-5449-4237-87ed-abfbf8fe873e · outbound

This paper cites Privacy in Large Language Models: Attacks, Defenses and Future Directions.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Privacy in Large Language Models: Attacks, Defenses and Future Directions

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.076609Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.076609Z digest=sha256:3fa61d404d9409e9e4a9bc25aea614873e31e09f72b39b3fbc401b41563556b9

Observation 5cd7afb4-fe5b-495e-9338-84609153062c · outbound

This paper cites Personalized Language Modeling from Personalized Human Feedback.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Personalized Language Modeling from Personalized Human Feedback

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.079612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.079612Z digest=sha256:09c32ae730d63d9a1617bce24f5b162aececba06284fe4092687c46b4fd6f591

Observation bbf519a6-9680-4607-8070-a3251649d9d9 · outbound

This paper cites Reward-Guided Speculative Decoding for Efficient LLM Reasoning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Reward-Guided Speculative Decoding for Efficient LLM Reasoning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.083207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.083207Z digest=sha256:ff3c96ec5234a285930222fca1b9a6db59a6e3ec5d6a6a0db1b24e6eff5e21b6

Observation 4a006a67-de87-4587-9da6-2604c988b059 · outbound

This paper cites AI Transparency in the Age of LLMs: A Human-Centered Research Roadmap.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities AI Transparency in the Age of LLMs: A Human-Centered Research Roadmap

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.086302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.086302Z digest=sha256:8bf0a5deda3b8f0261b2c2e8cccae369eeffe31d26d0912bc71c472565ffb94a

Observation ddd944c0-7925-4e6a-9efe-88cafb060228 · outbound

This paper cites 24 (AAAI 2025 and ACL.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities 24 (AAAI 2025 and ACL

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.089378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.089378Z digest=sha256:8592e87fac8f13c29632129af7cd3f7636eb771d61a702e7bdbead94ed0d1704

Observation 8345db02-524c-42cc-9e93-99dfba1bf963 · outbound

This paper cites Statistical Rejection Sampling Improves Preference Optimization.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Statistical Rejection Sampling Improves Preference Optimization

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.092262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.092262Z digest=sha256:43692a0b1f85fd0fbcfcabcaaa5be896a5cb6237dadb31e133d81ea86a5c38e6

Observation 9236ba57-eb05-42d2-a5e3-a1d44d921573 · outbound

This paper cites RRM: Robust Reward Model Training Mitigates Reward Hacking.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities RRM: Robust Reward Model Training Mitigates Reward Hacking

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.095336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.095336Z digest=sha256:1b0da3e965dceaa13279b9600aa57ca9cce0bbb784f6ecd1da150c110ceb78a2

Observation e7399c96-4795-48db-842d-c9751bf8efca · outbound

This paper cites RoBERTa: A Robustly Optimized BERT Pretraining Approach.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities RoBERTa: A Robustly Optimized BERT Pretraining Approach

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.098649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.098649Z digest=sha256:fd7334c6fa32d37398b9fb0d5c4cc6e4119065b2d682bdd59784003795bc6a35

Observation 7b49c1be-5347-4cca-825b-e4b3fba7e550 · outbound

This paper cites Inference-time scaling for generalist reward modeling.arXiv preprint arXiv:2504.02495,.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Inference-time scaling for generalist reward modeling.arXiv preprint arXiv:2504.02495,

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.101848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.101848Z digest=sha256:87a11d1a8bee2689b831934c2e6eae8c4ea6df60159391070c86835f29ed0c2f

Observation 28372cfb-437c-4cf6-9e3c-4a6219d7a720 · outbound

This paper cites Rethinking Diverse Human Preference Learning through Principal Component Analysis.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Rethinking Diverse Human Preference Learning through Principal Component Analysis

Reference 56

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:26.018857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T16:34:25.104669Z digest=sha256:ac26a7bf6c66e46b871cacffbcd957de206c5f0c96480ef2aa24d3c372330713

Observation f60977e9-086c-499f-b5b7-6954f51060d3 · outbound

This paper cites Generative Reward Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Generative Reward Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.107700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.107700Z digest=sha256:4a3f580a0da62e1a5c3bda6cbeffe44aa14d3bd419aae4c93d2bb921862818bd

Observation 4186af3e-c5b1-429b-aa9a-2686c2ec0536 · outbound

This paper cites A Survey of Explainable Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Survey of Explainable Reinforcement Learning

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.111313Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.111313Z digest=sha256:babdca929f3d88b149435b8b44c160ca2941214e171f2fa6a34713d064e746bc

Observation 1710d386-8bfe-4cb3-a838-d648fcb7b511 · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Playing Atari with Deep Reinforcement Learning

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.114353Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.114353Z digest=sha256:7c07e25d20266abd32c446a70a4e5882a5ec45f8afbd4b9c7b670096a5e05dce

Observation ac4fc5df-b4c9-4000-9c7b-a74f276d7b1e · outbound

This paper cites Active Preference Learning for Large Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Active Preference Learning for Large Language Models

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.117469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.117469Z digest=sha256:6bd20dd4cdf7bd0dba2e1727d408f2b541f3a12eab3ca7bbfcbadb22b6349275

Observation 10f4b0a1-0457-4552-9c92-2537507d433a · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 61

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:25.120526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.120526Z digest=sha256:7e5de0a76db6686dcd029dba90212da0ea3ca52ee512498161ed8813a441e639

Observation c6516752-655b-4a0b-9193-adbdc6190678 · outbound

This paper cites Deep Research is a new agentic AI capability integrated within ChatGPT that autonomously conducts multi-step web research and synthesizes comprehensive reports.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Deep Research is a new agentic AI capability integrated within ChatGPT that autonomously conducts multi-step web research and synthesizes comprehensive reports

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.124084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.124084Z digest=sha256:4c2123a4c63073d6cc4f3f97fe8bd9e08e91cb358d2fc5afdafe83ca9c3c55d8

Observation 87571df1-77b6-48be-be6f-6d30f6d46119 · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.126927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.126927Z digest=sha256:ece38eef620924cfe8f65fe089475cffdf02a5947c0fe31b0b6052521ed545a2

Observation 2993deae-6611-47ef-b968-555e2a0ce527 · outbound

This paper cites SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.133720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.133720Z digest=sha256:590e2f702b07feb5e05db4c9e9a10774a7bd4d9e14968b0957ec0a4eabb367c2

Observation 78ea5e32-c17c-4513-a199-c79c0c6fdb00 · outbound

This paper cites Automatic Prompt Optimization with "Gradient Descent" and Beam Search.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Automatic Prompt Optimization with "Gradient Descent" and Beam Search

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.139637Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.139637Z digest=sha256:ba69c25e11b03c810b7b340d7feb040f501333b86e6894ac6dbf822226fcbe40

Observation 05ccdabb-33dd-469e-9c2c-2d05c4d0ea58 · outbound

This paper cites A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.143438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.143438Z digest=sha256:76066638d8f6b3e2fae9f4847117449e847e30a86f443422473e90eed0c91061

Observation bcec6494-167d-4b74-a35b-9e7ab6db4d5e · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.146449Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.146449Z digest=sha256:fd7abb9fe842b65712858c41c08b9edc41d3634159f74aede9b0665f871b1368

Observation 1ceb9cd7-bbbc-49c6-a586-76b6bd52e915 · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 70

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:25.149674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.149674Z digest=sha256:0af84cbbac7508b7a0aaaa28fa3874a88ac9507126d4786255bd7da122b4e776

Observation 87501923-c62b-4545-b5ef-5c4fd60de35e · outbound

This paper cites Hierarchical Text-Conditional Image Generation with CLIP Latents.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Hierarchical Text-Conditional Image Generation with CLIP Latents

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.152709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.152709Z digest=sha256:cea1b4d0a1f3684e88abf3ad3d162c2e682cae0fde0bde509eca0fe829710df1

Observation cd2fe72f-dacb-4593-a527-847122627c44 · outbound

This paper cites A critical look at tokenwise reward-guided text generation.arXiv preprint arXiv:2406.07780,.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A critical look at tokenwise reward-guided text generation.arXiv preprint arXiv:2406.07780,

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.155797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.155797Z digest=sha256:df867731acb645604bd926d0c022dd6d31a56064efd2b9dbe3a4d896fbfa5023

Observation 8e80c9d6-ee00-4950-b41e-170613f0611b · outbound

This paper cites A Generalist Agent.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Generalist Agent

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.159876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.159876Z digest=sha256:0cea4f68f6896717573c9cd73eebe6355b929c3ed885d551a527486860d10bb6

Observation a2502d7e-e280-42d3-b361-6ba68091870a · outbound

This paper cites Learning Long-Term Reward Redistribution via Randomized Return Decomposition.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Learning Long-Term Reward Redistribution via Randomized Return Decomposition

Reference 74

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:25.818920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T16:34:25.163198Z digest=sha256:58918222c6a8f58699ceb9115ca806c07cf98d21f68782d9a9e703e2687c0703

Observation 21ae2890-0204-44ba-b4bf-2b3cff27a916 · outbound

This paper cites High-Dimensional Continuous Control Using Generalized Advantage Estimation.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities High-Dimensional Continuous Control Using Generalized Advantage Estimation

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.170316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.170316Z digest=sha256:ab0220be2de0cd553ea9e64ac1bc0de51d6b653f6b918f7e85dcbc10a510d651

Observation c615db8a-b98d-4bb0-aa2a-419d1f96996b · outbound

This paper cites Spurious Rewards: Rethinking Training Signals in RLVR.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Spurious Rewards: Rethinking Training Signals in RLVR

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.176219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.176219Z digest=sha256:8d85a176976459c27ea5cc10affe59393db72f3a57901e8441419d0f1a9cac43

Observation 86484ea3-4055-4753-a933-a2e3a05de87c · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.179391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.179391Z digest=sha256:b9a2b7c65eafc67baa3481291a12db69425c4cd8a75d6346b61768a45523bd19

Observation 6f256eb6-64ed-4697-934f-42d9e1153fb3 · outbound

This paper cites Reviving The Classics: Active Reward Modeling in Large Language Model Alignment.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Reviving The Classics: Active Reward Modeling in Large Language Model Alignment

Reference 80

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:25.767096Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T16:34:25.182215Z digest=sha256:e4a78cdf4dd5fd69e991e47977a7c696e0e6aee185a8e706c85d41f5e6d4643d

Observation 08498943-cdf1-4c8e-a21a-b4efbf1bb866 · outbound

This paper cites Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.185554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.185554Z digest=sha256:2c106ad1a5e2db3eb736e2f0181ef1572773de8d7001f8cf3ac642e1cec802da

Observation b622793b-3d91-4a6e-b0db-24460636a79a · outbound

This paper cites When Life Gives You Lemons, Make Cherryade: Converting Feedback from Bad Responses into Good Labels.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities When Life Gives You Lemons, Make Cherryade: Converting Feedback from Bad Responses into Good Labels

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.188545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.188545Z digest=sha256:c84de8949be0e304da0fd4a3cdae2b6c976e354de76ad1d8b7ce5abefb6b6d02

Observation ae7730dd-9eb7-48e4-a4de-b85e157906e8 · outbound

This paper cites an unresolved cited work.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Unresolved cited work

Reference 83

Resolution
parse uncertain
no resolver link, observed 2026-08-06T16:34:25.192087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.192087Z digest=sha256:d2a740e634eae5b74eca1a669ab8a6657a79babad7f1c65f0f291aab70028822

Observation c36e4d87-d47b-44e8-8317-feb967e0fa88 · outbound

This paper cites Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.194886Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.194886Z digest=sha256:6a2fb866fdb2b691972196c3fea874be3884ca08ff0d847e8b0ccb3712fe0bec

Observation 129db947-a33a-4513-93e2-67f981934587 · outbound

This paper cites Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.197977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.197977Z digest=sha256:378b3d4df2c8b60df8f258d89a46e070665c909c4c4dce164cd706a6207472f1

Observation 6e9d55e6-b139-4cc8-a47c-3cd574ed1282 · outbound

This paper cites Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.201081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.201081Z digest=sha256:2897c64d4a6f942099ba1c426167ff46c0e45f50f22f4200194e59b041b8ece6

Observation 49f8f937-525f-4198-9dfc-d182860057d2 · outbound

This paper cites A Roadmap to Pluralistic Alignment.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Roadmap to Pluralistic Alignment

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.204086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.204086Z digest=sha256:c3291807e62be665f18abb8a0bae6199d58f4c92f6ca493f0627988e3d1412fd

Observation 299da6d6-f1b3-43da-9533-97f5226241fe · outbound

This paper cites Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.210425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.210425Z digest=sha256:ef124dd8e7693fd3a5020949fdbb976b8b0edaa2f01531a5e17fb42445ab0349

Observation 1b8a5cf1-704d-4ee7-9611-ac9b10123401 · outbound

This paper cites Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.213454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.213454Z digest=sha256:5018949a37bc1f715130c256b01ddfeb3feeb0daaa18dc95ff1da7e0739e480b

Observation 36944cbd-6b9a-4553-9207-488a235ed765 · outbound

This paper cites Learning to Repair: Repairing model output errors after deployment using a dynamic memory of feedback.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Learning to Repair: Repairing model output errors after deployment using a dynamic memory of feedback

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.220429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.220429Z digest=sha256:12151f5dc413b189bb2e4d5352c1abdd607ff532dd00cb381d219668aa7a19ee

Observation bbeeeba4-80c0-4693-9d85-79b85eef1422 · outbound

This paper cites DeepMind Control Suite.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DeepMind Control Suite

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.223363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.223363Z digest=sha256:0e82846dfa0305fee493bfcb5584cb8d6f2cc68d959f53cea93f20509bec2405

Observation 5c3029af-049b-429f-a029-722c15b9e226 · outbound

This paper cites Grpo: Generalized reinforcement preference optimization.arXiv preprint arXiv:2405.00000,.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Grpo: Generalized reinforcement preference optimization.arXiv preprint arXiv:2405.00000,

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.226345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.226345Z digest=sha256:2b0729467ff73185b60df5748406da19f7d016334d0aa9e4b1aa280855d033bc

Observation 2fef2af8-216f-45a4-9f61-02b0e6243bcd · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.230052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.230052Z digest=sha256:de1ac21d3a0e242e405b6d63cf4a59766a9d5ecbc7c1ea6ced1fe100c09f8a6a

Observation 83ad950e-a994-42d4-a596-dd77890634e7 · outbound

This paper cites Gram: A generative foundation reward model for reward generalization.arXiv preprint arXiv:2506.14175, 2025a.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Gram: A generative foundation reward model for reward generalization.arXiv preprint arXiv:2506.14175, 2025a

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.233479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.233479Z digest=sha256:48d5d3c5753c3d1bf47ac36a8505e7ee88fc224ec19446d64c84d4817d5240d9

Observation 02dac0dd-db99-4c97-ae6b-d9eee97d771c · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.236262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.236262Z digest=sha256:f67f6f9ee26c1e9444a2c136cb64a345f7459e9b23b60e176b766086cb8265d1

Observation f0519097-48ef-4274-8731-66dc94072c1e · outbound

This paper cites Reinforcement Learning for Reasoning in Large Language Models with One Training Example.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Reinforcement Learning for Reasoning in Large Language Models with One Training Example

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.239464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.239464Z digest=sha256:a857d33a2fabc46ec35d50e099bdcf4a29efb9c27cd0e0ecc8c7cb8f4b2c1808

Observation b81d8143-0d29-4284-9d02-6ba928991711 · outbound

This paper cites How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective

Reference 100

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:25.472318Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T16:34:25.246579Z digest=sha256:ef7a1437a3f79f6ea69cd4b01bc1bd89df600a4cb5162347868c4c23f329e4c8

Observation caa7a167-a786-40b8-ad11-8e33e6c466dd · outbound

This paper cites Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint

Reference 101

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.249776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.249776Z digest=sha256:9d17b7fa5966368a59bf635b16471f77b329afa306f8c93074b370061662d1d5

Observation 11c90913-72bb-4836-a257-2e2879251b27 · outbound

This paper cites A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce

Reference 102

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.253465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.253465Z digest=sha256:5c0e939490a589f59e8db5b09d467ec465e3250e4003cd141281dce42e485761

Observation 34aa152a-be09-43ba-852b-232695cee304 · outbound

This paper cites Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models

Reference 103

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.256725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.256725Z digest=sha256:20b5c72a8b32b4e429562aba3b6ad1994aab724d819a2db9c6dbc913039a16a6

Observation 5809d262-c85c-43f6-ae1f-2ecea71cf6bc · outbound

This paper cites Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study

Reference 104

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.260209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.260209Z digest=sha256:14316a97c96ebaab06b78c6ace97d2c297b2477370324d759b1e7d6b60da3f23

Observation 738a22bb-d8db-4848-92be-c26a1f7ba4ff · outbound

This paper cites Large Language Models as Optimizers.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Large Language Models as Optimizers

Reference 105

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.263190Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.263190Z digest=sha256:f1342698bd61f0a29fe9b160c36d8a6c6c123d0c946762b8750788ae602ee64c

Observation a357dcd6-bad0-41da-8319-1a491f2a2c77 · outbound

This paper cites Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL

Reference 106

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.266194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.266194Z digest=sha256:5292f4c6d96d686200de2a52e05f1cfb81d10d3688a011a4ea1a7747225f04e6

Observation b248e687-6a40-4976-a20b-c4b0a2463933 · outbound

This paper cites Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs

Reference 107

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.269350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.269350Z digest=sha256:9ba0e885cee8071966865614d9d97b7223bb30bfca077b63fa3e00b2d8fe010e

Observation ac69e7f0-10ed-4d9b-8ad0-9b06eba55910 · outbound

This paper cites Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Relative Preference Optimization: Enhancing LLM Alignment through Contrasting Responses across Identical and Diverse Prompts

Reference 108

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.272362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.272362Z digest=sha256:cca658977d9ab765a5a52f45c0e9487cdbf8a325094b5509faf0adecccddf7e9

Observation 0daaf2f3-714b-4697-b4c1-8ef1564e3f8b · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 109

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.276239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.276239Z digest=sha256:dac62591ad5738b3c36a24eb3cfadb0e2070e4626357ca3bde5d97a90b2784c0

Observation 26a849c7-7e62-4a1a-9237-5698fd209cb9 · outbound

This paper cites RRHF: Rank Responses to Align Language Models with Human Feedback without tears.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities RRHF: Rank Responses to Align Language Models with Human Feedback without tears

Reference 110

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.279111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.279111Z digest=sha256:259b55b66d537826cdff80a956591b127bab52622e9c9d6164d724f025aa9f65

Observation c79daecb-c563-4a67-b965-4f7e470b53a2 · outbound

This paper cites Diversifying AI: Towards Creative Chess with AlphaZero.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Diversifying AI: Towards Creative Chess with AlphaZero

Reference 111

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.282653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.282653Z digest=sha256:986aa18499ab3dedd83cb005750c168e107cf5856832a59f1cf5e5158a2aa8d8

Observation 1b131a45-5c49-4f61-b78d-06947941fe55 · outbound

This paper cites When scaling meets LLM finetuning: The effect of data, model and finetuning method.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities When scaling meets LLM finetuning: The effect of data, model and finetuning method

Reference 112

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.285823Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.285823Z digest=sha256:c21cbe9fe6937b9836d032469d008d860355bd16aab561eee3d201f974dce6b8

Observation 963c5887-8ece-4b8d-8c6c-f0a2e45def27 · outbound

This paper cites Generative Verifiers: Reward Modeling as Next-Token Prediction.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Generative Verifiers: Reward Modeling as Next-Token Prediction

Reference 113

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.288762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.288762Z digest=sha256:dc5905cfb88987405b44060bc6439e38c61c6df8b0f57c5b49c8d980cc498f29

Observation d3396fdf-285c-4f06-9ab9-8ce1b7348ab2 · outbound

This paper cites Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation

Reference 114

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.291921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.291921Z digest=sha256:512647a29ea6363a41ee0e258c758ffe9c15640438401de9c4b64572e2f57593

Observation 4730a3b9-3f73-48fe-bbaa-275bc9827592 · outbound

This paper cites Secrets of RLHF in Large Language Models Part I: PPO.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Secrets of RLHF in Large Language Models Part I: PPO

Reference 115

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.294914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.294914Z digest=sha256:6098474134449e51dbe02a158284998c59ebe46ea5e624ee1eeb47f13cc9eb6a

Observation 99c591d9-b88d-4fbb-b681-f880534ff6fc · outbound

This paper cites DPO Meets PPO: Reinforced Token Optimization for RLHF.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities DPO Meets PPO: Reinforced Token Optimization for RLHF

Reference 116

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.297970Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.297970Z digest=sha256:779fe062e132eed7b01eb0069a4b970f37a673f2a816fa9fb07e2842024f3255

Observation ccac6194-08ff-4523-a40f-e40eac577756 · outbound

This paper cites Least-to-Most Prompting Enables Complex Reasoning in Large Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Least-to-Most Prompting Enables Complex Reasoning in Large Language Models

Reference 117

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.301260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.301260Z digest=sha256:7e78f00311cbc3d2de987651c3db199570a2cceb60924d9c4867ffa76565ece5

Observation 90b10786-5de4-4378-88bc-07dde36cb0ba · outbound

This paper cites RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

Reference 1952

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:24.945869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:24.945869Z digest=sha256:8e95bbf8e5569c0d7e82870bfe2cf5c82429ef02ec47a365fc2d5353277a2bc6

Observation 3f63be04-b7ef-4d04-826a-b31d7e63bd06 · outbound

This paper cites Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models

Reference 1973

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.207451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.207451Z digest=sha256:59c4464dfccf8c7a4be896242c592067b022d0c1a5b1b09406e0f4fac4bb6c66

Observation 3889c48b-10e2-4ab4-bbfb-46d8a41f0f78 · outbound

This paper cites Retrieval Augmented Thought Process for Private Data Handling in Healthcare.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Retrieval Augmented Thought Process for Private Data Handling in Healthcare

Reference 1991

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.136743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.136743Z digest=sha256:377e7855a32fdf089b7d01a84816deea2308cbf980af4306116fa83322cd9c08

Observation f8c77f3b-3746-4371-abd6-e3bb2c761ef8 · outbound

This paper cites Style Over Substance: Evaluation Biases for Large Language Models.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Style Over Substance: Evaluation Biases for Large Language Models

Reference 1992

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.242829Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.242829Z digest=sha256:1204197293045f4bdc00024f391a14c1bc350c06c256f7820488e646120db68c

Pith citing papers

Observation 58ce233a-7689-4a88-977a-8ab27b2358d0 · inbound

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives cites this paper.

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-04T11:17:36.742733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T11:17:36.742733Z digest=sha256:7a83625011656cb86f8b80db0136aedf297f0e18fa4780b36bbf536b5c3b5932

Observation 2654dec6-ac02-4a04-9249-fd87fe4db4ce · inbound

The Alignment Flywheel: A Governance-Centric Hybrid MAS for Architecture-Agnostic Safety cites this paper.

The Alignment Flywheel: A Governance-Centric Hybrid MAS for Architecture-Agnostic Safety Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-15T19:06:30.621395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T19:05:15.708770Z digest=sha256:742926cee5a586e6666c214cd0763b7947c1882005a31e6f13ca264996b4fcfa

Observation 72c87fdd-80a0-4329-9873-91904335d9f2 · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities

Reference 188

Resolution
verified exact
arxiv_id, observed 2026-07-04T07:59:40.153902Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:c88a035a61210b060ebb65ba15121745a950e560ec0283545637a8e54e074fb7