Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T12:17:54.087304Z
Paper Citation Record · LEDGER
As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 8 inbound Pith citation observations for arXiv:2507.21931.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T12:17:54.087304Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-04T16:07:41.298276Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-04T04:19:33.983480Z
58 of 58 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation cd436bbb-8825-4501-b8b7-f5db942d9c04 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback online" 'onlinestring :=
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 898f1862-0fd3-4dd8-aa93-459a74075cbe · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback write newline
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5d1cb278-b2eb-41ec-84eb-347d2bb2759d · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 103e03ea-5066-47f2-a743-bb3e04ec315f · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Constitutional AI: Harmlessness from AI Feedback
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b87270d0-8ae5-4356-a111-ecbc97cb7063 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 3bbc3fcd-2454-42d5-83a3-86301205b4fb · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b9e01c82-0882-4d41-9d5d-7f8d951f6bf4 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c0dc7cd6-39cc-4876-ab86-db2a37ae961b · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation ed71b569-643b-4543-88cd-57a3c01ac363 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 9
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 8c077c2b-629d-401b-9c09-fee464e66b55 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 184fa3dc-9100-46db-8a09-cf44577f28ff · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V
Reference 11
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation ef13e93f-ef6b-4205-a098-6de76c0b9c85 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4a223979-1815-4589-afd9-50d12be8bbe5 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Training Verifiers to Solve Math Word Problems
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation af25b509-5705-434e-8bfc-5038d932b14f · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ecf33ae4-b3f1-4596-87c7-8277a295c5ae · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 33048014-125a-43ab-99e2-e3c720b8ab88 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Quantile Regression for Distributional Reward Models in RLHF
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 65a6c262-66ef-40d4-a2c1-58753086e028 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 1d3cd083-fc4f-4586-bcaf-2e37104afeb7 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 2d9f3ea0-e767-4144-82ea-27d427b4b898 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 19
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation a2726703-344f-4cee-92b3-d18b74a2efd5 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8e4b5a15-b8c8-4ebb-af48-d535e3ef61c6 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 21
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 8b33bcec-5f80-4b65-8a12-45dc2f00570e · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 22
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 1a70b161-2ca9-48d1-b7b0-524b93f117c3 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation eec53b52-b622-4393-90a2-5a5b8cc340b1 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 24
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 2332ff48-cbd4-4132-a0b9-16d7673924a5 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation b3f475a8-3e21-4716-a4c6-e37faa252aaf · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 26
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation ddcc5375-fc42-4927-8101-504dfaeeccc0 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 27
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation aed7f9e3-5650-4f7c-9cce-ec449f2a3c7f · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback LLM Post-Training: A Deep Dive into Reasoning Large Language Models
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 65508360-c5de-4996-9683-89ad4182cfa7 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Tulu 3: Pushing Frontiers in Open Language Model Post-Training
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6305eda4-de57-41e8-8892-6d7d97443ecc · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback RewardBench: Evaluating Reward Models for Language Modeling
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 78f6f9e4-e7eb-4c0d-b853-0b34620982c8 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 5c1ddf74-63ee-42a0-973b-49555015e06f · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Hashimoto
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 73bda382-13c6-4c90-8b42-9ab188b7af6c · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1fdf2191-ddb2-476a-95fe-3bbacccb8a8f · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Machado and Michael Bowling
Reference 34
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 5ae024b5-e315-41e5-a8e8-1f749576accd · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 1607dbc4-e6fb-4267-ae5a-aa5a061a0536 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback GPT-4 Technical Report
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 920a9cf9-af70-4a6e-b69b-31596cf5a4c4 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback OpenAI o1 System Card
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7c5b48e5-f810-4442-8ae8-a20d5599757a · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 38
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 2ccb806d-4f12-4181-81e4-6828331e75dc · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Christiano, Jan Leike, and Ryan Lowe
Reference 39
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 1eb2c9ef-dce7-4f9b-9ba2-0212cadc9381 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 40
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation aba441ef-11c8-42b4-8b56-9b462885af30 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Manning, Stefano Ermon, and Chelsea Finn
Reference 41
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 974b5b5b-e63f-4abf-ab67-11cfec510a20 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Gemma 2: Improving Open Language Models at a Practical Size
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 18261e3f-3215-4bd2-af58-e902cb91da09 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f36d5dd8-6196-4ed5-b5c4-6a1bdbbdee99 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 44
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 01efa139-d2e5-42cb-b09f-6e42f4c5f689 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Proximal Policy Optimization Algorithms
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f88fab62-6c2e-46d4-ae45-ded60763dde7 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9c7807fa-509c-4bd1-bfec-804faf362c59 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6cd3f862-7b50-4f69-941e-1375d2f0cf7c · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Sutton, David McAllester, Satinder Singh, and Yishay Mansour
Reference 48
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 2f25b65c-16b8-4d5d-8705-135b06736807 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c24efdf8-b312-413b-b5a7-f1295e8b7b8b · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 01e7a4b5-375c-4141-aff7-57e20d96e081 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 51
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4f958512-d0ce-4590-af80-d1f24f2a005b · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Chain-of-Thought Reasoning Without Prompting
Reference 52
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c202611a-70b7-41d9-a323-e45ed797a153 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Le, and Denny Zhou
Reference 53
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 8a5381e1-c69b-4663-b51e-16398997157b · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 54
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 76501c6b-b7e7-4d15-915b-42e6a289f892 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 55
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1662f26f-1a90-4a84-9c2c-c688b711e9d9 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 56
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 5eb45b58-9c32-497c-ba3d-b6baeb420f04 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 57
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation a3b4f10c-1dea-43e8-a5a5-113697227e16 · outbound
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work
Reference 58
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 8a3bf153-0a8b-470d-b7ea-f08e298d5ef3 · inbound
Self-Rewarding Vision-Language Model via Reasoning Decomposition Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
Reference 20
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 401901ae-2ce4-4b39-bd17-2493aae8662b · inbound
Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
Reference 162
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a143f6f2-8730-4f1c-980f-16c0a9ca5807 · inbound
Towards AI epidemiology: a measurement standardisation framework for prospective risk detection Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
Reference 97
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6b42ea3d-cb52-4bb2-a765-04e608af4a2d · inbound
From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bf2287c3-e21b-4c88-ab6d-558d14d9c0ee · inbound
Trust Region On-Policy Distillation Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
Reference 39
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation c285e10a-1373-4563-9ecf-c71b9d11a2b8 · inbound
GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
Reference 38
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 84976034-2286-4be4-9490-3c0176afdddb · inbound
When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
Reference 12
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation a7deee87-0de1-4688-b5db-17d1c6785f06 · inbound
Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
Reference 102
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.