Pith. sign in

Paper Citation Record · LEDGER

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

As of 23 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 9 inbound Pith citation observations for arXiv:2507.21931.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.21931 v1

Coverage vector

measured 58 of 58 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T12:17:54.087304Z

measured 67 of 67 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 9 of 9 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T14:55:56.722273Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T04:19:33.983480Z

Reference resolution

58 of 58 outbound references displayed

  • verified exact6
  • verified fuzzy6
  • unresolved45
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cd436bbb-8825-4501-b8b7-f5db942d9c04 · outbound

This paper cites online" 'onlinestring :=.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback online" 'onlinestring :=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.820835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.820835Z digest=sha256:72cfd8511a0d0d42255084d6bb59f82d56744c25711ef94386da6102f5257cc2

Observation 898f1862-0fd3-4dd8-aa93-459a74075cbe · outbound

This paper cites write newline.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.826146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.826146Z digest=sha256:e1826c1c7cb5c05323495308fc0fca3c7e65bc33956c3a79d8fb1b377fb91d21

Observation 5d1cb278-b2eb-41ec-84eb-347d2bb2759d · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.831713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.831713Z digest=sha256:86e485f92e2d341bb919c9d9617f1d98c0162d7257c324a10a8b186b495c4af6

Observation 103e03ea-5066-47f2-a743-bb3e04ec315f · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Constitutional AI: Harmlessness from AI Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.836605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.836605Z digest=sha256:36e1b796af207a1789cfb7ba0758800c1055456b2c0a1a33ecf0ba4f02d701ae

Observation b87270d0-8ae5-4356-a111-ecbc97cb7063 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.113630Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.842077Z digest=sha256:2bf85011915799494cb0bdb7c017a47ea774e9d568596ddf0caada5b37f91bf2

Observation 3bbc3fcd-2454-42d5-83a3-86301205b4fb · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.847563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.847563Z digest=sha256:8300de8d788ca8d0ceee8f127a3347e4a5a21733af0b5ad78061b643b095c0b5

Observation b9e01c82-0882-4d41-9d5d-7f8d951f6bf4 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.852515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.852515Z digest=sha256:78ad878ca9233ec5023cabd386fd6cd15f8da4ba0949d448de80ed6a438ee5b8

Observation c0dc7cd6-39cc-4876-ab86-db2a37ae961b · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 8

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.432406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.857460Z digest=sha256:9fe92cca00fe95ff401984bdc873eba167b818ddb6fa8240ade379c29e3c7147

Observation ed71b569-643b-4543-88cd-57a3c01ac363 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.088245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.862686Z digest=sha256:f7211906be58d62dfe6fa8a8eb763ff58eb0f1d16d4db7270b62ca1ab3e5bde0

Observation 8c077c2b-629d-401b-9c09-fee464e66b55 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.074237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.867059Z digest=sha256:5e2a83e79225e9c033b13be3064ae4e9e71259ebadc503f4120cf938acd544b8

Observation 184fa3dc-9100-46db-8a09-cf44577f28ff · outbound

This paper cites Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:55.060022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.871556Z digest=sha256:34ca47bddde63209da0588783ac1413eb7cdfb7967b37a56a1f63c39f7ff298e

Observation ef13e93f-ef6b-4205-a098-6de76c0b9c85 · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.876094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.876094Z digest=sha256:7dfa92469302bd12e4b8e960b029e26e0b5bea1c496d21123d52229b676d3cea

Observation 4a223979-1815-4589-afd9-50d12be8bbe5 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Training Verifiers to Solve Math Word Problems

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.880989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.880989Z digest=sha256:8e5d9bd9005e5b2396115a8465519783c82b7d3038242058d282f6101a1153ea

Observation af25b509-5705-434e-8bfc-5038d932b14f · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.885704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.885704Z digest=sha256:bb391187be909fffc718d7a32a32390980d5bf9af1f1c77c5525030d6c512561

Observation ecf33ae4-b3f1-4596-87c7-8277a295c5ae · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.890650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.890650Z digest=sha256:49ce0243456de53da7c1af33fc97b223f858d80bc4cb78a5f727806ea6512e7a

Observation 33048014-125a-43ab-99e2-e3c720b8ab88 · outbound

This paper cites Quantile Regression for Distributional Reward Models in RLHF.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Quantile Regression for Distributional Reward Models in RLHF

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.895202Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.895202Z digest=sha256:b9877c3cd89705f07fb924e35e60bae83d034734ea208dae9a0f79208109b3e6

Observation 65a6c262-66ef-40d4-a2c1-58753086e028 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.045249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.899825Z digest=sha256:6318cd0bfd7fec8ea1a1e8edd83806a02778d86dcb71266c4bc6f8dcb11789de

Observation 1d3cd083-fc4f-4586-bcaf-2e37104afeb7 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 18

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.351568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.904052Z digest=sha256:b9058fb1946eac9d86cc2c7aa87ea8fa25f1877806be4f483cc8c141060bacc8

Observation 2d9f3ea0-e767-4144-82ea-27d427b4b898 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 19

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.334249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.908585Z digest=sha256:ae1ce7a8dedeb7a7ed2e7dc13437c6fa0192d63324f1482c544d2fd22c325915

Observation a2726703-344f-4cee-92b3-d18b74a2efd5 · outbound

This paper cites Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.912913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.912913Z digest=sha256:01be7bdc5e89f9f4dd9e1064654b6d5b27e0a63fb8ec5de006474973daeae98b

Observation 8e4b5a15-b8c8-4ebb-af48-d535e3ef61c6 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 21

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.301436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.917564Z digest=sha256:62ac5b73e1aa7a84a37c201c6af9bb25b93f95361c68f4d0769abefaf13266b0

Observation 8b33bcec-5f80-4b65-8a12-45dc2f00570e · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.029029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.922177Z digest=sha256:b90a9bccf6d3b539781798b6d4839bdd0cc1b59b3851a0f09f91398fed6d924c

Observation 1a70b161-2ca9-48d1-b7b0-524b93f117c3 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.926526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.926526Z digest=sha256:92f6a73260fb349eea8c91ee110691230de0624479b50551959e26ca51e3fa64

Observation eec53b52-b622-4393-90a2-5a5b8cc340b1 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:55.012714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.930960Z digest=sha256:8a9e57dc34688c1d59b4237ac8e6ad3e12107c7c286f9aeb91d6764594480196

Observation 2332ff48-cbd4-4132-a0b9-16d7673924a5 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.996760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.935155Z digest=sha256:ed85238917ffc809b2d8bcebf107fdf7a1c3005d01d97da0f9c4062c41a1193d

Observation b3f475a8-3e21-4716-a4c6-e37faa252aaf · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.981811Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.939221Z digest=sha256:633a0c41b09a5300706563072beed6539471656478adb755e3d35586ed310fbc

Observation ddcc5375-fc42-4927-8101-504dfaeeccc0 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.966669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.944321Z digest=sha256:4d2699738e9338a7c356ccfaf99fbb899d63a514e464343e214fa86e7f70419c

Observation aed7f9e3-5650-4f7c-9cce-ec449f2a3c7f · outbound

This paper cites LLM Post-Training: A Deep Dive into Reasoning Large Language Models.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback LLM Post-Training: A Deep Dive into Reasoning Large Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.948795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.948795Z digest=sha256:91776b2c6ae0826883b12051bde1d883c437a0b5ad6869edb55b3d5ed51decfa

Observation 65508360-c5de-4996-9683-89ad4182cfa7 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.953322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.953322Z digest=sha256:7eb111f67d18c78105a6e90c35d5b01dab705829e3683c8c36fd8f5fc9d81e60

Observation 6305eda4-de57-41e8-8892-6d7d97443ecc · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback RewardBench: Evaluating Reward Models for Language Modeling

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.957953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.957953Z digest=sha256:b01187e1261bd5bbf79dd4c22dc6b9af366ec5a74f677516df1286ef4a78673f

Observation 78f6f9e4-e7eb-4c0d-b853-0b34620982c8 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 31

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.951308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.962726Z digest=sha256:022bbeee7dc3e77f41d5e2b155dbea699543ce6e0417a115efa53938114ccdd7

Observation 5c1ddf74-63ee-42a0-973b-49555015e06f · outbound

This paper cites Hashimoto.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Hashimoto

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.967178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.967178Z digest=sha256:844ac604e709692a118178f1a7213c694a24b07e3881071315600e8670d14990

Observation 73bda382-13c6-4c90-8b42-9ab188b7af6c · outbound

This paper cites Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.971631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.971631Z digest=sha256:340ffac4123f9fe0294fbe30869304dea1f9cf3b9ecf8776d6bc2ca9981e0a92

Observation 1fdf2191-ddb2-476a-95fe-3bbacccb8a8f · outbound

This paper cites Machado and Michael Bowling.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Machado and Michael Bowling

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.926167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.976351Z digest=sha256:2bcd6ada22347f4613c7da1b816f6bf46f9862756e4ef0f6539b3c63f9106d58

Observation 5ae024b5-e315-41e5-a8e8-1f749576accd · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.908405Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.980788Z digest=sha256:b65c4ccb0900b2cf12baef8f68590028cdd76a42c5e9f971fb8aed52f05154e3

Observation 1607dbc4-e6fb-4267-ae5a-aa5a061a0536 · outbound

This paper cites GPT-4 Technical Report.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback GPT-4 Technical Report

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.985221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.985221Z digest=sha256:a6ae5442b63a20fb0638d1d7756d26707a8e33108474a003add8fbab6641e321

Observation 920a9cf9-af70-4a6e-b69b-31596cf5a4c4 · outbound

This paper cites OpenAI o1 System Card.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback OpenAI o1 System Card

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:53.989752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:53.989752Z digest=sha256:8404821edae82d0da6a748348c36d625fb2c9a2a3b7a1f7220c77e7591bc34e2

Observation 7c5b48e5-f810-4442-8ae8-a20d5599757a · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 38

Resolution
metadata mismatch
raw_fallback, observed 2026-08-06T12:17:54.674179Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.994478Z digest=sha256:74b09362b570f0d2ddc8112fc4f70618b81a4eb539f50d7363e17732d853a5ad

Observation 2ccb806d-4f12-4181-81e4-6828331e75dc · outbound

This paper cites Christiano, Jan Leike, and Ryan Lowe.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Christiano, Jan Leike, and Ryan Lowe

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.892689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:53.999449Z digest=sha256:95a1c6fc179acc0b63b4caf71d923cc0f2bc4e48efe2f34e99911a37bd3392e0

Observation 1eb2c9ef-dce7-4f9b-9ba2-0212cadc9381 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 40

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.245322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.003905Z digest=sha256:697d82214aa520446a25b66516d906b3b8929b307801653c65baba0ac7900bae

Observation aba441ef-11c8-42b4-8b56-9b462885af30 · outbound

This paper cites Manning, Stefano Ermon, and Chelsea Finn.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Manning, Stefano Ermon, and Chelsea Finn

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.876404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.008412Z digest=sha256:0dcaa1cdefea39af76dd204b162de3f80b981dc381ed9ba2b2e0f59e0f12552d

Observation 974b5b5b-e63f-4abf-ab67-11cfec510a20 · outbound

This paper cites Gemma 2: Improving Open Language Models at a Practical Size.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Gemma 2: Improving Open Language Models at a Practical Size

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.012877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.012877Z digest=sha256:bd2bab717d673fb2a8fff7aa38ac97cc3d427aa9646b93e3365d0e3b1462b105

Observation 18261e3f-3215-4bd2-af58-e902cb91da09 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.017693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.017693Z digest=sha256:8716bc2e925f24f1acc5fda7ed7e80d2997240b7edc00debb703413d75636c1f

Observation f36d5dd8-6196-4ed5-b5c4-6a1bdbbdee99 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.860761Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.022190Z digest=sha256:4efa853adab686d8a2b5bca1da87b87760e3d0afe14108b1341a762ca2cc7f30

Observation 01efa139-d2e5-42cb-b09f-6e42f4c5f689 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Proximal Policy Optimization Algorithms

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.026626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.026626Z digest=sha256:6a8cd444488ddbf869457c03c74a714749e06fe596ccd92bde26627902f98b7d

Observation f88fab62-6c2e-46d4-ae45-ded60763dde7 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.031390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.031390Z digest=sha256:535a7fc2d97c83cd3296a81166c9a4ef83890e7678c052bd626f7292ba1780e7

Observation 9c7807fa-509c-4bd1-bfec-804faf362c59 · outbound

This paper cites Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.036222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.036222Z digest=sha256:e0d8ad4d08d3b635c8c4245ceb8df4d44afe2028c01c8f9af9983582751a4f3c

Observation 6cd3f862-7b50-4f69-941e-1375d2f0cf7c · outbound

This paper cites Sutton, David McAllester, Satinder Singh, and Yishay Mansour.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Sutton, David McAllester, Satinder Singh, and Yishay Mansour

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.845656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.041302Z digest=sha256:4271c0b3988021408faec7fa0c9b872a3fff41d38fafff5d4bb36c23c7b53a21

Observation 2f25b65c-16b8-4d5d-8705-135b06736807 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.045473Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.045473Z digest=sha256:c5031e0390854042523aa662a6017cdfa358c47192d030145e3926f38940eed1

Observation c24efdf8-b312-413b-b5a7-f1295e8b7b8b · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.050028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.050028Z digest=sha256:8fbc12c5f4228d0f53348437e2a11462ac1fd2df7d2c6045ee9a8258c5513d3b

Observation 01e7a4b5-375c-4141-aff7-57e20d96e081 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.055241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.055241Z digest=sha256:c8c5b2237b3cde26040e309fa9cc8b260725bab76b2c405ff007ef29331b32de

Observation 4f958512-d0ce-4590-af80-d1f24f2a005b · outbound

This paper cites Chain-of-Thought Reasoning Without Prompting.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Chain-of-Thought Reasoning Without Prompting

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.059645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.059645Z digest=sha256:d9ea57869b6524446ffa12c79749c43da9e7c3865f0ad3dc9a0d2845cfa2f7dc

Observation c202611a-70b7-41d9-a323-e45ed797a153 · outbound

This paper cites Le, and Denny Zhou.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Le, and Denny Zhou

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T12:17:54.819137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.064389Z digest=sha256:74b6d1069972fc5595fcf5348240bc35f559ac573bb55394ead047862a34cab0

Observation 8a5381e1-c69b-4663-b51e-16398997157b · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 54

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.804267Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.068691Z digest=sha256:f903b32a620059a89d8fff54e4e12cba7e9f04b84dbfe7cf8b19d952dc30cbee

Observation 76501c6b-b7e7-4d15-915b-42e6a289f892 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T12:17:54.073482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T12:17:54.073482Z digest=sha256:2cfe83e36163b6ae6effacd274389937e69a0589849499ed15918f219ef2ed6a

Observation 1662f26f-1a90-4a84-9c2c-c688b711e9d9 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 56

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.789300Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.078344Z digest=sha256:c6477de9a110cb0409094d8ac3ffffa84b5f00248d95e2d94301baf491a1ebd7

Observation 5eb45b58-9c32-497c-ba3d-b6baeb420f04 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 57

Resolution
unresolved
raw_fallback, observed 2026-08-06T12:17:54.773581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.082905Z digest=sha256:43f5d42cdf3e14cac870220f312b4178f0552e6a0466d96f22b2c76a1c5c6b53

Observation a3b4f10c-1dea-43e8-a5a5-113697227e16 · outbound

This paper cites an unresolved cited work.

Post-Training Large Language Models via Reinforcement Learning from Self-Feedback Unresolved cited work

Reference 58

Resolution
verified exact
doi, observed 2026-08-06T12:17:54.125412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-08-06T12:17:54.087304Z digest=sha256:7022d7f90f16fd00ced4e5ef2fe054d01875d00812afe872fb31902c1ad55ac1

Pith citing papers

Observation 8a3bf153-0a8b-470d-b7ea-f08e298d5ef3 · inbound

Self-Rewarding Vision-Language Model via Reasoning Decomposition cites this paper.

Self-Rewarding Vision-Language Model via Reasoning Decomposition Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-18T21:06:50.793278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-18T21:03:31.606674Z digest=sha256:aab1cb22b79ab2fea252b9ef552e7ba5419b28847035567480db9b16c927f78d

Observation 401901ae-2ce4-4b39-bd17-2493aae8662b · inbound

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle cites this paper.

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 162

Resolution
unresolved
no resolver link, observed 2026-08-04T16:07:41.298276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T16:07:41.298276Z digest=sha256:a3b6f6d141b2761e967f607279386e9fba2670dc530acad4b142179ebcd50e47

Observation a143f6f2-8730-4f1c-980f-16c0a9ca5807 · inbound

Towards AI epidemiology: a measurement standardisation framework for prospective risk detection cites this paper.

Towards AI epidemiology: a measurement standardisation framework for prospective risk detection Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-03T16:33:13.577415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:33:13.577415Z digest=sha256:f9c15c9ecc2699eee6fa65ae436a668680c3f2c1dc2758fb8516ff78d8440ad8

Observation 6b42ea3d-cb52-4bb2-a765-04e608af4a2d · inbound

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning cites this paper.

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-03T06:52:55.624948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T06:52:55.624948Z digest=sha256:95531ff7d21858323ec4e265924571da38c0e55cf384e637f1b25b9c0fc9edc8

Observation bf2287c3-e21b-4c88-ab6d-558d14d9c0ee · inbound

Trust Region On-Policy Distillation cites this paper.

Trust Region On-Policy Distillation Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 39

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T20:56:13.491818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-06-28T17:38:50.313305Z digest=sha256:98ab013a848777dab3751e47c5e2411f719fbe18529277adbacf23b599fda7d3

Observation c285e10a-1373-4563-9ecf-c71b9d11a2b8 · inbound

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling cites this paper.

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 38

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T06:06:40.824202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-06-28T07:45:43.320339Z digest=sha256:1d306e3e4162187cace62e8868109b7e424c2a4a5cb1574dbccb0a4f2e18b983

Observation 84976034-2286-4be4-9490-3c0176afdddb · inbound

When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study cites this paper.

When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-07-04T04:19:33.985873Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T17:07:21.486960Z digest=sha256:2472ad3494d9a63b2400cd3208c13e2bd9d34fd8fa327b2f3b174c006ab49ad8

Observation a7deee87-0de1-4688-b5db-17d1c6785f06 · inbound

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs cites this paper.

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 102

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T10:35:42.088576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-07-01T05:22:38.232552Z digest=sha256:a78c6c9dbc62de5aacbf4401f2e1c540dece6385dea81614fa746f8815906fcf

Observation 4ee668c2-3338-4fac-9708-332017d83d63 · inbound

LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs cites this paper.

LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs Post-Training Large Language Models via Reinforcement Learning from Self-Feedback

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-15T14:55:56.722273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T14:55:56.722273Z digest=sha256:a94babc77c2e2db51433a4b30450a3ddb67e0c34464bcbac0287e925fc10455e