{"as_of":"2026-08-08T14:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9cdb56250a2ee396c06dda01cb33d32ca68f7109f15b5ef478463c04bf4fd3eb","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:17:54.087304Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:07:41.298276Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:19:33.983480Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":"2507.21931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-07-04T04:19:33.983480Z","title":"Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":"ed3250d2-ce0c-4199-b1c6-e19654cca2e2","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:ede0ceb13fb9b08eef797f73a5d947321ae0bccc08001d640ad41f0dcea0e3cd","observation_id":"8a3bf153-0a8b-470d-b7ea-f08e298d5ef3","resolution":{"observed_at":"2026-05-18T21:06:50.793278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-08-04T16:07:41.298276Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":162,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:41.298276Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:2b58d244eb8bd8c563075d844015c44ec44e8d574797911d9636db1615093b8c","observation_id":"401901ae-2ce4-4b39-bd17-2493aae8662b","resolution":{"observed_at":"2026-08-04T16:07:41.298276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-08-03T16:33:13.577415Z","title":"Science 193(4253):592–595 https://doi.org/10.1126/science.959820","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2512.15783","last_updated":"2026-07-20T11:40:43Z","snapshot_observed_at":"2026-08-06T22:03:12.977999Z","submitted_at":"2025-12-15T11:29:05Z","title":"Towards AI epidemiology: a measurement standardisation framework for prospective risk detection","version":4},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-03T16:33:13.577415Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2512.15783"},"observation_digest":"sha256:62dc9a92a6168ada0ec3d399467379134b38bc5e611d82948009c92de4f83c20","observation_id":"a143f6f2-8730-4f1c-980f-16c0a9ca5807","resolution":{"observed_at":"2026-08-03T16:33:13.577415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-08-03T06:52:55.624948Z","title":"M., Lin, H.-c., and Ga s i \\'c , M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-08T01:37:36.546626Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:55.624948Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:73944ba221fee8c17222784c8696a05dc330ab109869745b2c81710b80b07fc4","observation_id":"6b42ea3d-cb52-4bb2-a765-04e608af4a2d","resolution":{"observed_at":"2026-08-03T06:52:55.624948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":"2507.21931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-07-04T04:19:33.983480Z","title":"Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":"ed3250d2-ce0c-4199-b1c6-e19654cca2e2","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:1c64c813deecfb91f51c210a5198fb355066ac5efaa20bb3786121737c639cf5","observation_id":"bf2287c3-e21b-4c88-ab6d-558d14d9c0ee","resolution":{"observed_at":"2026-07-01T20:56:13.491818Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":"2507.21931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-07-04T04:19:33.983480Z","title":"Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":"ed3250d2-ce0c-4199-b1c6-e19654cca2e2","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:8c69306b08841f99e603b4c3277f3750e99a57307efdf855c16329f3b72467e1","observation_id":"c285e10a-1373-4563-9ecf-c71b9d11a2b8","resolution":{"observed_at":"2026-07-02T06:06:40.824202Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":"2507.21931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-07-04T04:19:33.983480Z","title":"Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":"ed3250d2-ce0c-4199-b1c6-e19654cca2e2","year":2025},"citing_paper":{"arxiv_id":"2606.20881","last_updated":"2026-06-18T19:15:50Z","snapshot_observed_at":"2026-08-07T07:30:08.874288Z","submitted_at":"2026-06-18T19:15:50Z","title":"When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T17:07:21.486960Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2606.20881"},"observation_digest":"sha256:9ad54fed8f42f2b889d36c7cd8edcd570441a0a957ec3f3821721d37bcbd0e39","observation_id":"84976034-2286-4be4-9490-3c0176afdddb","resolution":{"observed_at":"2026-07-04T04:19:33.985873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":"2507.21931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-07-04T04:19:33.983480Z","title":"Ke Wang, Junting Pan, Weikang Shi, Zimu Lu, Mingjie Zhan, and Hongsheng Li","venue":null,"work_id":"ed3250d2-ce0c-4199-b1c6-e19654cca2e2","year":2025},"citing_paper":{"arxiv_id":"2606.32032","last_updated":"2026-06-30T17:56:01Z","snapshot_observed_at":"2026-07-07T00:05:41.920778Z","submitted_at":"2026-06-30T17:56:01Z","title":"Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-07-01T05:22:38.232552Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2606.32032"},"observation_digest":"sha256:6ed439da1c1300c563276023db941d06179bc14e8e10d351d0cabc0e87a7a8e0","observation_id":"a7deee87-0de1-4688-b5db-17d1c6785f06","resolution":{"observed_at":"2026-07-01T10:35:42.088576Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21931/citation-record","integrity":"/paper/2507.21931/integrity","json":"/paper/2507.21931/citation-record.json","paper":"/paper/2507.21931"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.820835Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.820835Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:aa25e363d500a341c3703188c031ad13535d7decdcc80cb233187daab9ce9364","observation_id":"cd436bbb-8825-4501-b8b7-f5db942d9c04","resolution":{"observed_at":"2026-08-06T12:17:53.820835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.826146Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.826146Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:3f6e899afeb62c8f2e8e90efc9a14b08f0199db344c769ad3e4b01e96a4b890f","observation_id":"898f1862-0fd3-4dd8-aa93-459a74075cbe","resolution":{"observed_at":"2026-08-06T12:17:53.826146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.831713Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.831713Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:432d2f099f27b705a1c89f2f2b3a5cb6de9cf7e04797c491863d5b85107f5885","observation_id":"5d1cb278-b2eb-41ec-84eb-347d2bb2759d","resolution":{"observed_at":"2026-08-06T12:17:53.831713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T12:17:53.836605Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.836605Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:5c52ed630c8a05f38ee48a9611bddfe968bdb22a16f41aa77715a85057eba8f6","observation_id":"103e03ea-5066-47f2-a743-bb3e04ec315f","resolution":{"observed_at":"2026-08-06T12:17:53.836605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.108517Z","title":null,"venue":null,"work_id":"737795e6-9091-4791-b210-c37dcc75d87c","year":2013},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.842077Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:e86d9a26d84fc4e33bf246bfbc7515b52f46296670a821c3ee22bf41897733be","observation_id":"b87270d0-8ae5-4356-a111-ecbc97cb7063","resolution":{"observed_at":"2026-08-06T12:17:55.113630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.847563Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.847563Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:5369008bf3d13abc7c34b8813f7739384035ef259a170a10b4d979b6a6aaf387","observation_id":"3bbc3fcd-2454-42d5-83a3-86301205b4fb","resolution":{"observed_at":"2026-08-06T12:17:53.847563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.852515Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.852515Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:344c8a80a93397bac7db75164cbecd0fd82a4051114168a830713cc563297814","observation_id":"b9e01c82-0882-4d41-9d5d-7f8d951f6bf4","resolution":{"observed_at":"2026-08-06T12:17:53.852515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2019-1355","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.427517Z","title":null,"venue":null,"work_id":"122602b1-3697-4c7e-903a-1987c206418c","year":2019},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.857460Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:192611a4088c92d8258852dc2939025c3d1db81f12f0548a3ed9c13ba5e35fed","observation_id":"c0dc7cd6-39cc-4876-ab86-db2a37ae961b","resolution":{"observed_at":"2026-08-06T12:17:54.432406Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.083980Z","title":null,"venue":null,"work_id":"f9db3169-9627-463c-ac6a-32df01ace885","year":2004},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.862686Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:1be009a477490515723338e3643dcb097cff73648ecf45ba6d866935f31c6e98","observation_id":"ed71b569-643b-4543-88cd-57a3c01ac363","resolution":{"observed_at":"2026-08-06T12:17:55.088245Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.069799Z","title":null,"venue":null,"work_id":"083ca879-e2e0-4492-98e8-bd3a132b2007","year":2017},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.867059Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:b3fab7356102df9555a6f8da3e31fba4d8f9683b2cd4fdee1e24806118e9cbfd","observation_id":"8c077c2b-629d-401b-9c09-fee464e66b55","resolution":{"observed_at":"2026-08-06T12:17:55.074237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.055274Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":"600151d3-57bc-492c-a5eb-61cea781fb7c","year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.871556Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:024b62f77439a961d4762127da0169fa3c959e81587fb790fdc654041b43b2e9","observation_id":"184fa3dc-9100-46db-8a09-cf44577f28ff","resolution":{"observed_at":"2026-08-06T12:17:55.060022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T12:17:53.876094Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.876094Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:e711741bcb359eb1d5495f74489c7b7081ec6b9e990c5bbdf22fa0fd01298ca6","observation_id":"ef13e93f-ef6b-4205-a098-6de76c0b9c85","resolution":{"observed_at":"2026-08-06T12:17:53.876094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T12:17:53.880989Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.880989Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:9aad3b406570247d1a77555658f59021adc4ee220460e95e909a48583f9cb107","observation_id":"4a223979-1815-4589-afd9-50d12be8bbe5","resolution":{"observed_at":"2026-08-06T12:17:53.880989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T12:17:53.885704Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.885704Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:79bb51f6f283ef8012c0c4d9b0cb40416d4dd9cbfa4f98c2185f94c5b624b1bb","observation_id":"af25b509-5705-434e-8bfc-5038d932b14f","resolution":{"observed_at":"2026-08-06T12:17:53.885704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T12:17:53.890650Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.890650Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:15b167df74e40452d61968d811b265f4cbe8d0aa308c36112e98fe9e8e2069af","observation_id":"ecf33ae4-b3f1-4596-87c7-8277a295c5ae","resolution":{"observed_at":"2026-08-06T12:17:53.890650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10164","last_updated":"2024-09-16T10:54:04Z","snapshot_observed_at":"2026-07-06T19:15:56.947205Z","submitted_at":"2024-09-16T10:54:04Z","title":"Quantile Regression for Distributional Reward Models in RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10164","snapshot_observed_at":"2026-08-06T12:17:53.895202Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.895202Z"},"links":{"cited_paper":"/paper/2409.10164","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:d9e28896274e7397afa2950a04884bad0797b78714d45804695eea15e242a7e7","observation_id":"33048014-125a-43ab-99e2-e3c720b8ab88","resolution":{"observed_at":"2026-08-06T12:17:53.895202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.040326Z","title":null,"venue":null,"work_id":"36f5a5e6-3425-4f68-a2a2-a482f0ce0b2d","year":2019},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.899825Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:80c25ba2567a216f5ef54c3915008961b36e3651b205047aa2fac8db57fdb561","observation_id":"65a6c262-66ef-40d4-a2c1-58753086e028","resolution":{"observed_at":"2026-08-06T12:17:55.045249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.acl-long.558","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.346009Z","title":null,"venue":null,"work_id":"f3610f58-c86f-4030-8682-090284f0152b","year":2021},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.904052Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:2079b74baacec9451903ba94e465f17f463fa799684082a970f1e856197cdc64","observation_id":"1d3cd083-fc4f-4586-bcaf-2e37104afeb7","resolution":{"observed_at":"2026-08-06T12:17:54.351568Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.sigdial-1.4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.329354Z","title":null,"venue":null,"work_id":"52de4a12-1630-4b90-b091-1c229f270163","year":2020},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.908585Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:29f0a77b1038daa84a2771a0e6b83b913574969c405f0f9a4b05199e33fc1a7a","observation_id":"2d9f3ea0-e767-4144-82ea-27d427b4b898","resolution":{"observed_at":"2026-08-06T12:17:54.334249Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02902","last_updated":"2025-04-03T04:39:54Z","snapshot_observed_at":"2026-08-07T16:12:37.144625Z","submitted_at":"2025-04-03T04:39:54Z","title":"Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02902","snapshot_observed_at":"2026-08-06T12:17:53.912913Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.912913Z"},"links":{"cited_paper":"/paper/2504.02902","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:c7613b6443c1403016a9f2abb8eb1b9caa37a3c3cd987b44bfe65f12794eaaf5","observation_id":"a2726703-344f-4cee-92b3-d18b74a2efd5","resolution":{"observed_at":"2026-08-06T12:17:53.912913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.570","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.296702Z","title":null,"venue":null,"work_id":"6bfe1022-35c6-4123-a582-1f1a186640af","year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.917564Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:8236d89cc69488f785ef91922b457c0e4155d609518230fe2cc2f4f0fdf6bf37","observation_id":"8e4b5a15-b8c8-4ebb-af48-d535e3ef61c6","resolution":{"observed_at":"2026-08-06T12:17:54.301436Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.023956Z","title":null,"venue":null,"work_id":"a14571ea-6970-409a-a8b6-24af62212c37","year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.922177Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:8321799babdcaa24180c3695fb4eb473bc9d6e88bce78be325d6dbe45404a5ce","observation_id":"8b33bcec-5f80-4b65-8a12-45dc2f00570e","resolution":{"observed_at":"2026-08-06T12:17:55.029029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.926526Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.926526Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:32ca82dd039aa08d8352c3aa2b8bf2a3ff085835e5087fdede265eb66250d0fc","observation_id":"1a70b161-2ca9-48d1-b7b0-524b93f117c3","resolution":{"observed_at":"2026-08-06T12:17:53.926526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:55.007511Z","title":null,"venue":null,"work_id":"cecd1997-c9c3-4c0d-b3ff-889f24c2a3df","year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.930960Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:c252555e76669289d8a0248190e0a2dffe758b759580e1e74b9723280ed6ec31","observation_id":"eec53b52-b622-4393-90a2-5a5b8cc340b1","resolution":{"observed_at":"2026-08-06T12:17:55.012714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.992037Z","title":null,"venue":null,"work_id":"f6bf51cd-7068-4416-a830-6bb2a1335eed","year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.935155Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:7653508ca96f071f3ff2c8d8777b94da8c2ae4e5f077559410dafe3a552c0407","observation_id":"2332ff48-cbd4-4132-a0b9-16d7673924a5","resolution":{"observed_at":"2026-08-06T12:17:54.996760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.977260Z","title":null,"venue":null,"work_id":"64f3adb1-9703-4818-84ee-565eb92c4083","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.939221Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:f64db07dd65f3b3b984c226bdb1eee1035868734553f4bc22763c17d9d530690","observation_id":"b3f475a8-3e21-4716-a4c6-e37faa252aaf","resolution":{"observed_at":"2026-08-06T12:17:54.981811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.962040Z","title":null,"venue":null,"work_id":"3ec56bdc-638f-4581-9884-c7991cb9cb87","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.944321Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:ae463ff6cfa515f04def8198362cbb920ce0569c29187380e81f20f903f80298","observation_id":"ddcc5375-fc42-4927-8101-504dfaeeccc0","resolution":{"observed_at":"2026-08-06T12:17:54.966669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21321","last_updated":"2025-03-24T09:34:38Z","snapshot_observed_at":"2026-08-07T17:38:55.347235Z","submitted_at":"2025-02-28T18:59:54Z","title":"LLM Post-Training: A Deep Dive into Reasoning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21321","snapshot_observed_at":"2026-08-06T12:17:53.948795Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.948795Z"},"links":{"cited_paper":"/paper/2502.21321","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:efaae60f8b6dd38d741a0b139a48bc8efadcc2629ac98e2cdfa4a2187889e8d4","observation_id":"aed7f9e3-5650-4f7c-9cce-ec449f2a3c7f","resolution":{"observed_at":"2026-08-06T12:17:53.948795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T12:17:53.953322Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.953322Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:fa32fc91632a2ab3b639af8cbcadb23eba9e8251448f994499c3829a3001a5e4","observation_id":"65508360-c5de-4996-9683-89ad4182cfa7","resolution":{"observed_at":"2026-08-06T12:17:53.953322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-06T12:17:53.957953Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.957953Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:50c6694e55bde8527e81d69858f8613d7cd908aeffa611d6a1d38cf75ca12e34","observation_id":"6305eda4-de57-41e8-8892-6d7d97443ecc","resolution":{"observed_at":"2026-08-06T12:17:53.957953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.946780Z","title":null,"venue":null,"work_id":"b0d29bd4-5a68-4dcc-83ca-7b655468bc18","year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.962726Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:caf77e889d41658f2bcea16a607109ee65f2c93d640c83177f5be4d77faf2972","observation_id":"78f6f9e4-e7eb-4c0d-b853-0b34620982c8","resolution":{"observed_at":"2026-08-06T12:17:54.951308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:53.967178Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.967178Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:4f3214d3c9fce9dd672beb614bc57ecb7752ecda7275b0b1b368161dbdd36646","observation_id":"5c1ddf74-63ee-42a0-973b-49555015e06f","resolution":{"observed_at":"2026-08-06T12:17:53.967178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00847","last_updated":"2025-02-12T03:34:29Z","snapshot_observed_at":"2026-07-06T19:25:23.988463Z","submitted_at":"2024-10-01T16:29:59Z","title":"Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00847","snapshot_observed_at":"2026-08-06T12:17:53.971631Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.971631Z"},"links":{"cited_paper":"/paper/2410.00847","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:30b5ac5fca978b3cc60714535eb1afed95d9d568c7889bcb26a47aa865b3dd19","observation_id":"73bda382-13c6-4c90-8b42-9ab188b7af6c","resolution":{"observed_at":"2026-08-06T12:17:53.971631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.920523Z","title":"Machado and Michael Bowling","venue":null,"work_id":"eb755e59-20cb-46fb-a68c-b5f6470d57d5","year":2016},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.976351Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:cf9dedfeab1e9674f1fa6e921794c16447870acdd621822d9c901ae1d85f54a6","observation_id":"1fdf2191-ddb2-476a-95fe-3bbacccb8a8f","resolution":{"observed_at":"2026-08-06T12:17:54.926167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.903565Z","title":null,"venue":null,"work_id":"c729eb59-1997-45cd-88b1-385596d6f0cb","year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.980788Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:e4d07963db9cfbef367d0b11fde0fc5204091af155a05d967796303339f3c584","observation_id":"5ae024b5-e315-41e5-a8e8-1f749576accd","resolution":{"observed_at":"2026-08-06T12:17:54.908405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T12:17:53.985221Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.985221Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:7a2e4812cbec7a30104f0c461ad20af085bb141ed2c2d3532232015fca911ce2","observation_id":"1607dbc4-e6fb-4267-ae5a-aa5a061a0536","resolution":{"observed_at":"2026-08-06T12:17:53.985221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T12:17:53.989752Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.989752Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:970615a13afc61078458cadec5d9fcc9ca2bebd26dee95e8ec48631a7671ebda","observation_id":"920a9cf9-af70-4a6e-b69b-31596cf5a4c4","resolution":{"observed_at":"2026-08-06T12:17:53.989752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2006.89027","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.666996Z","title":null,"venue":null,"work_id":"3324007f-df42-44bc-8bf9-279e887e7b2d","year":2007},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.994478Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:cd64f65062b29060070d427b057a40d2fbfeacf1ca953819799d2cdcb5cfc52a","observation_id":"7c5b48e5-f810-4442-8ae8-a20d5599757a","resolution":{"observed_at":"2026-08-06T12:17:54.674179Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.887389Z","title":"Christiano, Jan Leike, and Ryan Lowe","venue":null,"work_id":"8fdf0349-511e-4e56-9f42-5137ab534abe","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:53.999449Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:792c5c066498921b43ba3376a7d11a74eca2f02486ca7cb58fa85181e1496586","observation_id":"2ccb806d-4f12-4181-81e4-6828331e75dc","resolution":{"observed_at":"2026-08-06T12:17:54.892689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pcbi.1010580","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.239953Z","title":null,"venue":null,"work_id":"62d48f8d-0da8-4efe-82ab-28fa30da43cb","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.003905Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:10625c5823a969530064f8bedfd071d468f1af4d2b9b2e6c21b9ff53a7fe3008","observation_id":"1eb2c9ef-dce7-4f9b-9ba2-0212cadc9381","resolution":{"observed_at":"2026-08-06T12:17:54.245322Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.871419Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":"c3a34e7d-c173-4ca0-bfe0-d327a18fca82","year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.008412Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:905e2d8dfdb1723a516972d5cadfbda962cac9058fd8801531a0dfb9709aee53","observation_id":"aba441ef-11c8-42b4-8b56-9b462885af30","resolution":{"observed_at":"2026-08-06T12:17:54.876404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T12:17:54.012877Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.012877Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:cdd8c3f9bfe5db03d0564e1f1e42bfefcfaf6416424bfcad84b2a90ccafc0acd","observation_id":"974b5b5b-e63f-4abf-ab67-11cfec510a20","resolution":{"observed_at":"2026-08-06T12:17:54.012877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.017693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.017693Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:a4dbbeb79829a1779e299956024955382b2f241724e6b77b6b2e1e4683982703","observation_id":"18261e3f-3215-4bd2-af58-e902cb91da09","resolution":{"observed_at":"2026-08-06T12:17:54.017693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.856016Z","title":null,"venue":null,"work_id":"7f978bcb-bffb-4388-bb87-5625bc6bbd47","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.022190Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:4b85ee45ec3437182c29f87295b95ce6291b01b9783a16f5eafb401cff32b836","observation_id":"f36d5dd8-6196-4ed5-b5c4-6a1bdbbdee99","resolution":{"observed_at":"2026-08-06T12:17:54.860761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T12:17:54.026626Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.026626Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:7c310472e61de2ed46b038b09d377fc23bae58574a6a02aa73bc796b4842143f","observation_id":"01efa139-d2e5-42cb-b09f-6e42f4c5f689","resolution":{"observed_at":"2026-08-06T12:17:54.026626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.031390Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.031390Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:30e742b599d01c6e412fa22927d6b23f8b3ba5283a3dc2288971c73fff358903","observation_id":"f88fab62-6c2e-46d4-ae45-ded60763dde7","resolution":{"observed_at":"2026-08-06T12:17:54.031390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15624","last_updated":"2025-01-25T11:10:39Z","snapshot_observed_at":"2026-08-02T18:32:46.919947Z","submitted_at":"2024-05-24T15:13:53Z","title":"Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15624","snapshot_observed_at":"2026-08-06T12:17:54.036222Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.036222Z"},"links":{"cited_paper":"/paper/2405.15624","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:7e6c0338badf4a4aea5749c6dcf7b0c370ead133ae3e554f92dfeb6749d0b9f3","observation_id":"9c7807fa-509c-4bd1-bfec-804faf362c59","resolution":{"observed_at":"2026-08-06T12:17:54.036222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.840422Z","title":"Sutton, David McAllester, Satinder Singh, and Yishay Mansour","venue":null,"work_id":"214b4f66-d576-4c10-af34-bf86b5799bc8","year":1999},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.041302Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:39ca5fae1c27559bec3799ca5059b2061aa32089d276002c58e13c1d440d4cb5","observation_id":"6cd3f862-7b50-4f69-941e-1375d2f0cf7c","resolution":{"observed_at":"2026-08-06T12:17:54.845656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.045473Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.045473Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:5000f727e47ac704d44a52c8ed560bd9ade38a625010b1c827564626e1594f1d","observation_id":"2f25b65c-16b8-4d5d-8705-135b06736807","resolution":{"observed_at":"2026-08-06T12:17:54.045473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.050028Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.050028Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:e1fefcf2c2ca90ae461f8ff4c0d7a9dcd17739901d88c89eb0737af34eb0756b","observation_id":"c24efdf8-b312-413b-b5a7-f1295e8b7b8b","resolution":{"observed_at":"2026-08-06T12:17:54.050028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.055241Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.055241Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:310c577ca40d3bc89911506115fdea0427b500726b18cbb9659c97053e956e5b","observation_id":"01e7a4b5-375c-4141-aff7-57e20d96e081","resolution":{"observed_at":"2026-08-06T12:17:54.055241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10200","last_updated":"2024-05-23T20:53:59Z","snapshot_observed_at":"2026-07-06T17:30:47.845775Z","submitted_at":"2024-02-15T18:55:41Z","title":"Chain-of-Thought Reasoning Without Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10200","snapshot_observed_at":"2026-08-06T12:17:54.059645Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.059645Z"},"links":{"cited_paper":"/paper/2402.10200","citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:235d2c59bb56aabf7571832a0ee0a0e56c86fa0b94df48bbe24d5371f8d9ce0c","observation_id":"4f958512-d0ce-4590-af80-d1f24f2a005b","resolution":{"observed_at":"2026-08-06T12:17:54.059645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.814567Z","title":"Le, and Denny Zhou","venue":null,"work_id":"1bf9c81b-1f3f-429b-b7d2-26fdc6c4adcc","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.064389Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:c0eef8307c8e45dbd4eb5f6adf9fced5176630ba965b21eb873ad51e030b37e8","observation_id":"c202611a-70b7-41d9-a323-e45ed797a153","resolution":{"observed_at":"2026-08-06T12:17:54.819137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.799511Z","title":null,"venue":null,"work_id":"8c89fafd-80f8-4154-a7b6-eac3af4abec2","year":2018},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.068691Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:dfb2c73de9a45c924a86958c9969f4a54526a73493bc697c8707f3b3e297b0ad","observation_id":"8a5381e1-c69b-4663-b51e-16398997157b","resolution":{"observed_at":"2026-08-06T12:17:54.804267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.073482Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.073482Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:49a13319aaf91fb4554ea68ceda49a326d3cc90a6186bd8deff0d085d2d4ffce","observation_id":"76501c6b-b7e7-4d15-915b-42e6a289f892","resolution":{"observed_at":"2026-08-06T12:17:54.073482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.783871Z","title":null,"venue":null,"work_id":"8778199f-7b16-4bae-a1ea-9dbcc0c214a9","year":2022},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.078344Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:81e36329a8aae042330caa82e51cda050dde9cde901b8614964ee42312801459","observation_id":"1662f26f-1a90-4a84-9c2c-c688b711e9d9","resolution":{"observed_at":"2026-08-06T12:17:54.789300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.768521Z","title":null,"venue":null,"work_id":"0f658ce6-2436-442c-93b0-821f60ecac4f","year":2024},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.082905Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:6c9e756de2020af94a78966add998ef7a6424f45f93ea505a69544aaf3ccea67","observation_id":"5eb45b58-9c32-497c-ba3d-b6baeb420f04","resolution":{"observed_at":"2026-08-06T12:17:54.773581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.672","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:17:54.119306Z","title":null,"venue":null,"work_id":"1274be7d-ec17-4fb5-a460-f6e2e13dff12","year":2023},"citing_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T12:17:54.087304Z"},"links":{"citing_paper":"/paper/2507.21931"},"observation_digest":"sha256:8094518cd863a7e7087091a55d65f39da1787e7bf6cb5d1ccfedf1583191f060","observation_id":"a3b4f10c-1dea-43e8-a5a5-113697227e16","resolution":{"observed_at":"2026-08-06T12:17:54.125412Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T12:17:52.343009Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":45,"verified_exact":6,"verified_fuzzy":6},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 8 inbound Pith citation observations for arXiv:2507.21931."}