{"as_of":"2026-08-05T11:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af8aae00252e1f06e47688e5d9d5a98d4323c4f1f45b642e5f664fadbd2911bb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T10:07:39.554999Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T12:44:40.086070Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.08555","last_updated":"2024-04-16T00:22:16Z","snapshot_observed_at":"2026-08-01T22:10:49.555742Z","submitted_at":"2024-04-12T15:54:15Z","title":"RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs","version":2},"cited_work":{"arxiv_id":"2404.08555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.08555","snapshot_observed_at":"2026-06-30T12:44:40.086070Z","title":"Chaudhari, P","venue":null,"work_id":"8cc9739a-1059-4390-9b64-133e6763f9bf","year":2024},"citing_paper":{"arxiv_id":"2504.13048","last_updated":"2025-04-17T16:05:24Z","snapshot_observed_at":"2026-08-01T14:35:01.098252Z","submitted_at":"2025-04-17T16:05:24Z","title":"Design Topological Materials by Reinforcement Fine-Tuned Generative Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-22T19:15:26.493687Z"},"links":{"cited_paper":"/paper/2404.08555","citing_paper":"/paper/2504.13048"},"observation_digest":"sha256:bc037239ba16a2ea922d5e3ca55d576a4c0286bec4792949f473ede096890450","observation_id":"0192f92d-4e8b-48a5-83a3-8b4552c38577","resolution":{"observed_at":"2026-05-22T19:16:58.673929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08555","last_updated":"2024-04-16T00:22:16Z","snapshot_observed_at":"2026-08-01T22:10:49.555742Z","submitted_at":"2024-04-12T15:54:15Z","title":"RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs","version":2},"cited_work":{"arxiv_id":"2404.08555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.08555","snapshot_observed_at":"2026-06-30T12:44:40.086070Z","title":"Chaudhari, P","venue":null,"work_id":"8cc9739a-1059-4390-9b64-133e6763f9bf","year":2024},"citing_paper":{"arxiv_id":"2604.19260","last_updated":"2026-04-21T09:21:14Z","snapshot_observed_at":"2026-07-31T22:25:13.931512Z","submitted_at":"2026-04-21T09:21:14Z","title":"Understanding the Mechanism of Altruism in Large Language Models","version":1},"reference_index":220,"source":"arxiv_source","source_observed_at":"2026-05-10T01:36:50.329664Z"},"links":{"cited_paper":"/paper/2404.08555","citing_paper":"/paper/2604.19260"},"observation_digest":"sha256:1c93e14054b9378608e2f94fa73c072006cd3fd60d8593bf339c89cd733fe6a2","observation_id":"3397599e-aa4d-4948-a852-e4b7820fc315","resolution":{"observed_at":"2026-05-11T13:31:02.095160Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08555","last_updated":"2024-04-16T00:22:16Z","snapshot_observed_at":"2026-08-01T22:10:49.555742Z","submitted_at":"2024-04-12T15:54:15Z","title":"RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs","version":2},"cited_work":{"arxiv_id":"2404.08555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.08555","snapshot_observed_at":"2026-06-30T12:44:40.086070Z","title":"Chaudhari, P","venue":null,"work_id":"8cc9739a-1059-4390-9b64-133e6763f9bf","year":2024},"citing_paper":{"arxiv_id":"2604.22089","last_updated":"2026-04-23T21:41:09Z","snapshot_observed_at":"2026-07-06T23:08:33.204647Z","submitted_at":"2026-04-23T21:41:09Z","title":"Ethics Testing: Proactive Identification of Generative AI System Harms","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T20:49:22.147548Z"},"links":{"cited_paper":"/paper/2404.08555","citing_paper":"/paper/2604.22089"},"observation_digest":"sha256:0999353c049e0b4d193f9dd68e863eab036160d4ff8223c6ef1471ffdd435674","observation_id":"9b4d72fe-7bac-4803-b262-a665d07aaed0","resolution":{"observed_at":"2026-05-11T14:56:08.134959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08555","last_updated":"2024-04-16T00:22:16Z","snapshot_observed_at":"2026-08-01T22:10:49.555742Z","submitted_at":"2024-04-12T15:54:15Z","title":"RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs","version":2},"cited_work":{"arxiv_id":"2404.08555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.08555","snapshot_observed_at":"2026-06-30T12:44:40.086070Z","title":"Chaudhari, P","venue":null,"work_id":"8cc9739a-1059-4390-9b64-133e6763f9bf","year":2024},"citing_paper":{"arxiv_id":"2605.00155","last_updated":"2026-07-09T02:28:34Z","snapshot_observed_at":"2026-07-12T23:17:30.599444Z","submitted_at":"2026-04-30T19:22:56Z","title":"Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T21:03:53.045304Z"},"links":{"cited_paper":"/paper/2404.08555","citing_paper":"/paper/2605.00155"},"observation_digest":"sha256:c2e3ab83eb1c9f01f6111ea950dcbee435ff5a1d222b46d9dd1343685f7fd608","observation_id":"a8e39a83-0311-4f70-a9ea-4457ffbeae58","resolution":{"observed_at":"2026-05-11T14:46:46.289373Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08555","last_updated":"2024-04-16T00:22:16Z","snapshot_observed_at":"2026-08-01T22:10:49.555742Z","submitted_at":"2024-04-12T15:54:15Z","title":"RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs","version":2},"cited_work":{"arxiv_id":"2404.08555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.08555","snapshot_observed_at":"2026-06-30T12:44:40.086070Z","title":"Chaudhari, P","venue":null,"work_id":"8cc9739a-1059-4390-9b64-133e6763f9bf","year":2024},"citing_paper":{"arxiv_id":"2606.28707","last_updated":"2026-06-27T03:25:53Z","snapshot_observed_at":"2026-07-07T00:02:47.924620Z","submitted_at":"2026-06-27T03:25:53Z","title":"BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-30T10:07:39.554999Z"},"links":{"cited_paper":"/paper/2404.08555","citing_paper":"/paper/2606.28707"},"observation_digest":"sha256:ecac11902cc415da02bbacfcedc06e58a590299c081e075e8a0badccf555ee4b","observation_id":"d1c5aa97-5a8e-4280-9ba1-b7fc5cff08b5","resolution":{"observed_at":"2026-06-30T12:44:40.087477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2404.08555/citation-record","integrity":"/paper/2404.08555/integrity","json":"/paper/2404.08555/citation-record.json","paper":"/paper/2404.08555"},"outbound":[],"paper":{"arxiv_id":"2404.08555","last_updated":"2024-04-16T00:22:16Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T22:10:49.555742Z","submitted_at":"2024-04-12T15:54:15Z","title":"RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2404.08555."}