{"as_of":"2026-08-08T16:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0fb0b4fc4345853764954a66cace9c741ab43f567444985931a20fa2ee53ed5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:46.376259Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:06:55.872592Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.07314","last_updated":"2024-11-12T08:24:10Z","snapshot_observed_at":"2026-08-02T04:27:34.554927Z","submitted_at":"2024-02-11T21:44:21Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","version":3},"cited_work":{"arxiv_id":"2402.07314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07314","snapshot_observed_at":"2026-07-02T12:06:55.872592Z","title":"Online iterative reinforce- ment learning from human feedback with general preference model","venue":null,"work_id":"edebf0a7-c19f-404d-9aa6-17412caa380e","year":2024},"citing_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T00:35:31.375020Z"},"links":{"cited_paper":"/paper/2402.07314","citing_paper":"/paper/2412.09413"},"observation_digest":"sha256:fe53927ad048711ba4239f1a7f167bfe051636653a88cd0a946b24c3d77d9fa5","observation_id":"800496e3-91e4-41d9-88cc-260b1ff6e4e5","resolution":{"observed_at":"2026-05-18T00:35:31.494836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07314","last_updated":"2024-11-12T08:24:10Z","snapshot_observed_at":"2026-08-02T04:27:34.554927Z","submitted_at":"2024-02-11T21:44:21Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07314","snapshot_observed_at":"2026-08-07T15:15:46.376259Z","title":"A theoretical analysis of nash learning from human feedback under general kl-regularized preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17122","last_updated":"2025-05-21T17:59:02Z","snapshot_observed_at":"2026-08-08T01:18:20.084265Z","submitted_at":"2025-05-21T17:59:02Z","title":"Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:46.376259Z"},"links":{"cited_paper":"/paper/2402.07314","citing_paper":"/paper/2505.17122"},"observation_digest":"sha256:32c7e56c3bbc5e0c35ef3b202e9a2639249623bf501c5b94fd1da4a2ed4298bb","observation_id":"4a78435b-0abb-422c-95b9-2722526d7a4a","resolution":{"observed_at":"2026-08-07T15:15:46.376259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07314","last_updated":"2024-11-12T08:24:10Z","snapshot_observed_at":"2026-08-02T04:27:34.554927Z","submitted_at":"2024-02-11T21:44:21Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07314","snapshot_observed_at":"2026-08-07T14:10:43.394782Z","title":"A theoretical analysis of nash learning from human feedback under general kl-regularized preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20268","last_updated":"2025-07-24T14:21:12Z","snapshot_observed_at":"2026-08-08T15:11:42.219804Z","submitted_at":"2025-05-26T17:44:08Z","title":"Outcome-Based Online Reinforcement Learning: Algorithms and Fundamental Limits","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:43.394782Z"},"links":{"cited_paper":"/paper/2402.07314","citing_paper":"/paper/2505.20268"},"observation_digest":"sha256:23b8157591771eb9f3bf72ccf001e48ba8754531a2bace465da410cd2bdc5a6d","observation_id":"62417c3d-95fc-47b8-9e9b-f5ba558409e3","resolution":{"observed_at":"2026-08-07T14:10:43.394782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07314","last_updated":"2024-11-12T08:24:10Z","snapshot_observed_at":"2026-08-02T04:27:34.554927Z","submitted_at":"2024-02-11T21:44:21Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07314","snapshot_observed_at":"2026-08-06T19:28:59.337652Z","title":"A theoretical analysis of nash learning from human feedback under general kl-regularized preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-08T15:26:44.713063Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:59.337652Z"},"links":{"cited_paper":"/paper/2402.07314","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:2a44071bed5f7484f1bcd00e97d482215365b153a3eef511502bc495f6423688","observation_id":"683f5707-3ded-4ea2-9359-4f792525dc08","resolution":{"observed_at":"2026-08-06T19:28:59.337652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07314","last_updated":"2024-11-12T08:24:10Z","snapshot_observed_at":"2026-08-02T04:27:34.554927Z","submitted_at":"2024-02-11T21:44:21Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","version":3},"cited_work":{"arxiv_id":"2402.07314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07314","snapshot_observed_at":"2026-07-02T12:06:55.872592Z","title":"Online iterative reinforce- ment learning from human feedback with general preference model","venue":null,"work_id":"edebf0a7-c19f-404d-9aa6-17412caa380e","year":2024},"citing_paper":{"arxiv_id":"2605.09214","last_updated":"2026-05-09T23:17:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T23:17:46Z","title":"Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-12T03:47:14.379908Z"},"links":{"cited_paper":"/paper/2402.07314","citing_paper":"/paper/2605.09214"},"observation_digest":"sha256:5d5d1735c46ceb8df062a4f0f727ff26b1b28768d43981114ef92a2cccd2176f","observation_id":"681a11cf-4fc8-4558-aaed-db5ba133eae9","resolution":{"observed_at":"2026-05-12T06:56:31.027663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07314","last_updated":"2024-11-12T08:24:10Z","snapshot_observed_at":"2026-08-02T04:27:34.554927Z","submitted_at":"2024-02-11T21:44:21Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","version":3},"cited_work":{"arxiv_id":"2402.07314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07314","snapshot_observed_at":"2026-07-02T12:06:55.872592Z","title":"Online iterative reinforce- ment learning from human feedback with general preference model","venue":null,"work_id":"edebf0a7-c19f-404d-9aa6-17412caa380e","year":2024},"citing_paper":{"arxiv_id":"2605.09363","last_updated":"2026-05-10T06:23:19Z","snapshot_observed_at":"2026-08-03T01:34:15.771125Z","submitted_at":"2026-05-10T06:23:19Z","title":"Near-Optimal Last-Iterate Convergence for Zero-Sum Games with Bandit Feedback and Opponent Actions","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T03:46:35.908522Z"},"links":{"cited_paper":"/paper/2402.07314","citing_paper":"/paper/2605.09363"},"observation_digest":"sha256:71aaeb6a052044a712fb5b20bc350a73127e44eacd4df32d0f7c951abdfdadc9","observation_id":"15262199-a874-49e4-8ca7-17e4457fbee4","resolution":{"observed_at":"2026-05-12T06:56:31.615988Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07314","last_updated":"2024-11-12T08:24:10Z","snapshot_observed_at":"2026-08-02T04:27:34.554927Z","submitted_at":"2024-02-11T21:44:21Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","version":3},"cited_work":{"arxiv_id":"2402.07314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07314","snapshot_observed_at":"2026-07-02T12:06:55.872592Z","title":"Online iterative reinforce- ment learning from human feedback with general preference model","venue":null,"work_id":"edebf0a7-c19f-404d-9aa6-17412caa380e","year":2024},"citing_paper":{"arxiv_id":"2606.06053","last_updated":"2026-07-12T09:46:20Z","snapshot_observed_at":"2026-08-05T13:47:01.053562Z","submitted_at":"2026-06-04T11:54:23Z","title":"Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T02:31:11.200818Z"},"links":{"cited_paper":"/paper/2402.07314","citing_paper":"/paper/2606.06053"},"observation_digest":"sha256:875ebab703221c92355abf4f10df81af46dc6d3748cbfb69d3523c0c3a0662d9","observation_id":"c02ab51e-a296-4c6f-ab53-b9a3347391f8","resolution":{"observed_at":"2026-07-02T12:06:55.873915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07314","last_updated":"2024-11-12T08:24:10Z","snapshot_observed_at":"2026-08-02T04:27:34.554927Z","submitted_at":"2024-02-11T21:44:21Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07314","snapshot_observed_at":"2026-07-14T18:23:21.126826Z","title":"Tong Zhang.Mathematical Analysis of Machine Learning Algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06053","last_updated":"2026-07-12T09:46:20Z","snapshot_observed_at":"2026-08-05T13:47:01.053562Z","submitted_at":"2026-06-04T11:54:23Z","title":"Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T18:23:21.126826Z"},"links":{"cited_paper":"/paper/2402.07314","citing_paper":"/paper/2606.06053"},"observation_digest":"sha256:bf00fb0c4ce642d78e4734c141d9531081f2bf03b2120de9e4d13eb3a67ccc8d","observation_id":"d4255a95-1077-4dd9-8b92-ceef7e6f0dd4","resolution":{"observed_at":"2026-07-14T18:23:21.126826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.07314/citation-record","integrity":"/paper/2402.07314/integrity","json":"/paper/2402.07314/citation-record.json","paper":"/paper/2402.07314"},"outbound":[],"paper":{"arxiv_id":"2402.07314","last_updated":"2024-11-12T08:24:10Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T04:27:34.554927Z","submitted_at":"2024-02-11T21:44:21Z","title":"Online Iterative Reinforcement Learning from Human Feedback with General Preference Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2402.07314."}