{"as_of":"2026-08-07T21:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86ee2e4128b6018f61df3f3e5ec196af9042a3a986085afd1f8c0cfca0b3716c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:31:46.566747Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:39:45.380468Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2402.00782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-07-04T10:39:45.380468Z","title":"arXiv preprint arXiv:2402.00782 , year=","venue":null,"work_id":"c1731b60-5000-454a-abc6-dac03f512a75","year":2024},"citing_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-01T22:07:45.419539Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"reference_index":212,"source":"arxiv_source","source_observed_at":"2026-05-20T09:41:59.979595Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2408.07199"},"observation_digest":"sha256:c079f31eea20c37c4fbe51f6751d9cfe03ab87680a4a102ef590bf3a5ac190a2","observation_id":"c62c326f-aff4-402f-9beb-a0c31d46f666","resolution":{"observed_at":"2026-05-20T09:42:04.405371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-08-07T14:31:46.566747Z","title":"Dense reward for free in reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21537","last_updated":"2025-05-24T09:07:13Z","snapshot_observed_at":"2026-08-07T14:26:44.015259Z","submitted_at":"2025-05-24T09:07:13Z","title":"OpenReview Should be Protected and Leveraged as a Community Asset for Research in the Era of Large Language Models","version":1},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-08-07T14:31:46.566747Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2505.21537"},"observation_digest":"sha256:ee0585aa0e3978a7c728eb038f80322b025a215ff4446c2a6779881b5a80b7c2","observation_id":"89aedb79-5dcd-4cae-bd54-dd6f3cd454ff","resolution":{"observed_at":"2026-08-07T14:31:46.566747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-08-07T13:24:30.201304Z","title":"Dense reward for free in reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21907","last_updated":"2025-05-31T04:48:02Z","snapshot_observed_at":"2026-08-07T13:17:19.145607Z","submitted_at":"2025-05-28T02:52:39Z","title":"Modeling and Optimizing User Preferences in AI Copilots: A Comprehensive Survey and Taxonomy","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T13:24:30.201304Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2505.21907"},"observation_digest":"sha256:2b8e622d6e53e417b71c889dda5ee389b562400aae07e6d75a92e017d44e4abc","observation_id":"04b3437d-e8a2-4c38-90df-e92982a2163d","resolution":{"observed_at":"2026-08-07T13:24:30.201304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-08-07T11:32:29.474618Z","title":"Dense reward for free in reinforcement learning from human feedback.arXiv preprint arXiv:2402.00782, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-07T11:19:28.410568Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:29.474618Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:18a3a6c57084ea9f88e5518d9ebbb74738b69276206d7e6a5d7e4ed575f03e63","observation_id":"3d4739b4-8fbb-4f16-9d85-ca8afd503afd","resolution":{"observed_at":"2026-08-07T11:32:29.474618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-08-06T18:11:15.717117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09016","last_updated":"2025-07-16T09:24:11Z","snapshot_observed_at":"2026-08-06T18:03:53.710746Z","submitted_at":"2025-07-11T20:49:04Z","title":"Enhancing RLHF with Human Gaze Modeling","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:11:15.717117Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2507.09016"},"observation_digest":"sha256:d72b6750072e2b321359061feacabfa4e7417c13a2aa9de720ce9d705effd44d","observation_id":"eeafc856-3917-4b89-81e4-fc7dc8fc5775","resolution":{"observed_at":"2026-08-06T18:11:15.717117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-08-06T16:34:24.959248Z","title":"Dense reward for free in reinforcement learning from human feedback.arXiv preprint arXiv:2402.00782,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":1995,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.959248Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:2b7bfde3d29692d63a577ca849311498f21cba96a0b38db98335bf8dc2dd43d8","observation_id":"86dc17e9-3288-47f0-beb1-d6f026a9a300","resolution":{"observed_at":"2026-08-06T16:34:24.959248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2402.00782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-07-04T10:39:45.380468Z","title":"arXiv preprint arXiv:2402.00782 , year=","venue":null,"work_id":"c1731b60-5000-454a-abc6-dac03f512a75","year":2024},"citing_paper":{"arxiv_id":"2604.20659","last_updated":"2026-04-22T15:08:58Z","snapshot_observed_at":"2026-07-06T23:07:14.243878Z","submitted_at":"2026-04-22T15:08:58Z","title":"GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T00:14:29.531510Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2604.20659"},"observation_digest":"sha256:4e9d30e6bb37b8f859cb521ef5b20488f69f08a8cedb05965a8eea9a543a19cf","observation_id":"0d5c9c75-420b-4e5e-8e4a-28b9c5425713","resolution":{"observed_at":"2026-05-10T00:14:46.356805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2402.00782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-07-04T10:39:45.380468Z","title":"arXiv preprint arXiv:2402.00782 , year=","venue":null,"work_id":"c1731b60-5000-454a-abc6-dac03f512a75","year":2024},"citing_paper":{"arxiv_id":"2605.09134","last_updated":"2026-05-13T16:38:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T19:31:02Z","title":"BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-12T03:09:40.321500Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2605.09134"},"observation_digest":"sha256:206cba45151cc62a86463fb7cb2ee110da47c995ab4c72f886f2f6f2e94b6c45","observation_id":"c5392912-1faf-4e67-a8c5-ad70b0730da2","resolution":{"observed_at":"2026-05-12T03:11:18.973585Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2402.00782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-07-04T10:39:45.380468Z","title":"arXiv preprint arXiv:2402.00782 , year=","venue":null,"work_id":"c1731b60-5000-454a-abc6-dac03f512a75","year":2024},"citing_paper":{"arxiv_id":"2605.09134","last_updated":"2026-05-13T16:38:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T19:31:02Z","title":"BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-13T06:03:32.270553Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2605.09134"},"observation_digest":"sha256:6dbed196455dcbb031956b375d2a413306befb8bf79172bdd588947e271f7e9c","observation_id":"adaaacc2-3461-49f7-b636-482d7be0e49b","resolution":{"observed_at":"2026-05-13T06:07:22.397309Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2402.00782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-07-04T10:39:45.380468Z","title":"arXiv preprint arXiv:2402.00782 , year=","venue":null,"work_id":"c1731b60-5000-454a-abc6-dac03f512a75","year":2024},"citing_paper":{"arxiv_id":"2605.12652","last_updated":"2026-06-01T07:33:52Z","snapshot_observed_at":"2026-08-04T16:10:21.909941Z","submitted_at":"2026-05-12T18:57:44Z","title":"Multi-Rollout On-Policy Distillation via Peer Successes and Failures","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-14T21:29:36.803832Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2605.12652"},"observation_digest":"sha256:d114d1ad062a65f5604398a14f84088782dd15cd2918727f5de2965c52635783","observation_id":"f64647a0-71af-4baf-9b8e-a5e4a8c7f973","resolution":{"observed_at":"2026-05-14T21:32:59.813847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2402.00782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-07-04T10:39:45.380468Z","title":"arXiv preprint arXiv:2402.00782 , year=","venue":null,"work_id":"c1731b60-5000-454a-abc6-dac03f512a75","year":2024},"citing_paper":{"arxiv_id":"2605.12652","last_updated":"2026-06-01T07:33:52Z","snapshot_observed_at":"2026-08-04T16:10:21.909941Z","submitted_at":"2026-05-12T18:57:44Z","title":"Multi-Rollout On-Policy Distillation via Peer Successes and Failures","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T22:01:38.639580Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2605.12652"},"observation_digest":"sha256:fd30c573c2f18a6e3bbfb8b5c85d0bc5904ae1e95a8e51de26b97dbf0c1e2208","observation_id":"445c0768-7675-4872-ad45-920470cccdbd","resolution":{"observed_at":"2026-06-30T22:05:05.717282Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2402.00782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-07-04T10:39:45.380468Z","title":"arXiv preprint arXiv:2402.00782 , year=","venue":null,"work_id":"c1731b60-5000-454a-abc6-dac03f512a75","year":2024},"citing_paper":{"arxiv_id":"2606.15893","last_updated":"2026-06-22T03:05:35Z","snapshot_observed_at":"2026-08-04T09:50:38.097939Z","submitted_at":"2026-06-14T16:25:59Z","title":"BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T04:07:26.224919Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2606.15893"},"observation_digest":"sha256:511cf43624c0bc402fb21cc8e4a27e53fa7c796fcd48417a6d927c36ee519127","observation_id":"65932d75-77af-4ff1-a506-947e7a565913","resolution":{"observed_at":"2026-07-03T17:28:44.652844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2402.00782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-07-04T10:39:45.380468Z","title":"arXiv preprint arXiv:2402.00782 , year=","venue":null,"work_id":"c1731b60-5000-454a-abc6-dac03f512a75","year":2024},"citing_paper":{"arxiv_id":"2606.23557","last_updated":"2026-06-22T16:28:11Z","snapshot_observed_at":"2026-08-05T01:24:53.186762Z","submitted_at":"2026-06-22T16:28:11Z","title":"Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T08:38:46.044079Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2606.23557"},"observation_digest":"sha256:0130c9e6c7d701f16d46840025ac2f6dad6bf4c9e3afedc8326a836b9f922846","observation_id":"aa517d00-67a1-44a2-a698-d2b0ee743b75","resolution":{"observed_at":"2026-07-04T10:39:45.381977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2402.00782 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":290,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:69fdb59fb847e30a70b518b6b375cfa2a6249e4bc5fee04e1d132bfd43550b6b","observation_id":"cf6a8f44-ebf0-4252-9e1f-b8ab5467c684","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-08-02T08:41:06.582566Z","title":"arXiv preprint arXiv:2402.00782 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":291,"source":"arxiv_source","source_observed_at":"2026-08-02T08:41:06.582566Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:96fa94abbabb1a79684f9425bc29c81e6a7fe50ce9205e542f53ec7ec41b0483","observation_id":"dc916ebb-4544-40d8-a59a-ffbe1455bcca","resolution":{"observed_at":"2026-08-02T08:41:06.582566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00782","snapshot_observed_at":"2026-08-02T13:37:01.518021Z","title":"and Sun, Hao and Holt, Samuel and Schaar, Mihaela van der , month = feb, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21610","last_updated":"2026-05-20T04:43:02Z","snapshot_observed_at":"2026-08-06T13:09:35.487490Z","submitted_at":"2026-05-20T04:43:02Z","title":"SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-02T13:37:01.518021Z"},"links":{"cited_paper":"/paper/2402.00782","citing_paper":"/paper/2607.21610"},"observation_digest":"sha256:524d4f93dc51c6720348249df9387d1f8d6beba0abcded9b4cffdd0d6e2dfb02","observation_id":"497c2e34-36c3-4fa8-897d-2935a505487d","resolution":{"observed_at":"2026-08-02T13:37:01.518021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.00782/citation-record","integrity":"/paper/2402.00782/integrity","json":"/paper/2402.00782/citation-record.json","paper":"/paper/2402.00782"},"outbound":[],"paper":{"arxiv_id":"2402.00782","last_updated":"2024-02-01T17:10:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:10:35Z","title":"Dense Reward for Free in Reinforcement Learning from Human Feedback"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2402.00782."}