{"as_of":"2026-08-08T09:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ecb64bc17f9ec569907967f073a83066855d2169be311e39867e3931269fd785","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:03:59.969588Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08965/citation-record","integrity":"/paper/2506.08965/integrity","json":"/paper/2506.08965/citation-record.json","paper":"/paper/2506.08965"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.804158Z","title":null,"venue":null,"work_id":"72d9b4b5-723f-4edc-b5da-eb106f8cb193","year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.629212Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:895600e00131ad77ce6740e810bc3e3e041a10697762d12e35c74911201a772d","observation_id":"03fe4b88-0c49-479c-a137-bec123b343a1","resolution":{"observed_at":"2026-08-07T05:04:00.872967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.649665Z","title":"strong signal","venue":null,"work_id":"c9a19b24-25ab-4ff8-ba85-d99556ee610b","year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.701979Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:a95344ef4aa05c10cdd122c43508739ca7c2b8b57d7019fcd4b1f2ca7c154522","observation_id":"76d43501-a5be-4718-a772-01626ecea597","resolution":{"observed_at":"2026-08-07T05:04:00.712230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.230703Z","title":"Weak Accept or Strong Reject vs","venue":null,"work_id":"749dd006-3b41-4112-9a14-245100bc547f","year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.969588Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:5f8250a05182dc33497d558ea09ebb81a67230a4d9ac6eed14172fa4774efdf6","observation_id":"45c4b94b-5f19-4f9b-8836-fea49deded49","resolution":{"observed_at":"2026-08-07T05:04:00.271775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-07T05:03:59.316747Z","title":"arXiv preprint arXiv:2410.12832","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.316747Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:009e36e5b463c2638b547b596c9725f19b26ada744feceefd1563fb0d24984e7","observation_id":"e7bb3a19-2414-47b3-bf2d-6a8c61a5c1b6","resolution":{"observed_at":"2026-08-07T05:03:59.316747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03742","last_updated":"2024-10-13T10:21:29Z","snapshot_observed_at":"2026-07-06T19:28:01.764884Z","submitted_at":"2024-10-01T07:38:58Z","title":"Beyond Scalar Reward Model: Learning Generative Judge from Preference Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03742","snapshot_observed_at":"2026-08-07T05:03:59.531765Z","title":"strong accept","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.531765Z"},"links":{"cited_paper":"/paper/2410.03742","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:1d836e6790f19eab1962358f9d810ad7794e1c338e9dd47e33344e96e0443e23","observation_id":"0346ca06-8dc5-42b6-8bac-5b01371268fd","resolution":{"observed_at":"2026-08-07T05:03:59.531765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.496354Z","title":"The model thus converges to an optimal solu- tion consistent with the true preference order- ing (up to an additive scaling)","venue":null,"work_id":"8dc8aed5-9464-41f4-b4bc-3436b9d93b69","year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.800755Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:bd4406df4d6fff6ee4b5019d3c3dd084b34a88233370c261059b1a69bcc4327d","observation_id":"6921bfe3-fb3a-4a1c-9b50-f04875cc2178","resolution":{"observed_at":"2026-08-07T05:04:00.559616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.355336Z","title":"This retains the positive gradient properties 14 of logistic log-likelihood, allowing standard optimizers to converge efficiently","venue":null,"work_id":"915d3ba2-cee5-43f5-9ce2-55c7b0d307bc","year":null},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.861614Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:0ed5062a44bad5a90c833edfff5725f5a9e9624c5da15ea7122574637671b736","observation_id":"0d90e109-0ec1-4a4d-a75e-8c517cb91d5b","resolution":{"observed_at":"2026-08-07T05:04:00.426144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:03:59.448741Z","title":"Jeff Rasley, Samyam Rajbhandari, Olatunji Ruwase, and Yuxiong He","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.448741Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:639a67ab15bc9843a3fa85720362cf355fd0ad8a0f061ef1b41a72e8590925ee","observation_id":"7e971c68-9613-45c3-98c3-6249acb37590","resolution":{"observed_at":"2026-08-07T05:03:59.448741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-07T05:03:59.265968Z","title":"In Proceedings of the Workshop on Speech and Natural Language, pages 103–108","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.265968Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:6c3008dffd3e42b23fb425b660bf4ad9752fdc322b09d6ef527fc867c61a4292","observation_id":"93599e44-d838-4697-8c2d-62358cf345b5","resolution":{"observed_at":"2026-08-07T05:03:59.265968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T05:03:59.109692Z","title":"arXiv preprint arXiv:2112.00861","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.109692Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:f9ff8256032e292641ef9cd26066d8e474b7eeeb9448001592e64850e0f5b4c6","observation_id":"0a49f408-87ef-4be4-8efc-4928a420e7ba","resolution":{"observed_at":"2026-08-07T05:03:59.109692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T05:03:59.185692Z","title":"arXiv preprint arXiv:2203.02155","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.185692Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:8c20e7920d28e6d2bea1d3804eab0fb44828bad986ecad5fddb708e7c812d388","observation_id":"c48772e5-ded9-4861-8e38-87baf9bd560c","resolution":{"observed_at":"2026-08-07T05:03:59.185692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:04:00.941842Z","title":"Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He","venue":null,"work_id":"a9a43f18-1b6d-451c-a911-d19e43d01f30","year":2020},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.380040Z"},"links":{"citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:ea849ab6409978e9ed77bc45994b5179861cafcdfa15c2745606731bdba6f981","observation_id":"98fe3752-c817-4a50-880f-dea6985cabb7","resolution":{"observed_at":"2026-08-07T05:04:01.019646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T05:03:59.046421Z","title":"arXiv preprint arXiv:2408.11791","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.046421Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:f91620e82eb16c6720447bf9a1dd697b03f0c187bbb62aa1f170711a9d6098e8","observation_id":"717b82e3-abeb-4939-8f27-cbe14a2d3d99","resolution":{"observed_at":"2026-08-07T05:03:59.046421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T04:55:38.346254Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2506.08965."}