{"as_of":"2026-08-10T07:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69a86063b5b908d0fe6433595a70b7444e1d069d39f960138b7f49335ceb6888","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":62,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:20:13.896255Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:09:46.433136Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:183edf0353a8d551589c258529cc02ee9f85834bbfda86a6c180ded35857596e","observation_id":"1722cd2e-8a89-48d6-ba18-325f40167411","resolution":{"observed_at":"2026-05-13T12:01:42.528194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T12:17:53.478052Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2402.01306"},"observation_digest":"sha256:87027797a808ccd0095d59d51009fb9b76e91a8053af73dfde7be55f3f683620","observation_id":"5e276e74-323e-4467-a46d-42e1c255fd92","resolution":{"observed_at":"2026-05-12T12:17:53.546101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-09T23:53:42.648697Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"reference_index":237,"source":"arxiv_source","source_observed_at":"2026-05-18T06:38:36.517935Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2408.00724"},"observation_digest":"sha256:fa4405f1983d0dc89b75b33a856074673304a24c3a4eb37065d6943478d2da55","observation_id":"34a278a0-618b-4598-9c74-270390f42fdb","resolution":{"observed_at":"2026-05-18T06:38:37.016336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-01T22:07:45.419539Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"reference_index":210,"source":"arxiv_source","source_observed_at":"2026-05-20T09:41:59.979595Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2408.07199"},"observation_digest":"sha256:be2bd96d3f68ffb547e31b352d6f9f99335549f1497d39c99295f1e48907cf45","observation_id":"75b6c38f-8957-4816-bbcb-19d670c555ee","resolution":{"observed_at":"2026-05-20T09:42:04.390390Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2412.02125","last_updated":"2026-05-01T15:42:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-03T03:27:48Z","title":"Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-23T08:20:05.898025Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2412.02125"},"observation_digest":"sha256:50bf039daec6d61f4346e4d640cb2fd6010d63dc69b4d6539c5ed80af93b6738","observation_id":"7a0c075c-9a59-4218-876e-38c6449f733a","resolution":{"observed_at":"2026-05-23T08:22:44.243462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-09T22:20:13.896255Z","title":", Joshi, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18858","last_updated":"2025-06-06T18:49:45Z","snapshot_observed_at":"2026-08-09T22:09:26.143585Z","submitted_at":"2025-01-31T02:39:07Z","title":"BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-09T22:20:13.896255Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2501.18858"},"observation_digest":"sha256:78ae7c0effc418669f7b235c3f2b8c6dee18b597f347c29842022348fadebced","observation_id":"fb60df69-5da4-4d2d-bc3d-6c928af3da1a","resolution":{"observed_at":"2026-08-09T22:20:13.896255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-09T20:09:54.404741Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00136","last_updated":"2025-05-28T05:28:29Z","snapshot_observed_at":"2026-08-09T20:01:23.940929Z","submitted_at":"2025-01-31T19:41:28Z","title":"A Checks-and-Balances Framework for Context-Aware Ethical AI Alignment","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-09T20:09:54.404741Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2502.00136"},"observation_digest":"sha256:594a58d2255f4f05a163757f20a5e6f87931ae17a9b64d90a6b1dbd4334743d0","observation_id":"049fc6f9-58a1-4cf3-831d-abe63ed3fee8","resolution":{"observed_at":"2026-08-09T20:09:54.404741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-09T16:18:40.583638Z","title":"Slic- hf: Sequence likelihood calibration with human feedback.arXiv preprint arXiv:2305.10425, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01208","last_updated":"2025-06-20T10:54:05Z","snapshot_observed_at":"2026-08-09T16:35:47.837184Z","submitted_at":"2025-02-03T09:59:32Z","title":"On Almost Surely Safe Alignment of Large Language Models at Inference-Time","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T16:18:40.583638Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2502.01208"},"observation_digest":"sha256:6d2385cc09a046e8303d870b58167210f4626017c2edd2427e641a7028625160","observation_id":"a6eccc06-70ba-46d1-a3e0-5158e1fbea3c","resolution":{"observed_at":"2026-08-09T16:18:40.583638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-09T06:04:01.644525Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03095","last_updated":"2025-02-05T11:41:43Z","snapshot_observed_at":"2026-08-09T07:07:23.846920Z","submitted_at":"2025-02-05T11:41:43Z","title":"Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T06:04:01.644525Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2502.03095"},"observation_digest":"sha256:186105b3d7af57edde208a073e1d58ee8a54ffe30fda9ed8e613d01ad6e4ab34","observation_id":"52741b9a-7c71-44bf-85a1-fe1cb7775f6b","resolution":{"observed_at":"2026-08-09T06:04:01.644525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-09T04:08:52.221810Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03699","last_updated":"2025-07-23T21:26:26Z","snapshot_observed_at":"2026-08-09T04:26:07.182723Z","submitted_at":"2025-02-06T01:22:06Z","title":"LLM Alignment as Retriever Optimization: An Information Retrieval Perspective","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T04:08:52.221810Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2502.03699"},"observation_digest":"sha256:12c1a5b37925e99b6fb588fffd8172177aad6f62832c7b9821edd618774da4aa","observation_id":"ff55ae22-d549-4c47-bb36-1e8685b45293","resolution":{"observed_at":"2026-08-09T04:08:52.221810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2502.06387","last_updated":"2026-04-07T06:33:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-10T12:15:27Z","title":"How Humans Help LLMs: Assessing and Incentivizing Human Preference Annotators","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-23T03:56:18.703995Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2502.06387"},"observation_digest":"sha256:4bcc8e22135d534be08fc9114d56cb1b25334dff86a72d4eabd5a90d845c3fb7","observation_id":"2380c056-2542-4170-8d4c-6ccb870716e3","resolution":{"observed_at":"2026-05-23T03:57:29.564192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-08T19:40:42.069597Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-08T19:30:36.087038Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.069597Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:3bdef3d0a8d6f13aad6c7e28a9160ba924a80e58d1ced1bb06641a6eb8c586f1","observation_id":"3c00348f-ff9c-439e-a0ce-a04c3d03c991","resolution":{"observed_at":"2026-08-08T19:40:42.069597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-08T11:57:12.067249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09650","last_updated":"2025-05-13T18:54:09Z","snapshot_observed_at":"2026-08-09T02:50:07.586622Z","submitted_at":"2025-02-11T17:01:11Z","title":"Principled Data Selection for Alignment: The Hidden Risks of Difficult Examples","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T11:57:12.067249Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2502.09650"},"observation_digest":"sha256:21625e9b8369ed6e9009b7198aeb9a6890615a46f5f5509fe47e051e18bd1f9a","observation_id":"f423684f-2bfc-493e-9f0c-f0ec5536991d","resolution":{"observed_at":"2026-08-08T11:57:12.067249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":193,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:9d1abdb242c12b7d26e22407be0ead7f081b5964b513aaac521c6b861b469c8e","observation_id":"59175734-fc8a-42e0-9c75-894c1cea7c81","resolution":{"observed_at":"2026-05-22T19:32:01.402266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T15:15:46.299308Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17122","last_updated":"2025-05-21T17:59:02Z","snapshot_observed_at":"2026-08-08T23:38:32.695642Z","submitted_at":"2025-05-21T17:59:02Z","title":"Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:46.299308Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2505.17122"},"observation_digest":"sha256:1c6df0e18e454aac57f9cbc642143cae3319ad6cb460d1dff33a02b4cee30dce","observation_id":"f2cf9eaa-5d02-454e-91db-cc41a6877c14","resolution":{"observed_at":"2026-08-07T15:15:46.299308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2505.19134","last_updated":"2026-04-13T23:58:15Z","snapshot_observed_at":"2026-07-06T21:30:04.828669Z","submitted_at":"2025-05-25T13:11:55Z","title":"Incentivizing High-Quality Human Annotations with Golden Questions","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T13:41:26.730528Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2505.19134"},"observation_digest":"sha256:2b3e581dd65dcdb3dafb71b1f9d9d959bbe0e439e0c2b730a4f8190ced9f6026","observation_id":"87bd096e-8ccb-4955-abd4-69db5d72d6bc","resolution":{"observed_at":"2026-05-19T13:42:19.370731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T13:45:04.554366Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:04.554366Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:97caa8f62f744750211014c3d7ec217d2f3741e1b5c45f79f7a25a36cd7305fe","observation_id":"0f25a33c-c908-4cf8-a2fd-d6b57a926c3f","resolution":{"observed_at":"2026-08-07T13:45:04.554366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T12:43:50.251391Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-09T08:37:01.244014Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.251391Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:09794b3969b0b6e3e06a22770692251220262d04c58272546bbf34ea707fdcae","observation_id":"0b8a432e-e368-4c56-b05f-05153a48c8e2","resolution":{"observed_at":"2026-08-07T12:43:50.251391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T12:27:57.177745Z","title":"Slic- hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24709","last_updated":"2025-05-30T15:30:43Z","snapshot_observed_at":"2026-08-10T03:27:48.884892Z","submitted_at":"2025-05-30T15:30:43Z","title":"On Symmetric Losses for Robust Policy Optimization with Noisy Preferences","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:57.177745Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2505.24709"},"observation_digest":"sha256:c664f38c82cf8aefeb2a68505f2fdcb9f650d32bfbb8c05171c7b6a0a2408a83","observation_id":"821c1dfc-b893-4828-acbd-f8130eb23105","resolution":{"observed_at":"2026-08-07T12:27:57.177745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T11:20:13.316647Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-10T01:49:26.032258Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:13.316647Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:9492c770341551b35ed2a006e2449d665473005bd02309eb8b2ed61223e388be","observation_id":"faf8bccb-9cd4-44ef-92c4-992109603475","resolution":{"observed_at":"2026-08-07T11:20:13.316647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T11:07:35.619682Z","title":"Limitations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.619682Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:7ee5ba3ce0e567462e7d9a2dd77e8e28f6b2e4e828e3eacd74d43cb32392831b","observation_id":"e928c41e-609e-4942-909e-de9dc75b6c28","resolution":{"observed_at":"2026-08-07T11:07:35.619682Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T05:40:18.036861Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-09T13:22:13.526160Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.036861Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:93859e3049fc73521f17c488528e12be29f6af85f76f5649a5ff88e709bf16ff","observation_id":"96a4e02e-511b-44ed-9d04-e4057629f929","resolution":{"observed_at":"2026-08-07T05:40:18.036861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T05:14:45.342641Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-10T02:38:21.781172Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.342641Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:91936b82b69679518c2af11dfecc972cc7978d63a00c03ccfdde17d1c6829025","observation_id":"1dc57259-667c-4d60-b5b1-f7b8a9949c6b","resolution":{"observed_at":"2026-08-07T05:14:45.342641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T05:08:05.322977Z","title":"Slic- hf: Sequence likelihood calibration with human feedback.arXiv preprint arXiv:2305.10425, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08998","last_updated":"2025-06-10T17:17:48Z","snapshot_observed_at":"2026-08-07T04:54:47.198895Z","submitted_at":"2025-06-10T17:17:48Z","title":"On Monotonicity in AI Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:08:05.322977Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.08998"},"observation_digest":"sha256:2fb45e6cc54ed563d912f6463fb6c20cf545d647b29aa3c28ec5c37f4edde43f","observation_id":"ad212efc-b520-4d1a-86e3-86662d50493f","resolution":{"observed_at":"2026-08-07T05:08:05.322977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T06:05:32.720004Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.720004Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:dcaf4ce801f2950da45b325c2360148d7123d3c1e6f9952c65734a6ebad46feb","observation_id":"9520ea74-8889-43c0-bd1b-372e99a61b44","resolution":{"observed_at":"2026-08-07T06:05:32.720004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T00:31:49.293738Z","title":"Slic-hf: Sequence likelihood calibration with human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13702","last_updated":"2026-06-01T10:55:41Z","snapshot_observed_at":"2026-08-07T23:29:31.451423Z","submitted_at":"2025-06-16T17:06:27Z","title":"Value-Free Policy Optimization via Reward Partitioning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:49.293738Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.13702"},"observation_digest":"sha256:97cc7d7103ccb052b10bad5fb5415b25f52d1d25b2069dd3b4e5b866fa186c41","observation_id":"586052fa-c7b1-42f5-b7d7-8e467d6e9ebc","resolution":{"observed_at":"2026-08-07T00:31:49.293738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-06T22:44:44.816609Z","title":"Slic-hf: Sequence likelihood calibration with human feed- back.arXiv preprint arXiv:2305.10425, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":274,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.816609Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:130ff763ea09457e41ca2b260bfde55e39ed6046c6aa2d5814199107f17d6d2f","observation_id":"7b97a484-904c-4c66-8d4a-e5b1f170f0c2","resolution":{"observed_at":"2026-08-06T22:44:44.816609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T00:54:49.868787Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00018","last_updated":"2025-07-04T08:16:16Z","snapshot_observed_at":"2026-08-07T00:41:17.848176Z","submitted_at":"2025-06-15T05:42:29Z","title":"Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:54:49.868787Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2507.00018"},"observation_digest":"sha256:33ee35adc07db445ea6586cbd57161f23e2916cdca851145169e15c589246295","observation_id":"665991a4-8154-4b0a-a47d-ecd103f3e2eb","resolution":{"observed_at":"2026-08-07T00:54:49.868787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-06T20:34:37.335053Z","title":"Slic-hf: Sequence likelihood calibration with human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02406","last_updated":"2025-07-03T07:59:49Z","snapshot_observed_at":"2026-08-09T06:57:17.078400Z","submitted_at":"2025-07-03T07:59:49Z","title":"Improving Consistency in Vehicle Trajectory Prediction Through Preference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:34:37.335053Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2507.02406"},"observation_digest":"sha256:4e989c88b805891fd530c84be076507c03eb13474413636f44b181ba9da31ca9","observation_id":"75cfad5b-8491-433a-a1af-4a7ef81d8a73","resolution":{"observed_at":"2026-08-06T20:34:37.335053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2507.02850","last_updated":"2026-04-20T16:20:19Z","snapshot_observed_at":"2026-08-08T22:29:26.063319Z","submitted_at":"2025-07-03T17:55:40Z","title":"LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T05:58:17.452837Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2507.02850"},"observation_digest":"sha256:86f9148665aff5228fb389a9e7b4006be2b578003a0dbfdcd0abd43d6e6e8bbc","observation_id":"1036f3d1-a9c8-4f11-bc1c-117c7058c47c","resolution":{"observed_at":"2026-05-19T06:02:07.792836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-06T18:52:38.808890Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T05:40:24.839933Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.808890Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:587ac57bcebf950ba49ff2113abd95761f737ae1c3fc90733e364294355fb57f","observation_id":"6b833df4-92a0-4977-88b7-29c850e08e7f","resolution":{"observed_at":"2026-08-06T18:52:38.808890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-06T10:28:56.119117Z","title":"Slic-hf: Sequence likelihood calibration with human feedback.arXiv preprint arXiv:2305.10425, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23779","last_updated":"2025-07-31T17:59:09Z","snapshot_observed_at":"2026-08-08T14:45:38.446269Z","submitted_at":"2025-07-31T17:59:09Z","title":"Phi-Ground Tech Report: Advancing Perception in GUI Grounding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T10:28:56.119117Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2507.23779"},"observation_digest":"sha256:1dad1ef3da3e1d9c711bcbb20182e03f1ad4d77ee74d8067c9436f65b0b5e038","observation_id":"d00b723e-d4c4-46eb-9e1d-42352f6ba700","resolution":{"observed_at":"2026-08-06T10:28:56.119117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-05T21:33:14.871864Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08466","last_updated":"2025-08-11T20:53:37Z","snapshot_observed_at":"2026-08-10T06:41:24.244484Z","submitted_at":"2025-08-11T20:53:37Z","title":"Enhancing Small LLM Alignment through Margin-Based Objective Modifications under Resource Constraints","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T21:33:14.871864Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2508.08466"},"observation_digest":"sha256:5ee432ccb8120302ccc3cf25d84540c0bcdfb0a9de66d12982630f1c3bdb3115","observation_id":"5fd91298-c1f0-4ab7-ae4c-bcc8c72fe381","resolution":{"observed_at":"2026-08-05T21:33:14.871864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2509.20265","last_updated":"2026-04-29T12:32:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T15:52:36Z","title":"Failure Modes of Maximum Entropy RLHF","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-18T14:02:11.084514Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2509.20265"},"observation_digest":"sha256:916362847832cf6a0d8d862f68b80dd4d649854ee8803f82de9ea46039f38348","observation_id":"9727fb8b-240f-40a7-a8a8-5838076e0ff6","resolution":{"observed_at":"2026-05-18T14:02:39.779960Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-04T14:52:23.843777Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.843777Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:1bcb25b750fe3c35e1085d29a7de6d1a90c40a1f0c090a1cfb8023720fa787a1","observation_id":"dca28929-3147-44b8-80dc-00812939bbea","resolution":{"observed_at":"2026-08-04T14:52:23.843777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-04T13:40:15.787091Z","title":"Slic-hf: Sequence likelihood calibration with human feedback.arXiv preprint arXiv:2305.10425,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.787091Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:5fb249c5ef50a42ca9757bb5cc585aa872c042a62cb96d23a6eaf0bf39dea5ae","observation_id":"6d45353d-31f5-45da-842c-4dfe6de29502","resolution":{"observed_at":"2026-08-04T13:40:15.787091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2510.17881","last_updated":"2026-04-24T20:38:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-17T23:07:57Z","title":"POPI: Personalizing LLMs via Optimized Natural Language Preference Inference","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T05:41:58.231139Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2510.17881"},"observation_digest":"sha256:c85f5256f2d051db6a95b7609edbdd888b4281e4fe4365b294adca125e6d02f6","observation_id":"1409158b-53b4-4237-b651-722e6ea4b7a9","resolution":{"observed_at":"2026-05-18T05:42:24.390403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2604.17396","last_updated":"2026-04-19T11:59:58Z","snapshot_observed_at":"2026-08-01T18:23:32.699442Z","submitted_at":"2026-04-19T11:59:58Z","title":"Representation-Guided Parameter-Efficient LLM Unlearning","version":1},"reference_index":209,"source":"arxiv_source","source_observed_at":"2026-05-10T06:01:46.885030Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2604.17396"},"observation_digest":"sha256:1fd47f3cd9c95c9501992dd51fbe684022ff15bfac2b4fb1e40604fa44687091","observation_id":"c4a76026-141a-4769-8298-c6042f584ffc","resolution":{"observed_at":"2026-05-10T06:06:19.162389Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2604.27733","last_updated":"2026-04-30T11:24:04Z","snapshot_observed_at":"2026-07-06T23:13:11.623453Z","submitted_at":"2026-04-30T11:24:04Z","title":"Mind the Gap: Structure-Aware Consistency in Preference Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-07T06:41:18.311986Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2604.27733"},"observation_digest":"sha256:7a6b89d6b840cb771731f746c7f603fdfb70fbbda9099ed7c5132fc75101ab2d","observation_id":"0783e4e0-6a46-4245-9168-026877db7356","resolution":{"observed_at":"2026-05-12T10:16:28.593236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2605.02439","last_updated":"2026-06-06T12:31:59Z","snapshot_observed_at":"2026-08-02T12:16:28.740865Z","submitted_at":"2026-05-04T10:37:09Z","title":"Anomaly-Preference Image Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-08T18:45:20.508200Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2605.02439"},"observation_digest":"sha256:7a31f69af7b01f24fa189e75aa7751b11caa20a4a18e2d1efbfda4c9dea98946","observation_id":"b7f30dcf-b92d-47e0-9d7e-b27dc150c79b","resolution":{"observed_at":"2026-05-09T06:15:37.409124Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2605.02439","last_updated":"2026-06-06T12:31:59Z","snapshot_observed_at":"2026-08-02T12:16:28.740865Z","submitted_at":"2026-05-04T10:37:09Z","title":"Anomaly-Preference Image Generation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-21T00:39:31.730684Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2605.02439"},"observation_digest":"sha256:b7896b601fc60eeaca19e2b3ab6ffbc444268f8395f301240ecffb3bcf9324d6","observation_id":"2eb63ced-9368-49ee-a8e6-807028c53ccc","resolution":{"observed_at":"2026-05-21T00:43:53.717724Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2605.02439","last_updated":"2026-06-06T12:31:59Z","snapshot_observed_at":"2026-08-02T12:16:28.740865Z","submitted_at":"2026-05-04T10:37:09Z","title":"Anomaly-Preference Image Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T00:36:26.957598Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2605.02439"},"observation_digest":"sha256:5bf9f04b194dbe759ab4b08aee5cacbcbf602577da51e98cd1e6de52a82c27cb","observation_id":"1e1e8f3b-289b-407d-b2a8-157ed91bcedc","resolution":{"observed_at":"2026-07-01T00:45:12.283055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-08T17:01:04.571087Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:19b752be457606598c40565456f91b6af622ccac7c4b4789a691d3894cd57420","observation_id":"7fa8adaa-2ecf-40ef-bb7e-38081db26d93","resolution":{"observed_at":"2026-05-11T17:51:09.182781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:a26701186a8f9b3c32ca92e02c5778581109a6ea94908c793331b0547026d502","observation_id":"754f1ef1-1628-4e0b-b4f3-c6b36a820e0c","resolution":{"observed_at":"2026-07-01T00:35:10.407105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2605.12545","last_updated":"2026-05-09T10:21:51Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-09T10:21:51Z","title":"CROP: Expert-Aligned Image Cropping via Compositional Reasoning and Optimizing Preference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T21:36:26.958957Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2605.12545"},"observation_digest":"sha256:608d48b637687710c9590e7bd25aa831194b24feb9b8fbb3b61ead43331e51b4","observation_id":"75f08799-ea08-4a97-9d8d-68b5a3dcbaff","resolution":{"observed_at":"2026-05-14T21:38:00.841961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2605.20834","last_updated":"2026-05-20T07:26:22Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:26:22Z","title":"Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-21T04:59:41.187000Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2605.20834"},"observation_digest":"sha256:048ac58a98893eabce0783eb5708d6dd3d47b1ed08180c034b56cc4d7c4bb4ee","observation_id":"188984cc-6ede-4346-90f0-ba835b7ebe66","resolution":{"observed_at":"2026-05-21T05:03:58.124603Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2605.21883","last_updated":"2026-05-26T03:18:58Z","snapshot_observed_at":"2026-08-02T06:47:31.736398Z","submitted_at":"2026-05-21T01:43:09Z","title":"Token-weighted Direct Preference Optimization with Attention","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-22T07:05:23.189975Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2605.21883"},"observation_digest":"sha256:d4b056eb2ab1d1f6bab161f838c71eb984c082bfc09b2c26150b9e9014f1910d","observation_id":"fde0b802-f605-407f-921a-0821d188ab28","resolution":{"observed_at":"2026-05-22T07:06:11.750006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2606.01561","last_updated":"2026-06-01T02:06:58Z","snapshot_observed_at":"2026-08-01T20:22:50.507895Z","submitted_at":"2026-06-01T02:06:58Z","title":"S-SPPO: Semantic-Calibrated Self-Play Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T14:58:33.167891Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2606.01561"},"observation_digest":"sha256:9a09180f6a36ea8238146baf8d2a197319894233eebdc41b364101599e5c5096","observation_id":"b6439581-fc26-4740-9979-7b9337f814fe","resolution":{"observed_at":"2026-07-01T22:56:19.435524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2606.03376","last_updated":"2026-06-03T03:21:53Z","snapshot_observed_at":"2026-07-06T23:43:40.769504Z","submitted_at":"2026-06-02T09:22:53Z","title":"P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization","version":2},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-06-28T11:13:37.291834Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2606.03376"},"observation_digest":"sha256:aa324e1bff430f868dd4cded99b496c7b7e4776b1a2d68cd221d66189f327e08","observation_id":"496bb23e-2733-4db9-a00b-e336c57b3c5e","resolution":{"observed_at":"2026-07-02T02:06:27.135124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2606.12578","last_updated":"2026-06-10T18:26:11Z","snapshot_observed_at":"2026-08-02T21:20:28.323048Z","submitted_at":"2026-06-10T18:26:11Z","title":"MARD: Mirror-Augmented Reasoning Distillation for Mechanism-Level Drug-Drug Interaction Prediction","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-27T09:44:38.871250Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2606.12578"},"observation_digest":"sha256:192ef60a85532ff37c099f4f47ec1a0131b904fc57fab1715ec3c786b13a53fb","observation_id":"72de1279-8562-4fca-b409-83c5916d3e1e","resolution":{"observed_at":"2026-07-03T10:58:03.338464Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:84701549cec877f5c5830edf600c4f397a631e77854dc7f4322bc3096d1f389a","observation_id":"06574a1f-879b-48d7-b34f-95e68bfb9f58","resolution":{"observed_at":"2026-07-03T16:08:37.812263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":1},"reference_index":194,"source":"pdf_text","source_observed_at":"2026-06-26T08:09:57.542558Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:24ebf74f83a05965dd3dbc53cf5bfd0c2601cef378dab462cc62c9078b2f1155","observation_id":"e3deae7e-03de-46fb-9a72-0ded20e4c8be","resolution":{"observed_at":"2026-07-04T11:09:46.434801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-02T10:27:18.422406Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":2},"reference_index":194,"source":"pdf_text","source_observed_at":"2026-08-02T10:27:18.422406Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:34b55ea603c323fc85e39ec0ec2432bf54ccf9d2977c146e43fea9ca20a646be","observation_id":"b1c3db5a-96df-4011-a5a9-6bf7ac7609b3","resolution":{"observed_at":"2026-08-02T10:27:18.422406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2606.28401","last_updated":"2026-06-24T11:06:22Z","snapshot_observed_at":"2026-07-07T00:02:29.000757Z","submitted_at":"2026-06-24T11:06:22Z","title":"Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T01:22:16.176398Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2606.28401"},"observation_digest":"sha256:fe7486519167c4b36ed4a220129e760d90a6dcee97578d7323c2aa9e10ce64bf","observation_id":"8fc7b84b-5fce-481d-8dc9-a489f7d6da51","resolution":{"observed_at":"2026-07-01T15:35:47.677633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2606.30248","last_updated":"2026-07-15T11:35:26Z","snapshot_observed_at":"2026-08-08T09:25:46.128175Z","submitted_at":"2026-06-29T12:57:34Z","title":"Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T06:07:44.343539Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2606.30248"},"observation_digest":"sha256:96b3b54cafd651c134063918886d46e6a4a99bea8c96b412957e4568fa63e4c3","observation_id":"8051384f-8274-450f-b576-80cc0349ec02","resolution":{"observed_at":"2026-06-30T08:14:26.741596Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-02T09:37:24.616723Z","title":"arXiv preprint arXiv:2305.10425 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30248","last_updated":"2026-07-15T11:35:26Z","snapshot_observed_at":"2026-08-08T09:25:46.128175Z","submitted_at":"2026-06-29T12:57:34Z","title":"Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T09:37:24.616723Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2606.30248"},"observation_digest":"sha256:cff887847b41e76c708fda90ed41ba03b881d3fca39020da595567a5150d6038","observation_id":"cccff79b-33e6-4cc0-bb99-7ab96de8cd7b","resolution":{"observed_at":"2026-08-02T09:37:24.616723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-12T03:50:30.002103Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03248","last_updated":"2026-07-03T12:04:43Z","snapshot_observed_at":"2026-07-12T03:50:29.370662Z","submitted_at":"2026-07-03T12:04:43Z","title":"Unbiased Alignment for Large Language Models with Noisy Preferences","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T03:50:30.002103Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2607.03248"},"observation_digest":"sha256:60cddd4b01e17c8e68b3c4cafd17ec2c7f5eeeda5e06184027bcbc746f2127e6","observation_id":"1470d54a-8ab3-4f29-b8b4-1ffcaa06c8cf","resolution":{"observed_at":"2026-07-12T03:50:30.002103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2305.10425 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":254,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:88022c81dd8d2d57d4184f69cb174fdd500e4507a750e63af71875771c93a0cf","observation_id":"c5def73b-34c0-4807-b171-8bde50c6a6f6","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-02T08:41:01.968095Z","title":"arXiv preprint arXiv:2305.10425 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":255,"source":"arxiv_source","source_observed_at":"2026-08-02T08:41:01.968095Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:ed40a6ba5be4399a4aaa57a42602c435db672c1e5713da8386c36b1dc59ff010","observation_id":"af3df9e8-9307-4cec-bf01-c72357f13696","resolution":{"observed_at":"2026-08-02T08:41:01.968095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-13T05:26:06.829382Z","title":"Slic- hf: Sequence likelihood calibration with human feedback.arXiv preprint arXiv:2305.10425, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08968","last_updated":"2026-07-09T22:09:16Z","snapshot_observed_at":"2026-08-09T10:00:22.541985Z","submitted_at":"2026-07-09T22:09:16Z","title":"Every Sample Counts: Supervised Fine-Tuning of Language Models with Pointwise Constraints","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T05:26:06.829382Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2607.08968"},"observation_digest":"sha256:0dcfb2db4b7144c2f0c4d2d7b523fc1581f8dda9b624a138b94e6e16d25402b8","observation_id":"fe93fbcb-ec48-420e-a923-cb85d810674c","resolution":{"observed_at":"2026-07-13T05:26:06.829382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-02T10:01:59.868237Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16240","last_updated":"2026-06-26T03:03:15Z","snapshot_observed_at":"2026-08-08T01:20:34.619049Z","submitted_at":"2026-06-26T03:03:15Z","title":"Normalized Rewards for Preference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T10:01:59.868237Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2607.16240"},"observation_digest":"sha256:3ea2e5970597b52dbcca13c8002e37d6c3119281e99d841d80e64b066fdd9386","observation_id":"8921611f-4095-440e-86e1-14e4d0f270dd","resolution":{"observed_at":"2026-08-02T10:01:59.868237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-01T07:28:35.893789Z","title":"arXiv preprint arXiv:2305.10425 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21453","last_updated":"2026-07-24T02:14:44Z","snapshot_observed_at":"2026-08-03T14:01:50.133228Z","submitted_at":"2026-07-23T15:55:29Z","title":"Test-Time Scaling via Error Localization","version":2},"reference_index":173,"source":"arxiv_source","source_observed_at":"2026-08-01T07:28:35.893789Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2607.21453"},"observation_digest":"sha256:7f309aa547ee833344d6cb18fe677faf5f177516a2f763a08c4cbcb573699fd6","observation_id":"bf7d0bd4-da96-4800-b1c7-887d73d5295c","resolution":{"observed_at":"2026-08-01T07:28:35.893789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.10425/citation-record","integrity":"/paper/2305.10425/integrity","json":"/paper/2305.10425/citation-record.json","paper":"/paper/2305.10425"},"outbound":[],"paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 62 inbound Pith citation observations for arXiv:2305.10425."}