{"as_of":"2026-08-09T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2751ce104723ff0b26f933b7c46ac4f4fe6f1cf3a2783e362807b43a1848075b","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:40:16.013589Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T05:01:31.560963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:05:23.205865Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"cited_work":{"arxiv_id":"2509.26169","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.26169","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2509.26169 , year=","venue":null,"work_id":"5341860e-5f26-42d2-9f2f-b76a5c52d4d2","year":null},"citing_paper":{"arxiv_id":"2605.23244","last_updated":"2026-05-22T05:25:00Z","snapshot_observed_at":"2026-08-01T14:10:27.190441Z","submitted_at":"2026-05-22T05:25:00Z","title":"Convex Optimization for Alignment and Preference Learning on a Single GPU","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-25T05:01:31.560963Z"},"links":{"cited_paper":"/paper/2509.26169","citing_paper":"/paper/2605.23244"},"observation_digest":"sha256:2d761a121a53df8727f8666cfa4b3ab53b8f8057d3f38b09e8ffb34d7448d83b","observation_id":"e64bf062-a3e1-4465-9d55-55a4176a46fb","resolution":{"observed_at":"2026-06-03T13:05:38.669402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.26169/citation-record","integrity":"/paper/2509.26169/integrity","json":"/paper/2509.26169/citation-record.json","paper":"/paper/2509.26169"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-04T13:40:15.147866Z","title":"Con- crete problems in ai safety.arXiv preprint arXiv:1606.06565,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.147866Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:e2b7fe57e25c2485c57c49bb7ad4cb0e3038b394c335a9e85c8c30e49f0b52a1","observation_id":"d316683d-ada4-4c43-8290-744f985fccad","resolution":{"observed_at":"2026-08-04T13:40:15.147866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-04T13:40:15.259926Z","title":"Kto: Model alignment as prospect theoretic optimization.arXiv preprint arXiv:2402.01306,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.259926Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:36d6db9c95a7e6002c797bc324dc4c195b8af75906a58501a80acad5e56d3e51","observation_id":"df4c1e42-9008-4fed-8370-14f77c46d3c3","resolution":{"observed_at":"2026-08-04T13:40:15.259926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:40:16.013589Z","title":"Google Nest Learning Thermostat","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:16.013589Z"},"links":{"citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:19885f605717df5f65b70f33bcd2a0798e5408881186422f46a72cf096721dd6","observation_id":"0d904953-7921-453f-8eab-5a346f6452e4","resolution":{"observed_at":"2026-08-04T13:40:16.013589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T13:40:15.564742Z","title":"Scaling laws for reward model overoptimization in direct align- ment algorithms.Advances in Neural Information Processing Systems, 37, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.564742Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:638c2109df72da07c98a6dfc8f5707478a950da89ede6892c758d5c427780642","observation_id":"7ef8deae-82ea-4b26-a27d-8172c8ca98cb","resolution":{"observed_at":"2026-08-04T13:40:15.564742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:40:15.637587Z","title":"Se- lective preference optimization via token-level reward function estimation.arXiv preprint arXiv:2408.13518,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.637587Z"},"links":{"citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:23d65668d79abf1bf08aae8c3290138f6bf57e163e3a6c3c8ef2021eb54de35d","observation_id":"64d56e6a-dd81-4671-a9c0-effce24de903","resolution":{"observed_at":"2026-08-04T13:40:15.637587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-04T13:40:15.787091Z","title":"Slic-hf: Sequence likelihood calibration with human feedback.arXiv preprint arXiv:2305.10425,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.787091Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:5fb249c5ef50a42ca9757bb5cc585aa872c042a62cb96d23a6eaf0bf39dea5ae","observation_id":"6d45353d-31f5-45da-842c-4dfe6de29502","resolution":{"observed_at":"2026-08-04T13:40:15.787091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-04T13:40:15.868294Z","title":"Fine-tuning language models from human preferences.arXiv preprint arXiv:1909.08593,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.868294Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:e256ea12095ae71d172280151f3aebe0a4e101623db890c4b0cc1ba9225b1fea","observation_id":"e77889db-73b4-4326-9fee-c156a82bd97c","resolution":{"observed_at":"2026-08-04T13:40:15.868294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:40:15.959617Z","title":"Table 3: Accuracy of the reward models trained on the different preference datasets","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.959617Z"},"links":{"citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:51b3ba883b2c566c5e6b994102e2bd80cba8b3580bac0131c9fbad0c8856949a","observation_id":"ba7d2237-8d97-4449-875b-680d12a10d05","resolution":{"observed_at":"2026-08-04T13:40:15.959617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:40:15.473298Z","title":"Contrastive decoding: Open-ended text generation as optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.473298Z"},"links":{"citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:c14b3f84b59cef12c6123e4bdb00829dcc5ef22a0d9793969706a5f0e93f9c25","observation_id":"13fbb65e-4c45-47fc-a849-db152d582a64","resolution":{"observed_at":"2026-08-04T13:40:15.473298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:40:15.309502Z","title":"Orpo: Monolithic preference optimization without refer- ence model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.309502Z"},"links":{"citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:81c4b514b6e59ab8df500d25c9aa8e503fc498abf718eabcebaed28c24a0f94d","observation_id":"971ecdf0-564c-4bb9-bb34-ffc2c90c8310","resolution":{"observed_at":"2026-08-04T13:40:15.309502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:40:15.431897Z","title":"Deal: Decoding-time alignment for large lan- guage models.arXiv preprint arXiv:2402.06147,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.431897Z"},"links":{"citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:d281f1b69432b310b38b6091a82496b59998bdf80791cdbee73878cf130d77a8","observation_id":"a51b33d3-29fc-441a-a105-3c8ae1b984a1","resolution":{"observed_at":"2026-08-04T13:40:15.431897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:40:15.533702Z","title":"Iterative reasoning preference optimization.Advances in Neural Information Processing Systems, 37,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.533702Z"},"links":{"citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:67aec13f4b9f9dfd13c2c1ade1c92b66872a226143be99e31a5d7a44e4c394d0","observation_id":"691482fb-79d5-4aa8-95bc-5eb99a055d16","resolution":{"observed_at":"2026-08-04T13:40:15.533702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:40:15.206137Z","title":"Reward-augmented decoding: Efficient controlled text generation with a unidirectional reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.206137Z"},"links":{"citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:1f8f9f58ef7758b268f68a33cf3aa53c6f22ad2d0247bc5a98eab90fea22fb07","observation_id":"1b70328b-7990-4f70-acbf-6973a9395ae5","resolution":{"observed_at":"2026-08-04T13:40:15.206137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:40:15.719591Z","title":"Inference-time alignment in continuous space.arXiv preprint arXiv:2505.20081,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.719591Z"},"links":{"citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:2706abdd3244000566317dce35dce4b14cd50b901866af473032b9676def1b39","observation_id":"d0025a5e-367b-4786-aaf3-5eb8a14f0b2b","resolution":{"observed_at":"2026-08-04T13:40:15.719591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:40:15.355726Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:15.355726Z"},"links":{"citing_paper":"/paper/2509.26169"},"observation_digest":"sha256:9412ff1488da0dde9e7bd530ef14c1d01c349e24cdfaf8cfe355a21ab6743611","observation_id":"fdfada74-1766-4c5c-833e-d55a4ae98e87","resolution":{"observed_at":"2026-08-04T13:40:15.355726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.26169","last_updated":"2026-06-02T16:44:25Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T17:00:22.361858Z","submitted_at":"2025-09-30T12:24:43Z","title":"Alignment-Aware Decoding"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 1 inbound Pith citation observation for arXiv:2509.26169."}