{"as_of":"2026-08-08T02:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0bef7927ab150b70675ac04b84fabc50447d8e1e6419ae6322452cb62d17d577","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:02:25.808950Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T15:58:33.337226Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":"2401.01879","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":"89e29a37-f045-43dc-92d2-8054b57d49ba","year":2024},"citing_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:33.219451Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2505.15134"},"observation_digest":"sha256:a4a5507144c37e6ee1fc5cee654f6f09dbeca07a6711231994ad297d9c4b97d2","observation_id":"96409407-698f-46e4-94b8-aa6ec6c1c4d4","resolution":{"observed_at":"2026-05-18T15:58:33.341248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-07T06:02:25.808950Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06444","last_updated":"2025-07-09T07:47:59Z","snapshot_observed_at":"2026-08-07T05:54:20.449365Z","submitted_at":"2025-06-06T18:05:45Z","title":"Saffron-1: Safety Inference Scaling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.808950Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2506.06444"},"observation_digest":"sha256:4237eaa2f05dc182bda87e84dfe96ddffbf29e3d831c810d0c31e2aacb23d5a6","observation_id":"3d2422cc-5f7a-453c-9cf4-7df4670ccb21","resolution":{"observed_at":"2026-08-07T06:02:25.808950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-06T23:48:23.000632Z","title":"Ahmad Beirami, Alekh Agarwal, Jonathan Berant, Alexander D’Amour, Jacob Eisenstein, Chirag Nagpal, and Ananda Theertha Suresh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16043","last_updated":"2025-06-19T05:40:54Z","snapshot_observed_at":"2026-08-06T23:42:10.838423Z","submitted_at":"2025-06-19T05:40:54Z","title":"DynScaling: Efficient Verifier-free Inference Scaling via Dynamic and Integrated Sampling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:23.000632Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2506.16043"},"observation_digest":"sha256:9350ed4dd3bbf82c804fb7a85e0b5633ab37f3266e3165efb989b861763f9b89","observation_id":"a30c1c74-b806-4531-aeba-dff77327aa7d","resolution":{"observed_at":"2026-08-06T23:48:23.000632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-06T23:13:12.544731Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19882","last_updated":"2025-07-07T02:00:46Z","snapshot_observed_at":"2026-08-07T11:24:36.780605Z","submitted_at":"2025-06-24T02:19:30Z","title":"Position: Machine Learning Conferences Should Establish a \"Refutations and Critiques\" Track","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:13:12.544731Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2506.19882"},"observation_digest":"sha256:91abf8df4949f5046e625666f90da9cdf6e7b83052870b974aa73e0d6332b53a","observation_id":"f5934dc1-2b12-42c4-a29f-b80ac7716703","resolution":{"observed_at":"2026-08-06T23:13:12.544731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-06T15:26:19.894110Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-08T01:18:19.012196Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:19.894110Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:f9053d0f6fe48d47900ecf1db90499c43f0468f4ece372c90abd283637cb2d0c","observation_id":"9d527b4d-6f21-4db1-ba27-14c2408157a1","resolution":{"observed_at":"2026-08-06T15:26:19.894110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-05T12:27:27.267919Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-08T01:24:49.421052Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.267919Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:43d2d007e8f166c69542c178fcf79c596b0094c99bd4e669249adb69c6797b36","observation_id":"416f724d-3c68-4ef6-a538-9b84233ed729","resolution":{"observed_at":"2026-08-05T12:27:27.267919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-04T07:23:56.319781Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26219","last_updated":"2026-06-03T00:59:51Z","snapshot_observed_at":"2026-08-04T07:23:55.106713Z","submitted_at":"2025-10-30T07:52:14Z","title":"Test-time reward-guided alignment of language models by importance sampling on pre-logit space","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T07:23:56.319781Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2510.26219"},"observation_digest":"sha256:528fba9441a1749fa2ad7a7b7ebcdf449e06df582203e881f3661e9a25390b39","observation_id":"5ff8a040-ccd8-4a84-a400-f3953db445e1","resolution":{"observed_at":"2026-08-04T07:23:56.319781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":"2401.01879","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Theoretical guarantees on the best-of-n alignment policy","venue":null,"work_id":"89e29a37-f045-43dc-92d2-8054b57d49ba","year":2024},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-07-06T23:02:05.116649Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:23d34768fa99c96f8275cee356467d02b8b32911f6b2156fd764446c2b0a7c91","observation_id":"aecf7ed5-1411-470a-81e6-aec8b16c3cf2","resolution":{"observed_at":"2026-05-10T13:20:25.648729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2401.01879 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-02T20:53:24.751933Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:62714218ff09331b05494501291841ffbe6cff7ec8c12e96d9d4a935d0ea48a3","observation_id":"720b3ea0-fa45-4009-8487-9e6e6307be9d","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2401.01879 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:6fef5fc73fd6c8780d2ec3534052db2d316e7e9d33c36a24cbea663a799dd099","observation_id":"201b043a-7f93-4d8d-8517-d38a777d7b34","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01879","snapshot_observed_at":"2026-08-02T08:40:48.100649Z","title":"arXiv preprint arXiv:2401.01879 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:48.100649Z"},"links":{"cited_paper":"/paper/2401.01879","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:f6a3a1eef1dc7ca0e2e03ceb7694cb60a6e7e8cb1393ea1112d360ad164ea9fd","observation_id":"178e307c-b0ff-4a56-891f-cd2d77dc74dc","resolution":{"observed_at":"2026-08-02T08:40:48.100649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.01879/citation-record","integrity":"/paper/2401.01879/integrity","json":"/paper/2401.01879/citation-record.json","paper":"/paper/2401.01879"},"outbound":[],"paper":{"arxiv_id":"2401.01879","last_updated":"2025-05-29T01:30:18Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:11:55.623943Z","submitted_at":"2024-01-03T18:39:13Z","title":"Theoretical guarantees on the best-of-n alignment policy"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2401.01879."}