{"as_of":"2026-08-20T18:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8166a10545084a15becdfb44036b8f9033ca0205871af37ff7b9ce45c2240d6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:08:39.194910Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T23:08:36.882178Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.01054","last_updated":"2025-01-29T08:52:40Z","snapshot_observed_at":"2026-08-16T14:04:40.827140Z","submitted_at":"2024-04-01T11:26:50Z","title":"Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment","version":4},"cited_work":{"arxiv_id":"2404.01054","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01054","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b2dabf0c-a58d-4e0f-9fc5-314eb20bb663","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-08-17T10:18:05.650518Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2404.01054","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:27c541d9dd2f07dbda286ca171df8471951b98d10b683bf4c9c14a5ba2d0975c","observation_id":"cb7df4c2-e908-4bf5-9a24-4a4fb6cbb9b8","resolution":{"observed_at":"2026-05-11T23:08:36.889530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01054","last_updated":"2025-01-29T08:52:40Z","snapshot_observed_at":"2026-08-16T14:04:40.827140Z","submitted_at":"2024-04-01T11:26:50Z","title":"Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01054","snapshot_observed_at":"2026-08-06T23:03:54.337367Z","title":"Regularized best-of-n sampling with minimum bayes risk objective for language model alignment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19967","last_updated":"2025-06-24T19:31:03Z","snapshot_observed_at":"2026-08-17T19:31:44.217890Z","submitted_at":"2025-06-24T19:31:03Z","title":"Inference Scaled GraphRAG: Improving Multi Hop Question Answering on Knowledge Graphs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:03:54.337367Z"},"links":{"cited_paper":"/paper/2404.01054","citing_paper":"/paper/2506.19967"},"observation_digest":"sha256:bce0d747e5e042cf9c9c0686d5dc278ce7e814901abe0b58b9fe35e0366399c0","observation_id":"18beda7d-ee04-4a1c-814e-63e191cf3b4f","resolution":{"observed_at":"2026-08-06T23:03:54.337367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01054","last_updated":"2025-01-29T08:52:40Z","snapshot_observed_at":"2026-08-16T14:04:40.827140Z","submitted_at":"2024-04-01T11:26:50Z","title":"Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01054","snapshot_observed_at":"2026-08-06T22:42:45.504260Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20949","last_updated":"2025-06-26T02:28:58Z","snapshot_observed_at":"2026-08-16T07:35:00.342233Z","submitted_at":"2025-06-26T02:28:58Z","title":"Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:42:45.504260Z"},"links":{"cited_paper":"/paper/2404.01054","citing_paper":"/paper/2506.20949"},"observation_digest":"sha256:cdd92bef1b51abb36dc7d97e7dd1d03c2172e02b3e9774c6db89229e82a8b2fa","observation_id":"4051c944-daed-4b13-a9a3-2cc5c1914d22","resolution":{"observed_at":"2026-08-06T22:42:45.504260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01054","last_updated":"2025-01-29T08:52:40Z","snapshot_observed_at":"2026-08-16T14:04:40.827140Z","submitted_at":"2024-04-01T11:26:50Z","title":"Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01054","snapshot_observed_at":"2026-08-06T22:05:27.667048Z","title":"Jinnai, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22716","last_updated":"2025-06-28T01:52:50Z","snapshot_observed_at":"2026-08-14T16:20:26.515800Z","submitted_at":"2025-06-28T01:52:50Z","title":"BEST-Route: Adaptive LLM Routing with Test-Time Optimal Compute","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:05:27.667048Z"},"links":{"cited_paper":"/paper/2404.01054","citing_paper":"/paper/2506.22716"},"observation_digest":"sha256:f6a2d7d8de8eeb5e80a5ca5f4a491db3544a891c03f7b7e2280b59ebc6e5c297","observation_id":"78b88685-a8f4-4edc-bd62-785f86a1e35b","resolution":{"observed_at":"2026-08-06T22:05:27.667048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01054","last_updated":"2025-01-29T08:52:40Z","snapshot_observed_at":"2026-08-16T14:04:40.827140Z","submitted_at":"2024-04-01T11:26:50Z","title":"Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01054","snapshot_observed_at":"2026-08-15T16:08:39.194910Z","title":"Regularized best-of-n sampling to mitigate reward hacking for language model alignment.CoRR, abs/2404.01054, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-15T23:25:21.613036Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:08:39.194910Z"},"links":{"cited_paper":"/paper/2404.01054","citing_paper":"/paper/2509.08755"},"observation_digest":"sha256:f6f2e7341e1a4373c61a209bc608d8f69c06ba3ca6e84a9b34b69cc4eb0b7397","observation_id":"4a25a3e2-e9f6-4264-8b77-1bdda9d6d28e","resolution":{"observed_at":"2026-08-15T16:08:39.194910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01054","last_updated":"2025-01-29T08:52:40Z","snapshot_observed_at":"2026-08-16T14:04:40.827140Z","submitted_at":"2024-04-01T11:26:50Z","title":"Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01054","snapshot_observed_at":"2026-08-04T10:09:02.446650Z","title":"Regularized best-of-n sampling to mitigate reward hacking for language model alignment.arXiv:2404.01054,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-20T02:44:42.295509Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:02.446650Z"},"links":{"cited_paper":"/paper/2404.01054","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:2851742a5aaf7762b9e4a3d1067b3e83a58416a3c74bc568f4d3cbc8a0335a0a","observation_id":"90838d63-31a2-46c7-8a5a-8ebd41642d03","resolution":{"observed_at":"2026-08-04T10:09:02.446650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.01054/citation-record","integrity":"/paper/2404.01054/integrity","json":"/paper/2404.01054/citation-record.json","paper":"/paper/2404.01054"},"outbound":[],"paper":{"arxiv_id":"2404.01054","last_updated":"2025-01-29T08:52:40Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T14:04:40.827140Z","submitted_at":"2024-04-01T11:26:50Z","title":"Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2404.01054."}