{"as_of":"2026-08-11T02:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b351c064780992a044be6b661b4ecb21485ea538b34f8bb149f3f016a614305","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T02:23:04.515705Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03453/citation-record","integrity":"/paper/2607.03453/integrity","json":"/paper/2607.03453/citation-record.json","paper":"/paper/2607.03453"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:c74a66ae5b1302af1d9a120d527e52108f0cf91a23818c70df7b9773e31a406a","observation_id":"5a74ed6f-69ce-4f4e-a5e3-db2bee7b03cc","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:008f5c507992b2a3c0c889e7277445206ab8256e9b222007ddfb3f219949eecc","observation_id":"dc19e9ab-fd1d-46fe-a0ad-8cc4fba1507e","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:93bcbcc0df64ad9f8de08384894f68c6ca815e91b9749d3fcbb18ec26357c953","observation_id":"c8800ae6-2397-4c46-ac03-50f126918545","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"doi: 10.18653/v1/2023.emnlp-main.968","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:32949f649373d05a29bacbd1ab5739fe1dc52839bcf4f4ead6b678d136db256f","observation_id":"bfca84cb-a071-4e4b-ae54-82470c9e7545","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Faria and N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:6035ce61f820db702465de48c70f2e7f97a7e424d9332043b8914d601ded0c6b","observation_id":"d0af021b-5d45-479f-b715-8439a842e434","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:d6a3ad82be4cc451d9de38df6ba0d5c19fdff90a6b307d23456c2876eeaea66a","observation_id":"aed56b67-0510-41cd-979d-9c2d8b6deeb1","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:a7897e84d913f795351e970dda104f00f35567ad3b7eec49309bb09944716749","observation_id":"a06d60dd-6d51-4b2d-a31b-eff2a21a7306","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"net/forum?id=QnjfkhrbYK","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:d315fd04b0fa438fe1787f2e55b0231011dc2214cd08e541822f2fc914bff1eb","observation_id":"d35d0cf5-0873-4c44-acb0-9449293e588c","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Khalaf, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:cd795fe81be9851edbad516d2d3cc88c161ab310a32fb96f35d8663076bf1db6","observation_id":"bab8cc30-f192-45ab-8170-bbd85401a040","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:3b6ca7e90a776e7c89474428795b45a8dac4e60d30c1397ea7bafc16236b8a41","observation_id":"08ae0c01-cea2-4452-afda-ac733a5a2c7d","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:b7f9b1cb20647a444c30166f1b86766a4e7e38b6d063f99642dd11e6620e00c9","observation_id":"6ebde266-3c58-4af8-b9f0-7bf5d1044370","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:fab4682c01c22beb15aaa053f3a5debd747cab8ad6ec4649eba1bcd325ab2712","observation_id":"1537785b-0ebd-47fc-b24d-117b7a13c1ff","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"URLhttps://aclanthology.org/2024.emnlp-main.35/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:6d3605efd52e73ee82af0d988551657804460cd0b856a38b8cb0aa690dbc3ddd","observation_id":"016b391d-e63b-48a5-84c4-9acf1a4d1b5a","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"net/forum?id=8p3fu56lKc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:43cf9be6b2897630620bf8beb30671033bddc05ffdc6e92d46aa5dabac54809b","observation_id":"68ef9b86-f3b7-4c6b-b3e2-2f9f7e5c4d29","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"doi: 10.18653/v1/ 2022.emnlp-main.759","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:aec3c348b9d920b949b108fbb5df03423f209c0e9a07d48390c7c022fa278e7c","observation_id":"8ad75384-dc42-4da1-a331-5b10b0308ca7","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Touvron, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:2ec002cbd3a18b7ca93a6b3a66b37e79c8451af7e1e2fd596fd261dce7e7e4c9","observation_id":"e38c4755-879b-4ce9-a9d8-2e90a38c2247","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Tunstall, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:f48458449022dbc791b4a39f0fdc3a928f7c5b01278498c8d416be79b347c1fb","observation_id":"7abb5149-8922-4aac-8963-aba86097a636","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03156","last_updated":"2025-05-06T04:03:11Z","snapshot_observed_at":"2026-08-07T15:56:09.223459Z","submitted_at":"2025-05-06T04:03:11Z","title":"Soft Best-of-n Sampling for Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03156","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2505.03156","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:bd01c4fceeb98dacacbf67a561d0c1048241df8e5a1ca932ec263b8fc6c70851","observation_id":"9ed9df29-4211-437d-97f5-2d7e42b33539","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:5af8fe21d2972bdc8bd71dc26dcddefceeb10be897321b68aafdf8baadffd133","observation_id":"8bd71a78-f4bb-4376-8f19-7c1b05fc6b36","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-08-10T22:45:29.185791Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"doi: 10.18653/v1/2024.findings-emnlp.620","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:bb686d72055c584cd677654d2e7c30dd4c848b5084595067e74ea1c00c57d1bf","observation_id":"bd6320cd-b181-435d-9f8f-c679da741b6a","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Step k:” labels are removed, and the “The answer is:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:7554be0aeb03a20a1a739be2edf2872c932aaf00c8791487de197b550857e62a","observation_id":"87bf07ae-4dfb-4ffb-96c3-00221038d096","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"It uses a smaller, fine-tuned Mistral-7B-Instruct-v0.2 model to classify whether a response refused or complied with a harmful request","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:139baec00181dd844f30babc77dbca2c6c797130aceab7b3bf8c462734c1553c","observation_id":"a48941b1-4689-4774-b13b-8745f9828f62","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"At one point, he spent 5 hours each for two consecutive weeks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:638a128e510930392e8946b5e3e2e5fa10eb7d58a0b43d6e3a9f74a7ffaef44e","observation_id":"23c6b696-f5cd-4039-9e21-fb85a84469ff","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"5.1,η= n n+d+1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:5135353cd0805b56268b764c54002b7f3a63a2c305040b40b2dc7f83aedb847a","observation_id":"49e6e79e-15d7-4618-a2db-d178c38e3676","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T11:45:45.620861Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2607.03453."}