{"as_of":"2026-08-09T16:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a27ba34c42981c2f967b2f2d384643c5db106d6b5bbc548972770101c0f5fce","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:22:38.305872Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04372/citation-record","integrity":"/paper/2509.04372/integrity","json":"/paper/2509.04372/citation-record.json","paper":"/paper/2509.04372"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:22:38.692301Z","title":"(2017).First-order methods in optimization","venue":null,"work_id":"472d0b14-3892-47a2-83e2-85b462c2bc40","year":2017},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.237900Z"},"links":{"citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:1a55c58cf20c74dc50cc956a6986b7cce1df4ec72a91169f84aa418bd41da608","observation_id":"cd3082b0-8c74-4f96-9715-d129ba5474e2","resolution":{"observed_at":"2026-08-05T10:22:38.695460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-05T10:22:38.242023Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.242023Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:5c9e08c71eda55f61e3eb638e6b7d5882a0a8d45bb3df734ae972c754dad9e12","observation_id":"c0a7c2e3-2b2c-4633-a31a-a452fca5ac6c","resolution":{"observed_at":"2026-08-05T10:22:38.242023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09000","last_updated":"2024-08-23T17:21:35Z","snapshot_observed_at":"2026-08-08T01:03:09.159790Z","submitted_at":"2024-08-16T20:00:55Z","title":"Classifier-Free Guidance is a Predictor-Corrector","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09000","snapshot_observed_at":"2026-08-05T10:22:38.246154Z","title":"and Nakkiran, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.246154Z"},"links":{"cited_paper":"/paper/2408.09000","citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:7c5f8dd145b24af62f696f5d7337b8cb44c7a61a3ae1ec3ab92af278c92c6bfe","observation_id":"2d7a47e9-e20b-47e4-a3af-42b94d32b2f8","resolution":{"observed_at":"2026-08-05T10:22:38.246154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:22:38.682867Z","title":null,"venue":null,"work_id":"38b1fcda-9b6f-4f7d-95e8-2611ba868946","year":1952},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.249522Z"},"links":{"citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:aed2f133abd84658ae625c3afa42c5314104c4a903e86091e591a3791a07fb61","observation_id":"f5316555-f017-4eb3-997b-825b26f673a9","resolution":{"observed_at":"2026-08-05T10:22:38.686324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T10:22:38.252791Z","title":"V., Ré, C., and Mirhoseini, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.252791Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:acf254f598ebf0520bd2bc6b4067b90c4dc18566468f61373382772c9e88edab","observation_id":"7cb71b9e-b355-49db-8a2a-5e754e480e46","resolution":{"observed_at":"2026-08-05T10:22:38.252791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:22:38.673354Z","title":null,"venue":null,"work_id":"9ad3e557-ed88-4752-b165-fec93dcaffc5","year":2021},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.256587Z"},"links":{"citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:2a3b388b63e5748a8fbbea25318e77cb13bdd325f3b821cc72a85b2cff3e7aa0","observation_id":"2bc5fd5c-f9d7-43fd-801f-395a9864940d","resolution":{"observed_at":"2026-08-05T10:22:38.676443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:22:38.662444Z","title":"and Nichol, A","venue":null,"work_id":"55beb597-1d71-4e06-88b0-f990c1f6bb4a","year":2021},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.259858Z"},"links":{"citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:19f1ca4c9b2958bcd7d68748c4d3a474c92274234dc186ef6b312c551f137bcd","observation_id":"d25f6725-d7f1-4125-aef6-f7c103f4a153","resolution":{"observed_at":"2026-08-05T10:22:38.665920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:22:38.652360Z","title":null,"venue":null,"work_id":"b0143ce9-f96f-445d-b9e8-e3d604822135","year":2023},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.262830Z"},"links":{"citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:050deaa49eea37a75f8e0149323953fb56ae34eff1baef7fd2552c0c1e7bd064","observation_id":"52fd0fb8-f6fb-40c0-8e73-058ed5d255e2","resolution":{"observed_at":"2026-08-05T10:22:38.655548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04832","last_updated":"2025-08-10T14:23:13Z","snapshot_observed_at":"2026-08-09T09:19:48.529688Z","submitted_at":"2024-09-07T13:55:45Z","title":"Reward-Directed Score-Based Diffusion Models via q-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04832","snapshot_observed_at":"2026-08-05T10:22:38.265706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.265706Z"},"links":{"cited_paper":"/paper/2409.04832","citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:309bc00914248b31894bd250d1cdfd0b593c8d9c556e5b16d4b935286e1a9307","observation_id":"87b7f893-9cbd-424d-822b-08be91ae1a17","resolution":{"observed_at":"2026-08-05T10:22:38.265706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:22:38.642430Z","title":"and Salimans, T","venue":null,"work_id":"18ea1ea4-c065-401c-8ff2-befb2ce1d830","year":2021},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.269327Z"},"links":{"citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:823b736e2e1b8381bd579adb67e8d893e66661efd62e7006e350d10121c1cc1b","observation_id":"85aa4d1d-64c5-48f1-a16c-1f46a4dd569d","resolution":{"observed_at":"2026-08-05T10:22:38.645855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:22:38.631603Z","title":"and Martin, J","venue":null,"work_id":"21265a72-e4e9-442d-97c7-b27d965ef937","year":2025},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.272663Z"},"links":{"citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:e3ff583a9aa20ec61c6f02700c8297be5e2552682de81456b4ec20e04e5669dd","observation_id":"a6e5b84c-2ae1-426f-a044-fad4ddd19f8a","resolution":{"observed_at":"2026-08-05T10:22:38.635292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05612","last_updated":"2024-05-28T23:56:14Z","snapshot_observed_at":"2026-07-06T17:41:47.331991Z","submitted_at":"2024-03-08T18:28:13Z","title":"Unfamiliar Finetuning Examples Control How Language Models Hallucinate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05612","snapshot_observed_at":"2026-08-05T10:22:38.275970Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.275970Z"},"links":{"cited_paper":"/paper/2403.05612","citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:8df704dcb90d0e7d2da328372b1d019f4026730f5cf189fb6527d8a4d7082114","observation_id":"cb943ee2-cf26-40a3-b4b8-b7879a812195","resolution":{"observed_at":"2026-08-05T10:22:38.275970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:22:38.279540Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.279540Z"},"links":{"citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:b9ecee911fd5640d7f355dfda1ffc7be3c1c0f5bcaae50160767d327b161d9ff","observation_id":"f72b04ac-3d8e-4a12-99b1-9aa8f46544ba","resolution":{"observed_at":"2026-08-05T10:22:38.279540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:22:38.282693Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.282693Z"},"links":{"citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:63dd12851b5e0c088faab53b84f74f3090ad4bd8053611599c2d152b14e16f71","observation_id":"4add29e6-a4f2-4a2b-bfaf-c9620c485b75","resolution":{"observed_at":"2026-08-05T10:22:38.282693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16765","last_updated":"2024-08-29T17:59:07Z","snapshot_observed_at":"2026-07-06T19:07:50.782209Z","submitted_at":"2024-08-29T17:59:07Z","title":"A Score-Based Density Formula, with Applications in Diffusion Generative Models","version":1},"cited_work":{"arxiv_id":"2408.16765","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16765","snapshot_observed_at":"2026-08-05T10:22:38.394801Z","title":"A Score-Based Density Formula, with Applications in Diffusion Generative Models","venue":"cs.LG","work_id":"058f5744-af28-43cb-8891-2edcfc3b301f","year":2024},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.285588Z"},"links":{"cited_paper":"/paper/2408.16765","citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:c46094a55de47c4a92d3e01fd0c11d269f70c3722f322fb68729d2f3f3e408dd","observation_id":"22f5eaa6-73ef-45f9-8a11-9d7b3ef3a84d","resolution":{"observed_at":"2026-08-05T10:22:38.401166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-05T10:22:38.289020Z","title":"L., Fei-Fei, L., Hajishirzi, H., Zettlemoyer, L., Liang, P., Candès, E., and Hashimoto, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.289020Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:2d9b999bce4e5a91f56520a2a186d26eac79cad53eb90e098946062982ee2a49","observation_id":"30c8b382-262b-445b-bdfe-55857c7d060b","resolution":{"observed_at":"2026-08-05T10:22:38.289020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:22:38.621062Z","title":null,"venue":null,"work_id":"53105eee-9bc1-46a6-88fa-beb30c8ef6e2","year":2022},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.292172Z"},"links":{"citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:2b3f0042650229cdd8c3e3448499e4f0b46476a30f46ed4daef5bceb2f46fe76","observation_id":"205eccfc-630f-4c06-9fda-1d0ef19f56d4","resolution":{"observed_at":"2026-08-05T10:22:38.624367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T10:22:38.294929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.294929Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:1be0dfb337e93ffe571b8d82cc17bac347ef6bcd3fa2e7a1bbd413f0e2387335","observation_id":"816f2ba0-a9dc-4797-a14e-7bedb121976a","resolution":{"observed_at":"2026-08-05T10:22:38.294929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03156","last_updated":"2025-05-06T04:03:11Z","snapshot_observed_at":"2026-08-07T15:56:09.223459Z","submitted_at":"2025-05-06T04:03:11Z","title":"Soft Best-of-n Sampling for Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03156","snapshot_observed_at":"2026-08-05T10:22:38.298599Z","title":"M., Oesterling, A., Lakkaraju, H., and Calmon, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.298599Z"},"links":{"cited_paper":"/paper/2505.03156","citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:45a1ac534f82b24f60304bbe7ba3449266719377ce50436c381d5d8181737e75","observation_id":"b4018f26-4601-459e-a03d-bbf657a72bf4","resolution":{"observed_at":"2026-08-05T10:22:38.298599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-05T10:22:38.301973Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.301973Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:1866355f20e64dd150c6fad2745496b050f98a4f296490e1ec670fd66bd2f9f6","observation_id":"54f756f7-d16c-4324-b4af-d85ed1f561e5","resolution":{"observed_at":"2026-08-05T10:22:38.301973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-05T10:22:38.305872Z","title":"M., Stiennon, N., Wu, J., Brown, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:22:38.305872Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2509.04372"},"observation_digest":"sha256:4111cf92c52142d09f182ff97af6a11b0e335e3d095999f53af12bf69dde833b","observation_id":"9b663c7f-160e-49b9-bad5-fbae983d3217","resolution":{"observed_at":"2026-08-05T10:22:38.305872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04372","last_updated":"2025-09-04T16:29:38Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-09T15:27:30.102829Z","submitted_at":"2025-09-04T16:29:38Z","title":"Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2509.04372."}