{"as_of":"2026-08-07T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eba0989ba529ac3e8ad0db720717a50a27c73d82ec9b9cd38321b009bf319ecc","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:57:56.794234Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:37.083838Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:17:30.651801Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"cited_work":{"arxiv_id":"2506.12446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12446","snapshot_observed_at":"2026-07-03T01:17:30.651801Z","title":"arXiv preprint arXiv:2506.12446 , year=","venue":null,"work_id":"717a313e-1c3f-46f5-8dc4-62e91acd42a6","year":null},"citing_paper":{"arxiv_id":"2606.09635","last_updated":"2026-06-08T15:33:13Z","snapshot_observed_at":"2026-08-02T03:20:14.810565Z","submitted_at":"2026-06-08T15:33:13Z","title":"Gradient-Guided Reward Optimization for Inference-time Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T16:43:04.984866Z"},"links":{"cited_paper":"/paper/2506.12446","citing_paper":"/paper/2606.09635"},"observation_digest":"sha256:0a4699cd29a8ee10814c8df2700792da51cf8095190e83d4d0fffe2db62fb87f","observation_id":"3b792169-b2d2-4d3e-9265-9f0db8bf8c72","resolution":{"observed_at":"2026-07-03T01:17:30.653219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12446","snapshot_observed_at":"2026-08-07T00:15:37.083838Z","title":"From outcomes to processes: Guiding prm learning from orm for inference-time alignment.arXiv preprint arXiv:2506.12446,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02694","last_updated":"2026-08-03T10:41:25Z","snapshot_observed_at":"2026-08-07T20:09:59.827524Z","submitted_at":"2026-08-03T10:41:25Z","title":"Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.083838Z"},"links":{"cited_paper":"/paper/2506.12446","citing_paper":"/paper/2608.02694"},"observation_digest":"sha256:131b7c53afcfa27aa340b61c6766f96a1228144a7424b54aff683cd968d1b83f","observation_id":"033c006d-117b-49b8-afbe-e84dce3a2697","resolution":{"observed_at":"2026-08-07T00:15:37.083838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12446/citation-record","integrity":"/paper/2506.12446/integrity","json":"/paper/2506.12446/citation-record.json","paper":"/paper/2506.12446"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:57:56.681605Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.681605Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:edec23f8f3e03dde497c8d36a5c15045692eb5aebed8063ad18fb2283d2f278c","observation_id":"4912a7b3-e65e-41ef-8303-80c8726670f7","resolution":{"observed_at":"2026-08-07T00:57:56.681605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T00:57:56.685536Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.685536Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:f27cceb346460ad313d71d8a0ed75d43ea7f423dae8d291ffa4f7d661118509b","observation_id":"36b19547-6eef-4627-ae27-4dcc131ed85a","resolution":{"observed_at":"2026-08-07T00:57:56.685536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.689287Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.689287Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:8c316abaecc0d65beccc03f354fa9a6cae1b1f521b53162f2d3a85003f683720","observation_id":"5a301271-6912-400a-b58d-7c8d8420db2b","resolution":{"observed_at":"2026-08-07T00:57:56.689287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20495","last_updated":"2024-05-30T21:36:12Z","snapshot_observed_at":"2026-07-06T18:23:01.681030Z","submitted_at":"2024-05-30T21:36:12Z","title":"Transfer Q Star: Principled Decoding for LLM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20495","snapshot_observed_at":"2026-08-07T00:57:56.692630Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.692630Z"},"links":{"cited_paper":"/paper/2405.20495","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:4fc191475863e359a7fe367d5c10fa8220ccb4fd1bc16d30325156bf0b8a1324","observation_id":"64b8a358-7d5d-46f4-b1bd-763f83fc57b1","resolution":{"observed_at":"2026-08-07T00:57:56.692630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T00:57:56.695734Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.695734Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:713d7abead4b3cb54361d4f1d255a6ff224be38f4e52a904ac7a3e958570fc6e","observation_id":"bd759edf-e7f4-41a2-b8c4-a9a8ed339231","resolution":{"observed_at":"2026-08-07T00:57:56.695734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.225505Z","title":null,"venue":null,"work_id":"6a0b9b77-7f16-46b2-821c-4cd0a441611d","year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.698732Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:528a7c2f6b2a0877e24e971690c64e57cfe27476665fc0d4cdf34c1735acc372","observation_id":"be50a20e-9127-4da4-90a6-8a96f6782934","resolution":{"observed_at":"2026-08-07T00:57:57.228881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.214695Z","title":null,"venue":null,"work_id":"4f6862df-078b-4d7f-b91d-db7ebc888092","year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.701902Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:8bf36dfc8f86a08f4f0d48bda7344381e1e4231ab2c036a3f1544c964194b59a","observation_id":"5ba7954f-67b5-4ade-a03c-f8e5177afea9","resolution":{"observed_at":"2026-08-07T00:57:57.218508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:57:56.704410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.704410Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:8ee466cdfd6304ef1ce74d69cf7b9e63e7c09b4d4764405c582e2d39e5154833","observation_id":"f4b0db48-f16d-4119-9208-e0a95dcea152","resolution":{"observed_at":"2026-08-07T00:57:56.704410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T00:57:56.707328Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.707328Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:f373ccd2859525dde4dd8c9acd24aeaddbac684cdfd9061db99ebf7e5eebf142","observation_id":"7c3de4f8-d9f8-4c1e-8feb-4f2346d6cdee","resolution":{"observed_at":"2026-08-07T00:57:56.707328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.204455Z","title":null,"venue":null,"work_id":"5f0c1769-2839-42c0-940b-9cabc0d6bbb7","year":2020},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.710065Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:239842849ce762ce24904cc4f5de400f11a81ce2f0d24cf940b38c9a988e01a2","observation_id":"f374665c-7c97-4133-b1d5-1da0c4d3329d","resolution":{"observed_at":"2026-08-07T00:57:57.207916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06639","last_updated":"2024-05-10T17:59:04Z","snapshot_observed_at":"2026-07-06T18:12:43.301678Z","submitted_at":"2024-05-10T17:59:04Z","title":"Value Augmented Sampling for Language Model Alignment and Personalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06639","snapshot_observed_at":"2026-08-07T00:57:56.712904Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.712904Z"},"links":{"cited_paper":"/paper/2405.06639","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:5dbe792b69cb1305fd6086316b0f92ef196ff10646a95ad208b7fba2d11acaeb","observation_id":"750e2506-feb8-4427-b82d-5e28a9a52517","resolution":{"observed_at":"2026-08-07T00:57:56.712904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.716070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.716070Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:84c7bb1a7a083197e4f5f8e9751d63db809697b97e4194631d229e64e472252e","observation_id":"ff29bdb1-8785-49a8-a405-a1467e673158","resolution":{"observed_at":"2026-08-07T00:57:56.716070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.194633Z","title":null,"venue":null,"work_id":"31f7c115-d125-41f7-9343-ec8fedaf7ab9","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.718781Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:a2b58d339cddda822a4a3ab8292af5d8a8800ad970b219612c37c64587a46fc5","observation_id":"30413e44-3eea-4f9f-99c3-37fa6e7a001b","resolution":{"observed_at":"2026-08-07T00:57:57.198063Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.184676Z","title":null,"venue":null,"work_id":"e4176810-3fb9-4219-a765-1b8616d15cc5","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.721421Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:710b43d4f313e2f947581a50a8decec9f1c41c854738b47364b3e81d37c7cb6b","observation_id":"2d75fb37-7379-41ef-9b21-9d795adc87fe","resolution":{"observed_at":"2026-08-07T00:57:57.188134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.174483Z","title":null,"venue":null,"work_id":"38cabc5c-de32-4b9e-8ae7-a7ca99bbe1f2","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.724342Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:baf3f40dd8602b35ff0e83dd67f0c1a6e1d934a09dba03340e9325448b6504e3","observation_id":"e2c5cddc-97b0-4acb-9b40-bb6750515811","resolution":{"observed_at":"2026-08-07T00:57:57.178228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T00:57:56.727160Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.727160Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:22dc98b3d78db25fe623f412fec3e92e0a0282775d07afe99bbd4076ea9e9999","observation_id":"d2fea9c8-b210-42d0-8d78-732189a2b6d3","resolution":{"observed_at":"2026-08-07T00:57:56.727160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02676","last_updated":"2023-10-18T07:11:12Z","snapshot_observed_at":"2026-08-04T10:05:48.268152Z","submitted_at":"2023-02-06T10:28:16Z","title":"Chain of Hindsight Aligns Language Models with Feedback","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02676","snapshot_observed_at":"2026-08-07T00:57:56.730028Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.730028Z"},"links":{"cited_paper":"/paper/2302.02676","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:c3a45b6c07d8bc9da70def6ab101b2bccb3301dc77ee431abed778195ee0d126","observation_id":"63beea3b-8356-4f0c-96e8-868abdd8ef81","resolution":{"observed_at":"2026-08-07T00:57:56.730028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.164526Z","title":null,"venue":null,"work_id":"5d4a9082-5430-4cb9-820c-169f36a41a21","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.733069Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:f2ce40607f911c5ac7d2f1e8427fbbf1da2e5e83bc4c60203ab33159b3983ba3","observation_id":"90b1afa9-5f82-4ca0-a092-fe93568fe61a","resolution":{"observed_at":"2026-08-07T00:57:57.168071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17022","last_updated":"2024-06-03T20:50:26Z","snapshot_observed_at":"2026-08-03T02:05:15.540884Z","submitted_at":"2023-10-25T22:00:05Z","title":"Controlled Decoding from Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17022","snapshot_observed_at":"2026-08-07T00:57:56.735807Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.735807Z"},"links":{"cited_paper":"/paper/2310.17022","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:7aeff3cbbc1d3f1baaa15279cbde536e31a853626204a582e3b9a2f70c8927ea","observation_id":"b034acf2-58e1-40be-b0af-8d389838d0e4","resolution":{"observed_at":"2026-08-07T00:57:56.735807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-07T00:57:56.738980Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.738980Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:efb24719751d99a355fc6334aa71389435c05fc3bfe8badfbb2a9237270df38e","observation_id":"1367ce34-8eba-4b7f-a077-1e9959661349","resolution":{"observed_at":"2026-08-07T00:57:56.738980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.742029Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.742029Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:e7f06a794ec0eff116aa24c2efcfae0c4b51474ef9690a5c6152c8b3d7a048fc","observation_id":"cd673f1c-19fe-4958-a75d-b6523f875956","resolution":{"observed_at":"2026-08-07T00:57:56.742029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.744661Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.744661Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:f68088a15f0068e12cfc1fbc18f80bff0e17acc7f172cde6eb471b52dbcf6f0e","observation_id":"922294fd-5611-495f-9001-32f2266d9f50","resolution":{"observed_at":"2026-08-07T00:57:56.744661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.747399Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.747399Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:39fa69ad0341b6863d696ba036abf7b8d0f6dea726b4b650107dd9bc739c6820","observation_id":"143a9fd4-240f-44aa-bc2f-f615c4e8db85","resolution":{"observed_at":"2026-08-07T00:57:56.747399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.750234Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.750234Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:a32bd0cc868a78eb6d21dd4faa1730efdde17b31570d6af7f0db29d095001b48","observation_id":"3199fd39-8f9e-45ef-ae6a-b68988faee9d","resolution":{"observed_at":"2026-08-07T00:57:56.750234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.127229Z","title":null,"venue":null,"work_id":"06c7eb16-6b7f-4341-bb6b-f504619b39cf","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.753004Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:f24743a54dd312e9ec75f2077d647d2e8c72afd2c788a680edbd96489a0c9aaa","observation_id":"a7787224-2806-4057-ac3b-82b765031810","resolution":{"observed_at":"2026-08-07T00:57:57.131045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T00:57:56.755879Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.755879Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:b0d4833eb5b6de8fba72eaaedd8415c9ee2e51ac318ec2c5ecebff6decca3be8","observation_id":"78ed9d1c-1e6c-47a6-8d80-cb1291d8bbef","resolution":{"observed_at":"2026-08-07T00:57:56.755879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.116168Z","title":null,"venue":null,"work_id":"d6a7d1d1-f6ed-44d1-952e-f86645a01ddb","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.758899Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:4087da6cdb6583e2bf015e33b55615291646dd9afe52359a569cf62228907cf4","observation_id":"62b97dd5-3282-43c5-8392-2a43316d5d4c","resolution":{"observed_at":"2026-08-07T00:57:57.119669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-07-06T15:57:57.167169Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-07T00:57:56.761990Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.761990Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:7afb81ee6e174dbd6f08faaa316c96babb10e8993a380d40ccd2097e97c7a79a","observation_id":"b835bba0-5dc3-49a4-a69b-fdd4e7ec0ca3","resolution":{"observed_at":"2026-08-07T00:57:56.761990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.104746Z","title":null,"venue":null,"work_id":"8eef77b4-088c-4ca7-880e-b3f8994e3f69","year":2025},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.764821Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:3c74edae6b1e41d0ad613c56250398e41e8b16568a02666fa7ce40749aae30c1","observation_id":"4e89d054-047c-48db-be8a-bd8991fc20d9","resolution":{"observed_at":"2026-08-07T00:57:57.109086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.094631Z","title":null,"venue":null,"work_id":"e4194b57-2fa2-4b81-b314-156df9020067","year":2025},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.767542Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:8a280f32f4ba475bdf8a1f76cb63be1844469bb4dabe73c272d8d969559a9ca2","observation_id":"ac75c50f-f1d4-4a42-9063-586384f48b1e","resolution":{"observed_at":"2026-08-07T00:57:57.097961Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08193","last_updated":"2025-07-15T00:32:25Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:58:24Z","title":"GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08193","snapshot_observed_at":"2026-08-07T00:57:56.770058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.770058Z"},"links":{"cited_paper":"/paper/2410.08193","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:2ea44e314e6a61907da67fc47247b21e4d081e1a579b5ba78699cd6ac5c548d4","observation_id":"affda21e-2a61-4a2e-a931-ae8f8241e175","resolution":{"observed_at":"2026-08-07T00:57:56.770058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.083392Z","title":"Inference-time alignment in continuous space","venue":null,"work_id":"15f8f78e-88d6-43f4-b046-486adfc0bbfa","year":2025},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.772720Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:b889b1388027808f9d3eed8359d37c6fd11764c80d5235dad7f30743c316c1e5","observation_id":"aca8fcc6-d181-4273-9fc6-653d0d315f8c","resolution":{"observed_at":"2026-08-07T00:57:57.087942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-07T18:08:01.409989Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-08-07T00:57:56.775426Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.775426Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:f72ef9943d571efb435d96b04e3b2bfbcfc0c78acc5d2465246ae8338fb1409e","observation_id":"71993794-c053-464e-aee0-5b8a05fd2004","resolution":{"observed_at":"2026-08-07T00:57:56.775426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03708","last_updated":"2024-08-17T13:39:13Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:35:26Z","title":"Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03708","snapshot_observed_at":"2026-08-07T00:57:56.778437Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.778437Z"},"links":{"cited_paper":"/paper/2310.03708","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:f8ebb0f4c79b843421689f4e49e9aafbd5a45f7421855017433252104a1ab710","observation_id":"1b4a77da-8cf0-4db5-ad51-48d485e998c6","resolution":{"observed_at":"2026-08-07T00:57:56.778437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:57.071370Z","title":null,"venue":null,"work_id":"a9621c6c-734a-4b6c-bc7e-95a12afe7ee6","year":2024},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.781278Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:2aed495f1554925db7c947f75cbc7df30f011eba7aa35a6cca5c0d0a42b6db77","observation_id":"f423252d-98fe-4eb1-b8ba-ddcb0c443197","resolution":{"observed_at":"2026-08-07T00:57:57.075895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T00:57:56.785108Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.785108Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:fe8647860ab6457bedc3649b0cca49734739cfd827c575ce2c7c7fd284e3dbba","observation_id":"5cdc6326-be2b-460e-bb3f-bacb141ca3a5","resolution":{"observed_at":"2026-08-07T00:57:56.785108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T00:57:56.788097Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.788097Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:69cf28a97bb619197365835653fe41c7f0f8a47cb55f1770e78649d18a10a9b1","observation_id":"a3988930-adf1-455e-8a44-bdacb97b37f9","resolution":{"observed_at":"2026-08-07T00:57:56.788097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.790928Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.790928Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:645b172dd5fb1937148da920125f916e81d3e3786b3d64dacd318395981bd5e9","observation_id":"89243b78-9e17-42f3-8ef2-3cb6b72e0e5b","resolution":{"observed_at":"2026-08-07T00:57:56.790928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:56.794234Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:56.794234Z"},"links":{"citing_paper":"/paper/2506.12446"},"observation_digest":"sha256:1146e587733cb89a1332aae6b44e1283e3ad7f3304b5a5032406cb352abcf659","observation_id":"abab279f-b4a8-4765-8e2c-21f35eb5758f","resolution":{"observed_at":"2026-08-07T00:57:56.794234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12446","last_updated":"2025-06-28T14:16:58Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T00:47:41.409376Z","submitted_at":"2025-06-14T10:58:38Z","title":"From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 2 inbound Pith citation observations for arXiv:2506.12446."}