{"as_of":"2026-08-08T17:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88f143672c2832e04763f502e203edffb9c36d2228b7b00eb4c9e03245a27835","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:42:27.675920Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18065/citation-record","integrity":"/paper/2505.18065/integrity","json":"/paper/2505.18065/citation-record.json","paper":"/paper/2505.18065"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:33.301869Z","title":"Le, and Denny Zhou","venue":null,"work_id":"581d2a3c-978e-4b03-89b9-0f54ee08386d","year":2022},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:24.081236Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:8443bef624a13f15ce8e97fbd8463d1906cdb3041f4a767f1d26953144645de6","observation_id":"3d07cc6f-051c-4d59-b313-62ffd2c6aba3","resolution":{"observed_at":"2026-08-07T14:42:33.454821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.152490Z","title":"Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:24.152490Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:427e2176ad732dffcba8e96f4ae0d2fa25ab883379ee83ccbaa2a14f1ed84d6e","observation_id":"05fdb4ef-c227-4761-88b5-7b958e0d5059","resolution":{"observed_at":"2026-08-07T14:42:24.152490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:33.021487Z","title":"Griffiths, Yuan Cao, and Karthik R","venue":null,"work_id":"ca94db49-829b-45fb-a4fe-8d4cedfc2bb2","year":2023},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:24.250753Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:3f16beaaee8641c69f52c1435010c88485f836b1242f55671ae3f638aeee2cce","observation_id":"727b13c4-1c25-4be9-9086-42328e456b6d","resolution":{"observed_at":"2026-08-07T14:42:33.163810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:32.845079Z","title":"Learning to reason with llms","venue":null,"work_id":"ebf0050c-66d4-4232-bc3a-4855e0cdc845","year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:24.362104Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:ab6a53128414c8686639daba09424d0288c34480cd61c2f50d3acfe0a08d7af3","observation_id":"18a474a5-bc81-4dc5-9c91-06cbda94bfb9","resolution":{"observed_at":"2026-08-07T14:42:32.923839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.426613Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:24.426613Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:b16fa82295d4e383418495e43649781b9a41a640b25f6c413df4f5bfdc93a848","observation_id":"c3a4d3ef-8136-4f88-b5b5-ae8006654fbf","resolution":{"observed_at":"2026-08-07T14:42:24.426613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:32.628937Z","title":null,"venue":null,"work_id":"22e6941a-74a1-4193-8f98-477fe981a937","year":2025},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:24.534100Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:90f3acd5f7b7a7b3fe7e4729f115f0b1e08a8aa8b92f5037c135ca4f15e0a684","observation_id":"13428347-59ee-4da7-aba4-b08a2574e3ff","resolution":{"observed_at":"2026-08-07T14:42:32.681900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:32.550029Z","title":"Scaling LLM Test-Time Compute Optimally Can be More Effective than Scaling Parameters for Reasoning","venue":null,"work_id":"e0bba643-206b-49c1-a374-ef9e151c58cc","year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:24.600772Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:1ae324319b02b1bdbac731c770a9383df3e40606561e295b32e38d2a43685a9e","observation_id":"a0dfc639-8053-4ea3-b46b-f059cd7739c1","resolution":{"observed_at":"2026-08-07T14:42:32.593348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:32.439211Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling, February 2025","venue":null,"work_id":"e7aeb678-b3f9-40dd-ba23-a9dcc3674f2d","year":2025},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:24.687363Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:4c441d991844acc4f2d32d4e5fee9363068d0d6971ecdcb74230594ac735b75b","observation_id":"6ecda57c-0ee5-49bb-b990-d2760e9246bb","resolution":{"observed_at":"2026-08-07T14:42:32.491605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:31.888188Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for LLM Problem-Solving","venue":null,"work_id":"6e6d1035-d737-495b-be79-740e6aafba28","year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:24.806743Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:4899ad2bc49f9283dd1e9c020fa7be11a8464447a90fda1b3ce36b3ec12feec9","observation_id":"fc930b81-756e-43f1-ab68-5a3c5057776d","resolution":{"observed_at":"2026-08-07T14:42:32.372697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:31.250301Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":"4a91e916-8fe2-4450-909e-e38bffd5c7c6","year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:24.911167Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:fbb8226324517c276ccfd4bcc098b550e38f290f98d45bd775c1a36d735b0e44","observation_id":"8d6b8157-deac-40a5-9ae5-9e66c590011a","resolution":{"observed_at":"2026-08-07T14:42:31.491532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:30.802032Z","title":null,"venue":null,"work_id":"75024fcc-870e-46fc-852c-e66cfb8cd512","year":2025},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:24.986744Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:b8663fda5077aa52bc826d2848bbeb733acb98d382080e2edfdf4bb0576955f2","observation_id":"22167700-eacc-421b-b6dd-ad8d092ee810","resolution":{"observed_at":"2026-08-07T14:42:30.980423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:30.623727Z","title":"Let’s Verify Step by Step, May 2023","venue":null,"work_id":"f97b034c-3f1c-45fa-a7c0-cff6c1d41361","year":2023},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:25.116168Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:6b2d667e7214c400846d7272c13a4335a80ceaedfe1911e64a2ba71b683d1fa2","observation_id":"4d3043e1-1d95-4555-9bfe-6683a1065dcb","resolution":{"observed_at":"2026-08-07T14:42:30.665499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:30.495391Z","title":null,"venue":null,"work_id":"bbdb7d43-d6c7-43f1-bcb9-661a1fe3c8a4","year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:25.192718Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:0728f1b244a65a3e7404939677f4d7100470914dcf9d1f7f43535ce2ade6d952","observation_id":"c38bed93-daca-4fd4-b267-9bb599ca8ab4","resolution":{"observed_at":"2026-08-07T14:42:30.551034Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:25.297848Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:25.297848Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:5ba04231093b6abb84e60fc501eecff70a3100e69d7602140f1cbceb6e3e60a2","observation_id":"5a24e95c-eec4-45e1-bb29-4a6f6118c9f5","resolution":{"observed_at":"2026-08-07T14:42:25.297848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:30.301894Z","title":"AIME 2024","venue":null,"work_id":"6f011350-4366-477f-936c-e2caf876ec82","year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:25.365975Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:727d1d7e94b80e059e809f6c27b811f17b6bcd215ae6c36c998dcb66abc9d815","observation_id":"0f2507de-19be-4ef7-bfb3-b53c6b5ec71e","resolution":{"observed_at":"2026-08-07T14:42:30.371400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:42:25.458387Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:25.458387Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:ec5242360b9cf6999c5ef95cf9bd63cb2077550beb1db38e3defa995a8722e1a","observation_id":"ed7f689d-b065-4e0f-b891-59a0eedcc988","resolution":{"observed_at":"2026-08-07T14:42:25.458387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:42:25.571342Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:25.571342Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:86a103d019f8a6758bb886c57f29d18f0783ecec2ab2455dca1705bb2d09964a","observation_id":"12682f0f-c37d-4d95-9637-82eaa88d51f1","resolution":{"observed_at":"2026-08-07T14:42:25.571342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:30.209688Z","title":"Llama 3 to connect 2024: Vision, edge, and mobile devices.https://ai.meta.com/ blog/llama-3-2-connect-2024-vision-edge-mobile-devices/ , 2024","venue":null,"work_id":"8a87c144-3546-4108-9e11-61cedead1a1c","year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:25.638982Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:c602b244995dcbf86709a2100bb468abe5f8884a99139079ea60ab5b22ba393e","observation_id":"97dcf570-6c88-4f66-abed-e1c38a9228d1","resolution":{"observed_at":"2026-08-07T14:42:30.257185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:30.090720Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning, January 2025","venue":null,"work_id":"51ec7dd3-25d8-4485-a7e5-6632ad20d970","year":2025},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:25.709602Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:c0fd1f456be9e6cb2a991977680c043f5dfcbf39f5aa82cbd63a0dc3fce8b5ba","observation_id":"111de10c-420a-4d6e-bf88-52694d5cc6c8","resolution":{"observed_at":"2026-08-07T14:42:30.155577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-07T14:42:25.802972Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:25.802972Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:a313403b1473908b40c8fb53518a7bf351ebd7c3ae8c23de293c558b474b6447","observation_id":"5bfd9ae4-d6fb-48ab-9074-776f40b33358","resolution":{"observed_at":"2026-08-07T14:42:25.802972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:29.946171Z","title":"Skywork-o1 open series","venue":null,"work_id":"4faa20eb-b48a-4e24-af31-b77757eb8973","year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:25.912177Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:b25446061ae9e843bc757db4208786abb30c94bc910be345391c09b62228e24e","observation_id":"9b4d4216-0c01-49c7-bc2e-deb80b3ec527","resolution":{"observed_at":"2026-08-07T14:42:29.991155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:29.850163Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models, April 2025","venue":null,"work_id":"7e89c34d-38d9-4c8c-9aad-f7e6ddc15b97","year":2025},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.045623Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:d4d3ab8058eee3d429becb69b0ce821d3e1fc31fe178ca752a28c0916fdf5f6a","observation_id":"63e3dcf3-98ff-48b8-b892-fd046de0b922","resolution":{"observed_at":"2026-08-07T14:42:29.885755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:29.726120Z","title":"Self- Refine: Iterative Refinement with Self-Feedback","venue":null,"work_id":"22e138d5-59e2-4fe5-9500-83dce71858d4","year":2023},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.134417Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:f29229d961e54f4f2f5b2c8620fb78e3391f872f77942bf09d07fcd12aa0f892","observation_id":"b298c93a-8765-4701-b57a-9268218fcdb4","resolution":{"observed_at":"2026-08-07T14:42:29.779220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-07-06T13:19:58.934755Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-07T14:42:26.240819Z","title":"Self-critiquing models for assisting human evaluators.arXiv preprint arXiv:2206.05802, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.240819Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:cf36ff7ee74ec4f1792afb33895f749fd8d9f0bed391322b55dea9f24827fda6","observation_id":"79eae5de-7d27-441b-9245-a15d3ef2d0c8","resolution":{"observed_at":"2026-08-07T14:42:26.240819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:29.590169Z","title":null,"venue":null,"work_id":"3d4278f5-168f-4769-8de6-8b377c969145","year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.313976Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:daa4aedf7a16b7ba7ff2bbe2a175ca8f890d539dc80078eb7d061eef4a1ea2da","observation_id":"4ab4ba77-f6a9-464a-a491-97db88620f98","resolution":{"observed_at":"2026-08-07T14:42:29.651910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:29.472674Z","title":"Algorithm of Thoughts: Enhancing Exploration of Ideas in Large Language Models","venue":null,"work_id":"5e5317a2-b986-4cd3-aaa9-29b8ca96e098","year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.414898Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:868c11520e8098576fafe3b00331017300175f2b2536d9b78cae2439994b85a6","observation_id":"d1580805-140a-400e-af05-3e50ae1c20c2","resolution":{"observed_at":"2026-08-07T14:42:29.538636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:29.322825Z","title":"Automatic Chain of Thought Prompting in Large Language Models, October 2022","venue":null,"work_id":"6e0c746d-3112-4f4d-831e-4500469ab564","year":2022},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.484880Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:f765c065487a5a995c7c3212fcb862f8a6fbf097a118403f1fefa7bc2d0da25c","observation_id":"23457b43-4bf6-4ab9-986a-95249c5d837d","resolution":{"observed_at":"2026-08-07T14:42:29.403676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:29.176164Z","title":"Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":"7dc3657a-085b-4b3e-a678-a9b19f931d2e","year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.586366Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:282683a6292d464282123d5e2fd804435e6c80049b9debf6337837a59a37e598","observation_id":"3e53c68c-5b28-483c-8688-904cf476686a","resolution":{"observed_at":"2026-08-07T14:42:29.235347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T14:42:26.655098Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.655098Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:5de0324c9443c1704837f61b7c6c8c654aff4fdf3d1f777db2217d92fff8d955","observation_id":"80aeda13-4e57-474a-830d-9b7989e22c95","resolution":{"observed_at":"2026-08-07T14:42:26.655098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:28.981196Z","title":"Self-Evaluation Guided Beam Search for Reasoning, October 2023","venue":null,"work_id":"3777fe00-0f6e-4c51-8f5a-78ab7bde3b21","year":2023},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.752346Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:5b66c31126c220ccdae70c22cf066f0d46a87eb9bbd93c24e1c3413a49d65891","observation_id":"3f49e629-983f-402e-8de3-c6bd1a6974a4","resolution":{"observed_at":"2026-08-07T14:42:29.066930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:28.797943Z","title":"Le, Ed H","venue":null,"work_id":"062c8b02-34d8-49c3-bd8c-258276876df6","year":2022},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.821415Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:3c1b8cd2c1facfe41b2446e91bd6c58752cb165ec0eb22b57258f3edcd496e58","observation_id":"5989dbf9-6351-427a-96f7-a2b83417e589","resolution":{"observed_at":"2026-08-07T14:42:28.888280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:28.623995Z","title":"Sparsity-aware generalization theory for deep neural networks","venue":null,"work_id":"af68dd02-f070-4ead-ab8c-9c21d83523c9","year":2023},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.878196Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:c1fb8ce54b698678021438d77041bdd7e1271940ffb04060b511a744ed105990","observation_id":"0f63f736-7ba2-4871-bd45-e37bdb4fc507","resolution":{"observed_at":"2026-08-07T14:42:28.710906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:28.474801Z","title":"Pac-bayes compression bounds so tight that they can explain generalization","venue":null,"work_id":"938ceb95-b4ac-4b3d-a9ce-172181a7dd48","year":2022},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.941110Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:a1e3ff1e8a777b7c1c637bad7d1f01d94bad5d7b06ee8dee2ee9f9e772320ef6","observation_id":"bcd5bd05-065f-458f-8156-47c1acb6cf61","resolution":{"observed_at":"2026-08-07T14:42:28.529245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:26.981219Z","title":"Efficient content-based sparse attention with routing transformers.Transactions of the Association for Computational Linguistics, 9:53–68, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.981219Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:3b0d2fbbcfa7cbc533038f509155208e04def1cc087f3bc92c2c920bc771b4e7","observation_id":"4310f865-1e8a-40e8-8302-6476b744c6a7","resolution":{"observed_at":"2026-08-07T14:42:26.981219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-07T20:59:29.819833Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-07T14:42:27.030634Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention.arXiv preprint arXiv:2407.02490, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.030634Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:a5c4ac5fd601b908c4e97fd55284e76175e1415150af6c2065ce2d3da25b2af9","observation_id":"aeec097a-a6a7-4685-b0a1-af1c8d334661","resolution":{"observed_at":"2026-08-07T14:42:27.030634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:27.086932Z","title":"Policy gradient meth- ods for reinforcement learning with function approximation.Advances in neural information processing systems, 12, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.086932Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:87fdfea4cf22807712f05a0eab7dbb03fae3781e34122b100bdcb6bc6a9a0ee2","observation_id":"ae4a9032-b346-4db8-893c-4db624af8ef8","resolution":{"observed_at":"2026-08-07T14:42:27.086932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:27.135988Z","title":"Pac-bayesian model averaging","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.135988Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:b3f95a1cfb750c802024628b4b9955bb2258c6b7e595bedbf0ec828a9aed16e5","observation_id":"8ab56fe0-8d44-4325-bf39-5dde9dc87c86","resolution":{"observed_at":"2026-08-07T14:42:27.135988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:28.296144Z","title":"Pac-bayesian generalisation error bounds for gaussian process classification","venue":null,"work_id":"0939810c-05a5-4c29-a557-becadae1e887","year":2002},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.172308Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:3846f2338e654a70c6f70ac086f0aee868066f74b07e5b923a37537f223107bd","observation_id":"908e7d2b-f6af-4cf3-ae26-283ddea24f6a","resolution":{"observed_at":"2026-08-07T14:42:28.359430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:42:27.222407Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.222407Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:d543b498cbf74a627652a3fbb9566d7645b84fd9df26d0889d57fe87ddddb41f","observation_id":"bd957e38-9971-47c0-9ac3-95acd361c0e5","resolution":{"observed_at":"2026-08-07T14:42:27.222407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:27.263006Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.263006Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:561e18dab02a8400006ac201f83a4ad56f3ca1d392f83cdc9c12d16346d12b13","observation_id":"88c52a6c-370f-4d0c-8894-c2d94f5e85d4","resolution":{"observed_at":"2026-08-07T14:42:27.263006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11694","last_updated":"2024-12-31T01:38:12Z","snapshot_observed_at":"2026-07-06T19:52:03.121993Z","submitted_at":"2024-11-18T16:15:17Z","title":"Enhancing LLM Reasoning with Reward-guided Tree Search","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11694","snapshot_observed_at":"2026-08-07T14:42:27.309575Z","title":"Technical report: Enhancing llm reasoning with reward-guided tree search.arXiv preprint arXiv:2411.11694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.309575Z"},"links":{"cited_paper":"/paper/2411.11694","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:f7ed2663d942ac3513c08df6f62e762c73841a258e6cf505b54f6863c4097cdd","observation_id":"f9b003d7-32fe-4b32-ab05-8497d578fab5","resolution":{"observed_at":"2026-08-07T14:42:27.309575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00320","last_updated":"2024-06-29T05:14:04Z","snapshot_observed_at":"2026-08-06T10:09:18.664387Z","submitted_at":"2024-06-29T05:14:04Z","title":"LiteSearch: Efficacious Tree Search for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00320","snapshot_observed_at":"2026-08-07T14:42:27.388786Z","title":"Litesearch: Efficacious tree search for llm.arXiv preprint arXiv:2407.00320, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.388786Z"},"links":{"cited_paper":"/paper/2407.00320","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:344589102752d87bbf013f6ceda6e8de96ef9f8821fe8e22defb7bb865f4c972","observation_id":"ff489b9b-8686-4b99-929b-ebd174b217a5","resolution":{"observed_at":"2026-08-07T14:42:27.388786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03553","last_updated":"2024-09-27T08:16:28Z","snapshot_observed_at":"2026-08-08T14:49:36.757543Z","submitted_at":"2024-05-06T15:20:30Z","title":"AlphaMath Almost Zero: Process Supervision without Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03553","snapshot_observed_at":"2026-08-07T14:42:27.432302Z","title":"Alphamath almost zero: process supervision without process.arXiv preprint arXiv:2405.03553, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.432302Z"},"links":{"cited_paper":"/paper/2405.03553","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:40d6efbf8f638f44e7fd0cb72a60f743444241dd5b6653522eeb79ca75eb7049","observation_id":"5deda4ba-41c6-44cd-8c92-812854e08f0d","resolution":{"observed_at":"2026-08-07T14:42:27.432302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-07-06T18:08:09.361079Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-07T14:42:27.461851Z","title":"Monte carlo tree search boosts reasoning via iterative preference learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.461851Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:e11a546cad30a8b8b1a6bff96a2f574f48cf83c294a97ca8068c79649bbbb623","observation_id":"b0e8a27f-7ab7-4583-9ee6-bbe4a596520d","resolution":{"observed_at":"2026-08-07T14:42:27.461851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:27.488154Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions.Hugging Face repository, 13:9, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.488154Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:d7d2542af7916deee2f11345af2130f5d307ef666135cd2c97d65a61a4122eb0","observation_id":"4ded9f65-0ab6-491b-815f-f82eeb5b2c6c","resolution":{"observed_at":"2026-08-07T14:42:27.488154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02884","last_updated":"2024-11-21T07:07:59Z","snapshot_observed_at":"2026-08-07T12:03:21.367108Z","submitted_at":"2024-10-03T18:12:29Z","title":"LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02884","snapshot_observed_at":"2026-08-07T14:42:27.539519Z","title":"Llama-berry: Pairwise optimization for o1-like olympiad-level mathematical reasoning.arXiv preprint arXiv:2410.02884, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.539519Z"},"links":{"cited_paper":"/paper/2410.02884","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:bf74693fcca3727b68388573c745ace7c9cdafc0d9f09d1d878d2e5c20e98971","observation_id":"b23991e7-dce8-4463-9a82-445e0a635091","resolution":{"observed_at":"2026-08-07T14:42:27.539519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-07T14:42:27.571108Z","title":"Accessing gpt-4 level mathematical olympiad solutions via monte carlo tree self-refine with llama-3 8b.arXiv preprint arXiv:2406.07394, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.571108Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:40894af750139df0b28d6bd9e1c47acc1fa5c660da707426ed90a8fbb7c1ffe2","observation_id":"534d5fd5-3165-403d-b888-4f26d9ddf483","resolution":{"observed_at":"2026-08-07T14:42:27.571108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03226","last_updated":"2025-02-17T06:27:16Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2025-01-06T18:59:13Z","title":"BoostStep: Boosting mathematical capability of Large Language Models via improved single-step reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03226","snapshot_observed_at":"2026-08-07T14:42:27.601318Z","title":"Booststep: Boosting mathematical capability of large language models via improved single-step reasoning.arXiv preprint arXiv:2501.03226, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.601318Z"},"links":{"cited_paper":"/paper/2501.03226","citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:371cf1ebc702497a91f1677189745b4ff3e329b74c89fa444591fa9d1a44ece3","observation_id":"55695bc1-c234-4fde-aef1-1f7a950991d9","resolution":{"observed_at":"2026-08-07T14:42:27.601318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3384.7184","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:27.845080Z","title":"Subtracting from 1 yields the bound Equation 6","venue":null,"work_id":"0fe00f3e-b393-41b0-ac78-a4663d60cf9d","year":null},"citing_paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:27.675920Z"},"links":{"citing_paper":"/paper/2505.18065"},"observation_digest":"sha256:106966a857d953b48c2c2b3bf5b4f9466d96f03e5396641937b10b634417ad0c","observation_id":"da4596c2-6956-4a5a-8812-5bfe8b0fe509","resolution":{"observed_at":"2026-08-07T14:42:27.897972Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18065","last_updated":"2025-05-23T16:12:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T14:50:33.225594Z","submitted_at":"2025-05-23T16:12:12Z","title":"Reward Model Generalization for Compute-Aware Test-Time Reasoning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2505.18065."}