{"as_of":"2026-08-18T04:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d5aeb008beb2cc3ad76d5cfcc0c646466ea5e3ed59b5d517b5b92439de9142a","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:31:32.681228Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:56:43.392662Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T17:56:44.691483Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"cited_work":{"arxiv_id":"2506.00027","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00027","snapshot_observed_at":"2026-08-06T17:56:44.691483Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","venue":"cs.CL","work_id":"6cef77d9-2df6-4064-9a72-6d13456f776c","year":2025},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-08T22:32:30.066463Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:43.392662Z"},"links":{"cited_paper":"/paper/2506.00027","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:9a1ac4024a9c5e8d7d667d9d7e76d2fa1f00041ec940542607dbc579509826a1","observation_id":"1d3a22a1-49e8-45c1-85e7-701a2f4f4e21","resolution":{"observed_at":"2026-08-06T17:56:44.698316Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00027","snapshot_observed_at":"2026-07-13T03:00:51.318412Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09438","last_updated":"2026-07-10T14:09:04Z","snapshot_observed_at":"2026-08-13T12:49:40.220419Z","submitted_at":"2026-07-10T14:09:04Z","title":"Test-Time Scaling for Small VLMs on Multilingual Visual MCQ","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T03:00:51.318412Z"},"links":{"cited_paper":"/paper/2506.00027","citing_paper":"/paper/2607.09438"},"observation_digest":"sha256:76e4a0dbb785009295aad2f24c75429ecea0492d12426f8e1aefed97d9547d45","observation_id":"9abfc3ba-89cc-483d-b9d9-d37af6e6f29c","resolution":{"observed_at":"2026-07-13T03:00:51.318412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00027/citation-record","integrity":"/paper/2506.00027/integrity","json":"/paper/2506.00027/citation-record.json","paper":"/paper/2506.00027"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:35.424183Z","title":"This loss function inherently accommo- dates the probabilistic nature of the labels generated via Monte Carlo simulations","venue":null,"work_id":"20313609-d7cb-484b-949a-83f6914621ec","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:31.706585Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:6018e9d4f505d7a8a39cefa54fe42a41b275e04d7448a681464eb1021848c937","observation_id":"bba346f9-7c64-4b17-b385-303de0e8fc09","resolution":{"observed_at":"2026-08-07T14:31:35.465025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:35.264055Z","title":"Key hy- perparameters such as learning rate, batch size, and weight decay are tuned based on validation perfor- mance","venue":null,"work_id":"5eaae4c6-b6ef-4433-831a-79418c758d68","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:31.800088Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:3ef49de2079a626b6763ef3aaaa35d8d8cdca06277d5dc11d80fc9f60f7916c9","observation_id":"7c16b16c-e274-4a28-b43d-960efeba1e36","resolution":{"observed_at":"2026-08-07T14:31:35.355153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:35.163000Z","title":null,"venue":null,"work_id":"e9be4215-ad7c-4fff-98bb-de4ccfe43021","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:31.912875Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:ba38d612ab43eb3b52da1d6b68b6a17f648f1d3f8fd523535a79e9c2cca551a2","observation_id":"8d42cbdf-8536-4493-ab1b-cd6705899bb5","resolution":{"observed_at":"2026-08-07T14:31:35.196714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:35.049329Z","title":"Through this comprehensive training process, the PRM learns to accurately predict the correct- ness of intermediate steps in reasoning tasks","venue":null,"work_id":"0c98d9c8-d1d8-49b1-9447-32e507255989","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.011816Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:70680833ea7e88e789aaf9854e90ca63ece4888b727c44a34ce4abe5604b9712","observation_id":"44e147b2-6a4d-4e99-8d78-306d6385c705","resolution":{"observed_at":"2026-08-07T14:31:35.092280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:34.926909Z","title":"Generation: Generate N candidate solutions for a given problem","venue":null,"work_id":"7501c332-fb46-4203-8324-ece4babf003f","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.085667Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:ae009e8466e8a80d32ee60db525063ebd4819aaba8143332f5e983ee138c78cc","observation_id":"5f56dcf1-dcf5-464f-9bd0-3ece17db7a02","resolution":{"observed_at":"2026-08-07T14:31:34.970889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:34.788672Z","title":"Initialization: Start with an initial set of paths (beam width K)","venue":null,"work_id":"a8199c99-2f04-48d3-9bbb-6aab45e1b42d","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.134622Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:4385363174e601a6ab87ce94113ddfe2db3632a5eddb0a4303d0a56a9999840d","observation_id":"cc9e8e8a-119b-4968-930e-78aa750a4660","resolution":{"observed_at":"2026-08-07T14:31:34.838749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:34.633527Z","title":"Tree Structure: Represent the reasoning process as a tree where nodes are states and edges are actions","venue":null,"work_id":"4add4dd5-11c9-4775-b82a-170ac8ff5af1","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.169968Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:dae136fdbabe8bed85662fbc73814251aafb4d7728e3991fb67bae16ca916c68","observation_id":"ee66bcbe-b6fb-4051-a049-d1597e554db1","resolution":{"observed_at":"2026-08-07T14:31:34.684994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:34.516066Z","title":"Generation: Generate mul- tiple candidate solutions","venue":null,"work_id":"7e6dea03-843b-4954-bf27-3ad76b9c4943","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.237742Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:315b01a98a7f633eb28c41dbf3fa4f1ceee47fa8c61ce9333413eef9af2b01de","observation_id":"85045de8-8db1-461e-a55c-14529b4d9488","resolution":{"observed_at":"2026-08-07T14:31:34.562022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:34.366556Z","title":"Evaluate x1 using the PRM to obtain a correctness score p1","venue":null,"work_id":"22742a4d-05bd-4926-82e6-91b63e51c9e0","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.294762Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:481c11d079ebd3bf615c5e697c1579f70eff5021a10b2422156a81d51707f614","observation_id":"d1516759-e0b1-48dc-90de-691ecb764514","resolution":{"observed_at":"2026-08-07T14:31:34.427544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:34.236114Z","title":"Evaluate each candidate step using the PRM, selecting the one with the highest score","venue":null,"work_id":"6598b73f-f993-44c1-9623-10bf04b427e6","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.319712Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:fb3cf0558c5af49e10776a3c44b787a0d5f45418af0f66c9a407cc3e0dd13529","observation_id":"76db70f9-f352-43b1-8125-5f83a158852d","resolution":{"observed_at":"2026-08-07T14:31:34.312072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:34.091434Z","title":"Use strategies such as PRM-Last (considering the score of the last step) or PRM-Min (considering the minimum score across steps) to determine the final solution","venue":null,"work_id":"1df0acc8-d78c-49c5-a39c-5a74c8b930a2","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.359064Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:76e57dfe8d62a3168148c94f8f49141e4c5ef73e6c9404f20c0a5f5c9fe284dc","observation_id":"b637c00a-7475-43e2-ad36-7bab6de445ea","resolution":{"observed_at":"2026-08-07T14:31:34.145604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:33.935022Z","title":"Utilize modern hardware ac- celerators, such as GPUs, to handle the increased computational load","venue":null,"work_id":"1d58b62a-c4ff-4a50-9ab7-1f1ef5dd22cd","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.398936Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:54d753a8ff8e613cf265b0239bd76b01a22f76af41983c4639f97c340b9fc3b6","observation_id":"ce9a8883-6a9a-42ad-856f-8deb5b74f96d","resolution":{"observed_at":"2026-08-07T14:31:34.019206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:33.742448Z","title":"Imple- ment adaptive strategies to balance the depth and breadth of search, optimizing resource usage","venue":null,"work_id":"49024c83-9686-4410-ae95-8724d44cdf84","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.439421Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:a45a8b0c37ce9657b81cd9e0fa1b13f20b369665766c8ea5060e3e3953de5ac6","observation_id":"ab19f1b9-ac38-4461-87e1-1ace9ebd8450","resolution":{"observed_at":"2026-08-07T14:31:33.823336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:33.586756Z","title":"Prune low-scoring paths early in the search process to focus computational efforts on promising candidates","venue":null,"work_id":"c083848b-06da-4ec0-b736-adcb79b10449","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.495362Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:a121b77a0386fa083707a66090806934dc22a1e94d0490c581ea519162622d77","observation_id":"4654c7ba-005c-402b-b5d3-1040160d8ae1","resolution":{"observed_at":"2026-08-07T14:31:33.662415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:33.371556Z","title":null,"venue":null,"work_id":"850b88e0-1356-48ea-8aeb-4083eac79f41","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.534588Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:390498555374d1e7fe2067e892a515953b658e246bf0f8ec23263a1a6834bc2b","observation_id":"cc8ebed9-c271-4d82-819f-98e0a79f680b","resolution":{"observed_at":"2026-08-07T14:31:33.465675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:33.173651Z","title":null,"venue":null,"work_id":"7166083f-2ca0-4bee-ad0d-f3bff9fd9de9","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.572618Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:b599d96eb2e9351fc64b6848dafd62038b6945b15fa05a8fdb97c6f0cb064689","observation_id":"0248f2c1-d0f9-4fb8-86aa-459924e9acc5","resolution":{"observed_at":"2026-08-07T14:31:33.229148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:33.073454Z","title":"This adaptability is par- ticularly valuable in real-world applications where resource constraints may vary","venue":null,"work_id":"beda1589-be9b-4b3e-a10a-815a2a48bb78","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.632868Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:e71d6876f90273437d66c4e6040435ce74d63129d209ffc2441fb5cd645f0949","observation_id":"8a0d53e8-e69c-49f7-9e74-deaea23ec7e7","resolution":{"observed_at":"2026-08-07T14:31:33.119005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:32.928421Z","title":null,"venue":null,"work_id":"488bffc0-9973-4bd6-a7fa-02809f682d37","year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:32.681228Z"},"links":{"citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:15c6e9e24ecee3fa315c18dbcd9028fac3eb629337ce820bc6f8c77b53901a00","observation_id":"22f9940c-0462-4b55-a407-3765bdd45aa0","resolution":{"observed_at":"2026-08-07T14:31:33.013658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:31:31.378407Z","title":"arXiv preprint arXiv:2110.14168","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:31.378407Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:03898bf11ae9e0e1c10912f8c86a3841a309170d4ba91233c02a003c9be0930d","observation_id":"2c0c9326-0eed-4aff-9ab8-f92e75dac285","resolution":{"observed_at":"2026-08-07T14:31:31.378407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T14:31:31.448994Z","title":"arXiv preprint arXiv:2305.20050","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:31.448994Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:4a451a2aa8bcfa4d8a66fe12c20fb426d625cbe25b3c96533c7ac55b310a2309","observation_id":"448e7d3d-9561-438e-9162-830cae32bb52","resolution":{"observed_at":"2026-08-07T14:31:31.448994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-13T20:49:59.656333Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-07T14:31:31.553358Z","title":"arXiv preprint arXiv:2410.08146","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:31.553358Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:f5e975d954ab02412962d75fd80042fb4401aa9c224d92eef7eecd8faff42a39","observation_id":"0c39dbd5-9b15-40a9-9920-fcc822bf7ff5","resolution":{"observed_at":"2026-08-07T14:31:31.553358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-17T18:51:13.219936Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T14:31:31.630290Z","title":"Teng Xiao, Yige Yuan, Mingxiao Li, Zhengyu Chen, and Vasant G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:31.630290Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2506.00027"},"observation_digest":"sha256:b4c2d7f80f80ce49a982717c5f2e02a7f822cb90a7f391389772f562e06ac66d","observation_id":"d5444646-d5de-4dac-9b70-5200418c738f","resolution":{"observed_at":"2026-08-07T14:31:31.630290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00027","last_updated":"2025-05-24T12:44:15Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T08:34:35.903697Z","submitted_at":"2025-05-24T12:44:15Z","title":"From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 2 inbound Pith citation observations for arXiv:2506.00027."}