{"as_of":"2026-08-21T05:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aedb9055ab76a28f35a0fc6dc1758239703480ede26fc03dba1602709c78b2b2","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:32:10.732509Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:59:54.314068Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T20:49:00.766137Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06737","snapshot_observed_at":"2026-08-06T00:59:54.314068Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04088","last_updated":"2025-08-07T03:52:48Z","snapshot_observed_at":"2026-08-20T15:31:13.506860Z","submitted_at":"2025-08-06T05:10:29Z","title":"GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T00:59:54.314068Z"},"links":{"cited_paper":"/paper/2502.06737","citing_paper":"/paper/2508.04088"},"observation_digest":"sha256:71cdda911951fcad3074748b663d29faf86e1a942997c4ec757659f69bf84607","observation_id":"bd0b5798-ed0c-42bc-b161-01f3c06fbd77","resolution":{"observed_at":"2026-08-06T00:59:54.314068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06737","snapshot_observed_at":"2026-08-04T07:56:47.849322Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:47.849322Z"},"links":{"cited_paper":"/paper/2502.06737","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:7e95e5d3f8426ac778de4d26bcb1d3e4e19f0954850752f131a7937eb0ac6dc5","observation_id":"f4f44dfe-ee49-448d-9142-681886b99854","resolution":{"observed_at":"2026-08-04T07:56:47.849322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"cited_work":{"arxiv_id":"2502.06737","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06737","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Versaprm: Multi-domain process reward model via synthetic reasoning data","venue":null,"work_id":"5c36e827-8fef-4005-a0b9-8b6ff27025a4","year":2025},"citing_paper":{"arxiv_id":"2605.02395","last_updated":"2026-06-20T01:28:53Z","snapshot_observed_at":"2026-08-17T16:25:03.413470Z","submitted_at":"2026-05-04T09:36:57Z","title":"Verifiable Counterfactual Supervision for Process Reward Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:18.022593Z"},"links":{"cited_paper":"/paper/2502.06737","citing_paper":"/paper/2605.02395"},"observation_digest":"sha256:9867bdcc944a504bc75dce107832e443466ec75d10b52a41c5e8719eec06598b","observation_id":"7aa50ad5-9f73-46db-b0a6-7f1e5a6f9ccd","resolution":{"observed_at":"2026-05-09T05:55:30.057650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"cited_work":{"arxiv_id":"2502.06737","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06737","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Versaprm: Multi-domain process reward model via synthetic reasoning data","venue":null,"work_id":"5c36e827-8fef-4005-a0b9-8b6ff27025a4","year":2025},"citing_paper":{"arxiv_id":"2605.13467","last_updated":"2026-05-13T12:55:18Z","snapshot_observed_at":"2026-08-12T16:10:37.480335Z","submitted_at":"2026-05-13T12:55:18Z","title":"PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T19:20:32.435135Z"},"links":{"cited_paper":"/paper/2502.06737","citing_paper":"/paper/2605.13467"},"observation_digest":"sha256:88c81b5f671a73516c342bec2780ed328baefaa46f8e25e1d981516d20835a8b","observation_id":"0c86b742-d9fc-4919-9abf-94e64605482e","resolution":{"observed_at":"2026-05-14T19:22:50.520864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"cited_work":{"arxiv_id":"2502.06737","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06737","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Versaprm: Multi-domain process reward model via synthetic reasoning data","venue":null,"work_id":"5c36e827-8fef-4005-a0b9-8b6ff27025a4","year":2025},"citing_paper":{"arxiv_id":"2605.18851","last_updated":"2026-05-13T11:04:31Z","snapshot_observed_at":"2026-08-17T16:29:02.037115Z","submitted_at":"2026-05-13T11:04:31Z","title":"STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T20:47:16.236629Z"},"links":{"cited_paper":"/paper/2502.06737","citing_paper":"/paper/2605.18851"},"observation_digest":"sha256:baa522a688f7bfad7a1db88df0599817fcd31dc74cad3f5a594fc7a85d42c6f6","observation_id":"e3a156cf-aa5f-482c-a9b6-bb04f1e91f38","resolution":{"observed_at":"2026-05-20T20:49:00.768167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06737","snapshot_observed_at":"2026-07-13T03:00:51.318412Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09438","last_updated":"2026-07-10T14:09:04Z","snapshot_observed_at":"2026-08-13T12:49:40.220419Z","submitted_at":"2026-07-10T14:09:04Z","title":"Test-Time Scaling for Small VLMs on Multilingual Visual MCQ","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T03:00:51.318412Z"},"links":{"cited_paper":"/paper/2502.06737","citing_paper":"/paper/2607.09438"},"observation_digest":"sha256:cfafc258921debe8eb233c3c6b42b7547937a11ce83e4caec7d4b6752d4486f6","observation_id":"a32409a8-59b5-4a82-a65f-d99e872ff374","resolution":{"observed_at":"2026-07-13T03:00:51.318412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06737/citation-record","integrity":"/paper/2502.06737/integrity","json":"/paper/2502.06737/citation-record.json","paper":"/paper/2502.06737"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:12.070696Z","title":null,"venue":null,"work_id":"c56d839b-89cb-471e-88e5-cf8404b31417","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.323686Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:32a6c9cef5560411c87b4aa9faed470685158b1737d28d44ce3556fe6f3e7494","observation_id":"0a59c4f0-7c83-4f7c-8573-125e34c76d9f","resolution":{"observed_at":"2026-08-08T14:32:12.075011Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:12.057051Z","title":null,"venue":null,"work_id":"4ba75abc-d942-4840-aa80-04710e190bb5","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.331717Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:8ee089b75661d302ea46ce7d61ddfc568fcaed61bed8cfa97a38e8bed89bcaef","observation_id":"a443ee0f-8a18-4135-8098-dcda6d4450ad","resolution":{"observed_at":"2026-08-08T14:32:12.061130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:12.044842Z","title":"A student’s final answer is considered correct if it matches the ground truth answer or only differs due to differences in how the answer is rounded","venue":null,"work_id":"7f3078a9-0995-4b2c-bfd1-53eac27f7aa2","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.338652Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:bca1fc176a4762e5d096514b375edf9da2d9aa0eb1a78f320e043df3121390f7","observation_id":"c4d99383-4717-4272-9768-9304a07fae6d","resolution":{"observed_at":"2026-08-08T14:32:12.049173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:12.033121Z","title":"Your task is to: 1","venue":null,"work_id":"bd1bc6d6-83a8-46e3-947d-bbbb53aa418f","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.344183Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:dc9d4b42ce89d9078a7f9db6d7975e5702ceca96234988005143824100605213","observation_id":"c145d8ad-dd97-4f75-845d-7a474727b55e","resolution":{"observed_at":"2026-08-08T14:32:12.036917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:12.020263Z","title":"This should include: - Identifying a step where the reasoning could naturally deviate","venue":null,"work_id":"34596637-26f7-43c4-a112-c10d8ec1b785","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.348830Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:e19339a26dd6d75c1d388f7123936247e10019d9274797b4ddcceafe3a08a5a7","observation_id":"490ee6f6-02f7-4a08-aa6c-38118b608103","resolution":{"observed_at":"2026-08-08T14:32:12.024869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:12.004476Z","title":"This incorrect step should: - Reflect a deviation in reasoning that significantly harms the correctness","venue":null,"work_id":"f7c3dc40-46d3-4224-8610-ea4127de2748","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.353000Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:46fd9477d647a8733760b1826a9b60e1bf3124ff646ca70a63fc595d67ddc806","observation_id":"add17453-6820-4374-9d6a-9ad110861df1","resolution":{"observed_at":"2026-08-08T14:32:12.010447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.979085Z","title":null,"venue":null,"work_id":"be4d3aa4-7b7f-4ddd-859e-a9806f7e67d6","year":2025},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.357375Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:caf64ff4eb7a33a9abd5ffddc95d4b901ec5447859d6b89517bf382182729d22","observation_id":"7da8f460-c833-4641-924c-bedbf61c2fdf","resolution":{"observed_at":"2026-08-08T14:32:11.988657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:12.111175Z","title":"- Verifiable: The step can be verified using common knowledge, simple calculations, or a quick refer- ence (e.g., recalling a basic theorem)","venue":null,"work_id":"47f1946c-00d1-49d6-bcef-4f38b68c4f23","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.362337Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:897092586766984285acec5bcc7aa789f3867b4b7c7e576777832ce428ece0f0","observation_id":"4cab58e6-d00f-4814-b20e-d33f9de27aae","resolution":{"observed_at":"2026-08-08T14:32:12.115698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:12.097426Z","title":"Good job!","venue":null,"work_id":"428a25ee-e681-416e-baa6-de8b6b5100e6","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.366565Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:e30f1dbf6da6e065e7cf8a644b697abc9074b87ed1e25864d5b1607b2ce63b58","observation_id":"10266fca-597a-4bd1-b513-1a16d6102ce5","resolution":{"observed_at":"2026-08-08T14:32:12.102248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:12.083700Z","title":"- Is Hard to Verify: Requires significant effort to confirm due to poor explanation","venue":null,"work_id":"bfeaf82b-95d9-415f-bcd8-6d8d0c470c4f","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.370712Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:b359f7ae549b11dbf618c1f6852d9f70808b3377bba58d0eab312440be53192e","observation_id":"16381305-d567-4437-854b-6c7697b182d7","resolution":{"observed_at":"2026-08-08T14:32:12.088003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.956235Z","title":"Otherwise, return the index of -1 (which denotes all steps are GOOD or OK)","venue":null,"work_id":"31d3f735-8305-4c55-bb08-bbc3d711d733","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.375419Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:b94f94b3daeb1165496f11335f8caaed3a4d989235e13b31844d4496ec73c073","observation_id":"88c8f66c-59a8-4a4e-9e17-87b0644f7bde","resolution":{"observed_at":"2026-08-08T14:32:11.961006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.939618Z","title":null,"venue":null,"work_id":"38106c50-be20-4bca-9314-427cafc63931","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.379848Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:4d066c882dee34e00a562c35813cc8d80dfb90d4ee0fbf27c0aa9e1320484bee","observation_id":"78c6957c-c362-42c8-9070-36149de33a42","resolution":{"observed_at":"2026-08-08T14:32:11.944718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.891878Z","title":"This process continues until a terminal node is reached","venue":null,"work_id":"d11d8fe9-8739-4b1a-a228-d624d3c07736","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.383770Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:24f004b7a51dfd2f2e099f2f098a7e2263c796b16990ad35a25167801defb725","observation_id":"c5bf14cd-7e07-444e-8760-15a2e9e104f8","resolution":{"observed_at":"2026-08-08T14:32:11.914376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.845631Z","title":"These steps are repeated for a fixed number of iterations or until a computational or time limit is reached","venue":null,"work_id":"9d1048dc-ffac-4a21-8cba-109b343a4c52","year":2024},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.387834Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:c8ef381c820dedd3c259f01210d4e894a94c53a2e7392789c2a2721d1b276f63","observation_id":"322952c3-ba45-4532-aba3-3a4ce8e08d78","resolution":{"observed_at":"2026-08-08T14:32:11.864138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.793431Z","title":null,"venue":null,"work_id":"93b9f6c3-1879-4ded-8400-fe7dd216b6c2","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.392881Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:7fa7e830bc99a9e8f853d3d0a88562f4938f06e0e529463a0df3fba440722651","observation_id":"9a9d6bfa-8c38-4834-bbae-c6b662a43ff4","resolution":{"observed_at":"2026-08-08T14:32:11.812151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.756277Z","title":null,"venue":null,"work_id":"e5920aff-3f9f-4df5-a939-f784c006f837","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.397444Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:a4bbd3b499b786fb2a466b4c069ce006e5a381b9aadc9d20bb0b1b424e2975b6","observation_id":"4ae3eb8e-c469-46e2-a7c8-a6013535c7a2","resolution":{"observed_at":"2026-08-08T14:32:11.771436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.740186Z","title":null,"venue":null,"work_id":"47633337-8a03-4370-be29-9aef7ff7f509","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.402174Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:c8f126900b118df9d4e371ce75acb0164108c4e1e3ff2cdf6f0c76ae28cb702f","observation_id":"ceba9e57-3def-45d1-9fdd-92a50c900ab8","resolution":{"observed_at":"2026-08-08T14:32:11.744326Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.727863Z","title":null,"venue":null,"work_id":"8c7f9353-296b-419c-ae9c-7e6718dc5a51","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.407012Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:066b5c8ae176b3e7e56767267f2f4426b06f8e5f33d8de93e43f7ec25104bf99","observation_id":"b78cbf04-8536-4fab-80fd-eee15b7e2570","resolution":{"observed_at":"2026-08-08T14:32:11.732081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.715621Z","title":null,"venue":null,"work_id":"5d8190ad-4041-4404-bd63-4625638d77ed","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.412018Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:8e0ae8ba648d0354f612b42c2f82ba5e8ad92513e89a2bcefc85517f3babd9b1","observation_id":"da8c17fb-56b1-47b4-926f-237694543d2e","resolution":{"observed_at":"2026-08-08T14:32:11.720151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.700511Z","title":"33 VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","venue":null,"work_id":"a0fec773-3f06-46ee-a677-827696c7a564","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.417084Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:97c369a1411d95343997c560b8c515388a7ed80a9dcd3e8eb8baa81c8bb6d097","observation_id":"2a0feb1d-ee04-4b71-80fc-816389f549f6","resolution":{"observed_at":"2026-08-08T14:32:11.705556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.686136Z","title":null,"venue":null,"work_id":"435ef530-1036-41ee-a1fb-34f95c0b9629","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.421826Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:5cdc8b68e1538925c91397694d5759e8c30107486d7ead2e32dccfd34935d026","observation_id":"43f30992-d450-4301-8563-c57ef45148f8","resolution":{"observed_at":"2026-08-08T14:32:11.690181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.670826Z","title":"Math PRM rewards: 0.94, 0.92, 0.96, 0.87 VersaPRM rewards: 1.00, 0.43, 1.00, 0.09 Explanation: The Math PRM fails to detect that the wrong hearsay exception was applied","venue":null,"work_id":"5d70b444-3808-467a-bbbf-56e136162a31","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.426243Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:b42cb6946ee7e2b4124d3c9257bfc1fa626171854db6b92e20ad7b48dbc3ca3b","observation_id":"fd97ac58-2655-43bd-b689-d73ab0d01832","resolution":{"observed_at":"2026-08-08T14:32:11.677372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.655797Z","title":null,"venue":null,"work_id":"0d55400b-d63d-4768-b1a2-c698d189b4ed","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.431463Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:85d837df56964915d8bf609b5a8c8983999a7a9bc7bf9e74cc470c4cad800865","observation_id":"5a42e14c-7d81-47fc-913f-1cc8c1fad88c","resolution":{"observed_at":"2026-08-08T14:32:11.659699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.638392Z","title":null,"venue":null,"work_id":"63908ef5-d724-42df-a2d2-5fee7c0219ae","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.436521Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:918b28fab889dbfb3b263350d9a6761f165397c69acf794922b6ab989b856d37","observation_id":"734db4ff-4e45-44d2-8a11-ee3fbf6d2a58","resolution":{"observed_at":"2026-08-08T14:32:11.642577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.622392Z","title":null,"venue":null,"work_id":"38375c67-ae07-4222-a353-d1200eafdf8a","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.440337Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:1f8064a0eedb2aa23c068099c062ba1178efab13ac71267aec224c9b208b8266","observation_id":"3fdefb31-3c15-477d-aa28-9ddb6e117a98","resolution":{"observed_at":"2026-08-08T14:32:11.626789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.606888Z","title":null,"venue":null,"work_id":"799b8774-6397-4af0-86c7-29a6226a6ea7","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.444055Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:0c508b323e97d6e7239167c2388078048e552c4f87befb2b39bd293605cc8a2d","observation_id":"4c9ec132-0c80-4ed4-902d-416fe830a837","resolution":{"observed_at":"2026-08-08T14:32:11.612589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.591144Z","title":null,"venue":null,"work_id":"fa4f8ce3-125f-4919-8db4-94d4e9998e28","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.448203Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:8e6b22ff9241509744416952a15999ccd587d2a39e8c879c198e9bbdc920b7ca","observation_id":"e8ac57aa-eb6e-4cfd-9bbe-16e299fb431c","resolution":{"observed_at":"2026-08-08T14:32:11.595421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.560707Z","title":null,"venue":null,"work_id":"b36d2bd9-c504-42f4-aaeb-c480e1ea179c","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.452473Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:90ca8696f439a1e098f09cde8cdc1173b48a727bab2a3097208cbc110b276f85","observation_id":"33adc291-6033-46c8-90d4-ff55092700ed","resolution":{"observed_at":"2026-08-08T14:32:11.573835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.532807Z","title":null,"venue":null,"work_id":"7281427b-7d18-428e-83d6-df327b7df2ad","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.456164Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:c1d787a4bcff4daa2b6ccc3f610607aae3648898433ea80168891280d46a7e3e","observation_id":"f7223351-2a9c-42ef-9988-f5f335b7b850","resolution":{"observed_at":"2026-08-08T14:32:11.545051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.505644Z","title":"race to the bottom","venue":null,"work_id":"64ddaf69-cbcd-44d5-be16-bfdcbd86e5cf","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.459940Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:b5bff312418b764870e8553e15322d2501787e6e275fd84fdf01c99cc5707fe4","observation_id":"faf8697d-eaaa-4430-a1dd-254df8d095e8","resolution":{"observed_at":"2026-08-08T14:32:11.516446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.479405Z","title":null,"venue":null,"work_id":"7ca40f0c-87ca-4e90-8008-c74c7d161b21","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.464080Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:d432de738c6cc1dd7b9f711d27a8d169bfe04a98f3c86433e960a0057284eae6","observation_id":"f65efcb2-935e-40aa-b160-16926f351c88","resolution":{"observed_at":"2026-08-08T14:32:11.489253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.463241Z","title":"This is an example of devolution because the federal government is limiting the power of the state to act on its own, effectively ”devolving” power back to the federal level","venue":null,"work_id":"02fd2818-a3ab-498b-a20e-2f4ea374c2e9","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.468168Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:d84a702de667e1a09e56ce76bd6c9619c0a15cf60b3f5a99391daabbeff30301","observation_id":"885a6794-cbbb-46e5-ab7d-20364bc631cd","resolution":{"observed_at":"2026-08-08T14:32:11.468521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.451227Z","title":null,"venue":null,"work_id":"693abb6a-7f72-43e0-9f14-1d167ffea157","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.478428Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:8de494fe035da143815e416b57452bec42bb064da63cfb75aa6b2a31683eb359","observation_id":"85138796-aed2-4c9e-b69a-9ffabb79f3fa","resolution":{"observed_at":"2026-08-08T14:32:11.454999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.438433Z","title":null,"venue":null,"work_id":"9aa81251-34c6-45d0-a84f-d2294ce107a0","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.483665Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:c78be388528f104f2c92f39830355b3347cc9bfd4389fd555328bd0d1bee35d3","observation_id":"6b1ffba6-334b-42d4-bfaf-c6b531ed8906","resolution":{"observed_at":"2026-08-08T14:32:11.442925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.423930Z","title":null,"venue":null,"work_id":"2008b2ed-aa56-4728-943a-435dba9d484e","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.488428Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:408c9502ef333b3095f2caac6b8bc6f068ca4d187b9671aadbe641c7bf268399","observation_id":"1e8f8dd8-9544-473c-aec7-e1725496a15a","resolution":{"observed_at":"2026-08-08T14:32:11.428158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.409871Z","title":null,"venue":null,"work_id":"5f3c9a87-3e22-4eaf-96e4-65dfd0069f92","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.493939Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:7db2c3a889d1b3d8cde54eb1dbf81193e67900c666c24aabcb68d57c4591f082","observation_id":"87788937-a00b-45f1-8fbd-d5335070a93b","resolution":{"observed_at":"2026-08-08T14:32:11.414629Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.394041Z","title":null,"venue":null,"work_id":"e864671c-2866-41c7-a147-7b228c57293b","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.498981Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:ce7755ee73331efb7f284e82a7189abf3c2d16c6b3e54b15b873d374a3b27b21","observation_id":"d59d4d11-4eda-48ff-8d0d-022666874e21","resolution":{"observed_at":"2026-08-08T14:32:11.399881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.372563Z","title":null,"venue":null,"work_id":"eea84cdb-051b-464f-84fd-38756249d04e","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.503473Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:0ece05e8af9df023455d7585854dfbb940e48721cfd82e33841af69ee3e67f45","observation_id":"9d64dc5e-8711-4bdb-b742-cb8b127ba305","resolution":{"observed_at":"2026-08-08T14:32:11.378232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.356216Z","title":null,"venue":null,"work_id":"766e1523-630f-4a0f-9af5-42c54b727d49","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.510762Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:69d12b81776e7eef64f2f64f6589993a821db7094c1b13972aaf800f8ecf487f","observation_id":"8885c703-11ba-4b62-9de2-0db2a6ea14df","resolution":{"observed_at":"2026-08-08T14:32:11.360707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.342043Z","title":null,"venue":null,"work_id":"c50d4c3d-a888-403f-ab1b-e9ec19f628ac","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.515548Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:da46fac219a3b88dfea906c1ea1cca815a4e48751eddb9cbcc48f3e554ac5d59","observation_id":"fad6c245-8daa-4b0d-988d-dce0b528d1f9","resolution":{"observed_at":"2026-08-08T14:32:11.346678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.310935Z","title":null,"venue":null,"work_id":"4e81afbd-4a62-4339-9b71-afcf51a6ae4a","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.526878Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:202273c1f7fe03d698f6bf4c025901378c21b8424dd2c4707b81e6798ff5de84","observation_id":"df6ea495-c2bd-49ec-bd17-d8cff99400a1","resolution":{"observed_at":"2026-08-08T14:32:11.316955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.297072Z","title":null,"venue":null,"work_id":"b4329d2a-ba18-4790-bc95-f5ab60faea1b","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.532001Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:ecc93fa4fc40e383aa8bc5971618f4f84fb43a2e87fb70fb9d85364e73964656","observation_id":"384f4f90-24aa-4b5e-b65a-a65a18e545ec","resolution":{"observed_at":"2026-08-08T14:32:11.301830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.280210Z","title":"The new concentration of OH − ions is 0.05 + 2x","venue":null,"work_id":"d95547ac-50da-4a72-95ee-69d24aa31da1","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.536458Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:dca2c56d8833c317fb22c99d028f4e7d4f33dda99b343dc3b54f3234de15ce18","observation_id":"66e17569-4f34-432d-8004-e9b5d5f79eb3","resolution":{"observed_at":"2026-08-08T14:32:11.285965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.259782Z","title":null,"venue":null,"work_id":"5760cd49-2896-416c-a640-6f4d4fc30fa1","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.541145Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:a220334b82426457673be602fe11d59780aa7dccacf98e28d4510b3451146704","observation_id":"fbd7bfa9-f1b1-4043-865b-7ca01076ae5a","resolution":{"observed_at":"2026-08-08T14:32:11.264134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.326543Z","title":null,"venue":null,"work_id":"dc23a9b6-1ba2-45a5-a29b-089a2cab5a4b","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.547791Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:7afc952446c73ec521d29ee65c656ad70efe08a53e1f95f918aa9cd1c286e87e","observation_id":"2bc622cf-fd00-4673-b3e6-897db0ed8310","resolution":{"observed_at":"2026-08-08T14:32:11.332224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.244956Z","title":null,"venue":null,"work_id":"55a4b90c-a845-4618-9695-8a398b3dcef8","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.552237Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:1936499eb5d6eaa38847ee7cfc756ea1c8bffc7d1e1fab4b73f22bb6e6d58541","observation_id":"f06d1f56-715d-4ca2-ad11-bbd45cb1f4a5","resolution":{"observed_at":"2026-08-08T14:32:11.249381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.230275Z","title":"The concentration of OH − ions is much larger than the concentration of M g2+ ions, so we can assume that 0.05 + 2x ≈ 0.05","venue":null,"work_id":"8956033d-c3a6-4377-b181-5d28fad2cb0c","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.556930Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:e9703a5c9d155e9e863113314bd636c8e0af3c94f30ec2c2685888411513af34","observation_id":"5812b2ad-d33b-49c2-96b2-8a5bea1fe320","resolution":{"observed_at":"2026-08-08T14:32:11.235860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.212125Z","title":null,"venue":null,"work_id":"e4836fee-2773-462f-89a0-b06707e70a8c","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.562477Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:ec290d70fd2d6116d908070ae90a5947f208bff8a089690295f6023b966bab13","observation_id":"322512e6-abc7-402d-b3d9-65f7513be571","resolution":{"observed_at":"2026-08-08T14:32:11.218240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.197384Z","title":null,"venue":null,"work_id":"395eac9d-1016-4e6f-803d-b3c84857d5ad","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.567936Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:b656c6009f4bd377a1d7b5b06ffe22d8ae295791253e2cfad58c84ea68a43248","observation_id":"b76409ed-0649-4215-970f-6ca5b5ba1d83","resolution":{"observed_at":"2026-08-08T14:32:11.201973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.179542Z","title":null,"venue":null,"work_id":"c7f01b2d-737b-40df-bd99-65aa8bd4a9d2","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.578688Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:cd51edc1f2c26426f428606cdd5add51b1da73ae437186cc34ada041be54234a","observation_id":"761fb5c2-021d-4e7d-b382-2610d9bb6683","resolution":{"observed_at":"2026-08-08T14:32:11.186911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.156434Z","title":null,"venue":null,"work_id":"002a8487-f866-40e5-81cd-6cb41208952d","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.585422Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:2e623dd800151ad3329a6cde1eb31f7dacd4c331cac8cc7686210832d2801933","observation_id":"cb0428c3-bb1c-45b0-a519-848d3951d4c2","resolution":{"observed_at":"2026-08-08T14:32:11.160947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.139656Z","title":null,"venue":null,"work_id":"2e3aa26f-d933-4a14-bcb4-f44583f0ffb6","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.590512Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:a8267414c27ee810dc5cb54fdb29a763d13f039aeea58734022768bcd7843475","observation_id":"bdd2ab91-3491-4f39-98ad-a9ff796a2e24","resolution":{"observed_at":"2026-08-08T14:32:11.145533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.122020Z","title":null,"venue":null,"work_id":"53198a19-a395-48d9-a4dc-7cb8376b4b6b","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.595142Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:9a27dd850b06446bc7b837d4bc6d6ae9096ed370490188117dfd8679cbd021da","observation_id":"88b84cf3-a438-40c2-bd11-51d45c95d25e","resolution":{"observed_at":"2026-08-08T14:32:11.125941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.108238Z","title":null,"venue":null,"work_id":"9ce6a9ec-6840-48ac-b1e4-bbafbf1afea9","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.601217Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:252b52e682fc4ebc0b07d96d0db116c92ec5ac220d22cc81554e4a8aca218f03","observation_id":"1eaeb2dd-5e0e-41a6-903c-b9f4a65a21a3","resolution":{"observed_at":"2026-08-08T14:32:11.113211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.075542Z","title":null,"venue":null,"work_id":"df52ceaa-786a-4980-ad65-47d7ae637bfa","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.611340Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:389850f07bc65a0860305a317ab7833749aad359646bd04aba9bc6daaff2aa76","observation_id":"64e8d002-503e-4021-8290-71fab4218d6a","resolution":{"observed_at":"2026-08-08T14:32:11.080047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.057584Z","title":null,"venue":null,"work_id":"32c674e1-3ff1-44c1-930a-82f939990420","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.618264Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:b278270b299ee615bf812065816571ce80ab570d9982b00ecdba560990c03744","observation_id":"aaf88d98-2cc0-4b36-b55a-66d0036d56a2","resolution":{"observed_at":"2026-08-08T14:32:11.063092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.093020Z","title":null,"venue":null,"work_id":"a3621d63-6e6d-43e1-ba1b-c8a98e6c60d8","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.625867Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:ada684456980cc9c9dc68bce2bdd9161a2b7a09153dff984b7c4fbf1bd8ae8c5","observation_id":"68430d26-ff17-4e09-8f61-099739d01aea","resolution":{"observed_at":"2026-08-08T14:32:11.098527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.043540Z","title":null,"venue":null,"work_id":"3120b910-231d-425e-a638-8dd659222625","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.631596Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:e5ce5bfa401c62334c2b1587a29aaf56262a11c39cb1c6e4cc27d0b9049504a9","observation_id":"268a5365-f874-4686-8add-4f4e43e86f16","resolution":{"observed_at":"2026-08-08T14:32:11.048738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.027699Z","title":null,"venue":null,"work_id":"61ed888b-ffe3-4826-b7cf-9053702ffbd9","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.641039Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:d14ce2f0e1b7344280e41709403373eb3e637a8f03c6b4196399c687c725276f","observation_id":"3c07f981-5666-4b11-a645-3051bc28e441","resolution":{"observed_at":"2026-08-08T14:32:11.034584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:11.009041Z","title":null,"venue":null,"work_id":"8edee7c5-4cd4-48f9-896d-bf1e2c1ef6c4","year":2014},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.649547Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:28b4719acee6c7a009dfaf8ea3f4719625cd0658dafa9b939ffddfb79a1eba93","observation_id":"b0b2bd8b-a944-4f56-bb35-0664fa94df3d","resolution":{"observed_at":"2026-08-08T14:32:11.016477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.981117Z","title":null,"venue":null,"work_id":"70eaa064-104a-4585-bed4-9c87787f68bd","year":2014},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.658995Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:acd93cb7737e1ccf8b8e00844e3c5cd72958ea6539380d6c0ee8e4df139d3654","observation_id":"b08bdc63-ca0b-4407-a177-ce613b804e7c","resolution":{"observed_at":"2026-08-08T14:32:10.987923Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.963676Z","title":null,"venue":null,"work_id":"8448092b-c3a6-4abc-a707-a81088a707a1","year":2014},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.663541Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:ea2c971d14545ab29ebd752567f455e17b09ef3c7d20447f479231d0a4fbc401","observation_id":"75b7e747-9f1b-429a-bd2a-c5a817620a33","resolution":{"observed_at":"2026-08-08T14:32:10.968751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.949813Z","title":null,"venue":null,"work_id":"2d292268-0dad-4966-8283-56cbb9b85909","year":2015},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.669827Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:8f8a7ab1f9beeaa56e726c0ae15e376688a9b80fcf09f4ba27479b166862dd7f","observation_id":"852a70a5-147b-4390-b895-4e2bae37481f","resolution":{"observed_at":"2026-08-08T14:32:10.954897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.936106Z","title":null,"venue":null,"work_id":"37823131-20ca-4f51-be20-6da6831352c1","year":2014},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.675092Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:ba0219d7e0315268a2d51970242a6f7303bc56dfa8fc88390c73bbf600b64e67","observation_id":"98e54ac9-3f21-40b7-b8de-fbcb8b3c414a","resolution":{"observed_at":"2026-08-08T14:32:10.941013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.921226Z","title":null,"venue":null,"work_id":"3200005f-e191-4632-abb2-84abcd31909e","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.687292Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:565bed13c3075d0564555684afe9782ca4d8813909fd89efcdb58dd8db23550f","observation_id":"7c2fefdf-a252-4d15-8997-c902c770038f","resolution":{"observed_at":"2026-08-08T14:32:10.925989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.905148Z","title":null,"venue":null,"work_id":"83a1343b-24f6-4fa6-b658-969b4aaef755","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.692485Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:e67b546f60cd5d3304afc6a8dc7baa7ef00e4d519a4b4ad3810afb0e8c605e78","observation_id":"ccfa85dd-937a-4ec2-950a-735615ed8695","resolution":{"observed_at":"2026-08-08T14:32:10.910362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.890882Z","title":null,"venue":null,"work_id":"83aa745a-56fc-4c29-ba87-20f5850a224a","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.697916Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:efb9d55006a4affdc191efb813343dd3f8a767af2ffa59a172b6b847c5ac4efd","observation_id":"93ff9bc8-ee16-4216-a512-33f57822e0ae","resolution":{"observed_at":"2026-08-08T14:32:10.895485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.874788Z","title":null,"venue":null,"work_id":"65bcc6db-cf97-49c5-9a33-2797fcc92fde","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.702536Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:de08cb87f794128fba54a231ce89d1ddb3bc46c25d5329ca5fac41a9adbfc3bf","observation_id":"f17120c2-d00c-419e-98f6-9cfa6fde514a","resolution":{"observed_at":"2026-08-08T14:32:10.881094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.856419Z","title":null,"venue":null,"work_id":"b33568e4-981b-4060-ac33-dc9c5be5ca4c","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.706851Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:671b95da4caca91aeaec4bd83cb925fafbc915d2986b818ccc372db2097ab50f","observation_id":"30c20af5-c890-4ec2-8f71-c4f3eee869bc","resolution":{"observed_at":"2026-08-08T14:32:10.860983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.836914Z","title":null,"venue":null,"work_id":"18e42f6e-bcf2-434d-9756-5c994530bbce","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.712735Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:c2ec8525ee733e9731f6b54b9a361fe2398132609e23adbc39a9b408efffe6f4","observation_id":"84e55778-c315-451e-b814-179053aa2980","resolution":{"observed_at":"2026-08-08T14:32:10.841817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.810232Z","title":null,"venue":null,"work_id":"b6bd3b86-73c5-449e-8304-d9e491bcaf68","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.717394Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:09d6ba168d2833beee6b7cf385864e518d6e23f5aba254a5d203c32341a4f1c4","observation_id":"cbf2af6d-b626-475b-9452-ca6c595cd88a","resolution":{"observed_at":"2026-08-08T14:32:10.817118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.796121Z","title":null,"venue":null,"work_id":"5b74ee6e-8e53-4145-a5fb-48e3f7640bb7","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.722142Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:e92f455ec02cc2c4e8ff61b8bb2f09d7c5fb120754c3c893f481566a6bf06b29","observation_id":"1e3d19b2-a24b-4a09-b637-fc649b63066f","resolution":{"observed_at":"2026-08-08T14:32:10.800279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.783463Z","title":null,"venue":null,"work_id":"44bfe13a-826d-4645-9515-6362675097bf","year":null},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.726615Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:d204c844c010ff50890a9e1d2c550e9bd23f1e7221d904135429f559350b3d9c","observation_id":"fa9c7ed9-fe6a-4a65-87a6-8e7fcb4dd5b7","resolution":{"observed_at":"2026-08-08T14:32:10.787366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:32:10.765409Z","title":"which of the following [X] is correct","venue":null,"work_id":"3d762302-6d89-4d2d-9eb3-9f0b3c27b685","year":2023},"citing_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T14:32:10.732509Z"},"links":{"citing_paper":"/paper/2502.06737"},"observation_digest":"sha256:e4405e43ca2db7ff63812c5425f78b743adcbded8d5cbd95d13fe37fb927ec48","observation_id":"95df2d65-3585-46ec-adfa-8e1d438d6a4d","resolution":{"observed_at":"2026-08-08T14:32:10.773615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":55,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 6 inbound Pith citation observations for arXiv:2502.06737."}