{"as_of":"2026-08-23T12:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49b620b26b861d850ce2f3bf84cf223975bfaaeda41027921a66583c43b1b360","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:56:48.047690Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.24803/citation-record","integrity":"/paper/2510.24803/integrity","json":"/paper/2510.24803/citation-record.json","paper":"/paper/2510.24803"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:56:45.789075Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:45.789075Z"},"links":{"citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:41d08d4bab5f9fe35538bddc760b2e227f95769b5c772040032418783339f6d6","observation_id":"b7692c4d-85f9-4910-a5a7-d62e1a7e7240","resolution":{"observed_at":"2026-08-04T07:56:45.789075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:56:45.833177Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:45.833177Z"},"links":{"citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:a0c4c77b7d8a23a7672ffbc49966ff47fdcabe9724dd2495d6a6cac33d224a2e","observation_id":"684fef4c-a351-48f4-868c-d894a4bc037f","resolution":{"observed_at":"2026-08-04T07:56:45.833177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:56:45.894456Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:45.894456Z"},"links":{"citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:19f57704f0794bfdf6002a76ff0cc3c6e90b4bff98d77c80007e0aee82946692","observation_id":"b3f51e71-208f-4874-9e3b-34949f3ee422","resolution":{"observed_at":"2026-08-04T07:56:45.894456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12130","last_updated":"2025-02-17T18:49:25Z","snapshot_observed_at":"2026-08-20T19:47:16.309734Z","submitted_at":"2025-02-17T18:49:25Z","title":"Scaling Autonomous Agents via Automatic Reward Modeling And Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12130","snapshot_observed_at":"2026-08-04T07:56:45.944867Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:45.944867Z"},"links":{"cited_paper":"/paper/2502.12130","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:8faf81997674878de1b897b35b9ac2c4d2affd152bdcb12652677b0045426e0d","observation_id":"fb73fb84-8b1e-4f77-bbaf-95cbc41138c7","resolution":{"observed_at":"2026-08-04T07:56:45.944867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-17T08:38:50.436240Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-04T07:56:46.023170Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.023170Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:9803f98b22fa2fd683190ff185f33056ede12c472555620174b3e8144aec4864","observation_id":"69ce9a63-a132-439c-b4ef-6b5382d7eb0c","resolution":{"observed_at":"2026-08-04T07:56:46.023170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T07:56:46.107061Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.107061Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:de6ca749f1f651cfe3a959002599aa6171ff449ab50b8ec9c29ab6a91e210d54","observation_id":"53283494-a6e1-490e-9314-547247250b80","resolution":{"observed_at":"2026-08-04T07:56:46.107061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-08-20T04:08:34.710482Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-04T07:56:46.211072Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.211072Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:559a1622b136a218e8734bde2e904b9e1edcedb78e7cc4ea59038227231ab0a3","observation_id":"881e3b73-1110-4772-9f13-8601f252e676","resolution":{"observed_at":"2026-08-04T07:56:46.211072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:56:46.312568Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.312568Z"},"links":{"citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:bd021e6eac58ea23fb415ba6a6030252d036bb6eb0587b16c1882b898df8e32e","observation_id":"43d7f39d-9f5c-48a5-833c-98136f934a23","resolution":{"observed_at":"2026-08-04T07:56:46.312568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-14T00:11:28.443916Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-04T07:56:46.376327Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.376327Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:8a7466f05737e1b370e59091e11970e4913e4845e14b96e1f14b6afd1ce9e07b","observation_id":"0c1c197b-2910-421a-b4f6-af84b593fac8","resolution":{"observed_at":"2026-08-04T07:56:46.376327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-04T07:56:46.446556Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.446556Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:c3786f7cbaed61cc9da657ac3cca8bb42faf1e2cae307e3b1568ded8add3de3d","observation_id":"b70fef98-0b36-4922-815d-b009d1471623","resolution":{"observed_at":"2026-08-04T07:56:46.446556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:56:46.502349Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.502349Z"},"links":{"citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:5f85d520065cc1764373ff98b2c5103b40e5272915a074b1e93de788d99ffb5c","observation_id":"021f8d04-102a-46b9-8d57-c22f8d372532","resolution":{"observed_at":"2026-08-04T07:56:46.502349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03872","last_updated":"2017-06-12T23:57:48Z","snapshot_observed_at":"2026-08-14T20:54:29.288695Z","submitted_at":"2017-06-12T23:57:48Z","title":"Six Challenges for Neural Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03872","snapshot_observed_at":"2026-08-04T07:56:46.579280Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.579280Z"},"links":{"cited_paper":"/paper/1706.03872","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:5ccb529f5ec86bc2bc6fe1e8e1008cd4b6e7eb7e53e90c5cf213ef00c28a4969","observation_id":"7a8fa645-9e8a-43c9-b9ee-0c03bf070808","resolution":{"observed_at":"2026-08-04T07:56:46.579280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16129","last_updated":"2026-05-30T09:48:39Z","snapshot_observed_at":"2026-08-18T01:57:24.551549Z","submitted_at":"2025-04-21T07:03:54Z","title":"MARFT: Multi-Agent Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16129","snapshot_observed_at":"2026-08-04T07:56:46.663818Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.663818Z"},"links":{"cited_paper":"/paper/2504.16129","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:1d049e51af683823fe09509d69716778d5db5ff405860a78fd41be4a6a1943a1","observation_id":"a4c744a8-7fc4-4fc7-a50f-d1ac819ee512","resolution":{"observed_at":"2026-08-04T07:56:46.663818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:56:46.737622Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.737622Z"},"links":{"citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:7a9615f0f2d17f9f3b7ac62a4b138e70a28628c23c96798a18672c0a9404b1d5","observation_id":"ccd2f73c-dac3-476f-90d9-542b1c7f04b8","resolution":{"observed_at":"2026-08-04T07:56:46.737622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03723","last_updated":"2025-03-01T01:43:31Z","snapshot_observed_at":"2026-08-19T19:57:31.579790Z","submitted_at":"2025-02-06T02:26:47Z","title":"Speaking the Language of Teamwork: LLM-Guided Credit Assignment in Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03723","snapshot_observed_at":"2026-08-04T07:56:46.797195Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.797195Z"},"links":{"cited_paper":"/paper/2502.03723","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:e06fabdf1a8ab53ba26fd355d2d0392ec33e15c2949fdf4642560ef0955b72ef","observation_id":"61540494-045a-46b4-b6e9-baa27c71ad69","resolution":{"observed_at":"2026-08-04T07:56:46.797195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-04T07:56:46.894742Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.894742Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:cd51b8889e6b4140253a8ed6d9ff768920b9d452de107333ffa1dd7013c87318","observation_id":"48877fb9-e9cd-4017-825f-afe11f9ab73f","resolution":{"observed_at":"2026-08-04T07:56:46.894742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16863","last_updated":"2025-02-24T05:56:47Z","snapshot_observed_at":"2026-08-18T22:05:39.316421Z","submitted_at":"2025-02-24T05:56:47Z","title":"Leveraging Large Language Models for Effective and Explainable Multi-Agent Credit Assignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16863","snapshot_observed_at":"2026-08-04T07:56:46.965356Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:46.965356Z"},"links":{"cited_paper":"/paper/2502.16863","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:2daafd187773bf8a2efde2021714ebff530207505e4fb7291c7fbb0f8801477c","observation_id":"1ef2ecb1-3502-4295-9f9a-d9a99d76b874","resolution":{"observed_at":"2026-08-04T07:56:46.965356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-13T20:49:59.656333Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-04T07:56:47.011678Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:47.011678Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:3ad1a586c4e3da3251c39bd4f0cef870d25df01c0536304d52c8e3c8ec45e124","observation_id":"aa185488-4eb0-48e8-8ae1-8d51f677c548","resolution":{"observed_at":"2026-08-04T07:56:47.011678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-04T07:56:47.083055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:47.083055Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:475d2a3b4acd24e2727afe64a7c69efd06bcaec31395f526d2ca3eb8074d956c","observation_id":"479e194e-4b08-45f6-b0b4-2035b59a8ee8","resolution":{"observed_at":"2026-08-04T07:56:47.083055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-20T01:46:00.683780Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-04T07:56:47.157332Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:47.157332Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:a7922aaa32999eb74c64f1786021a1431712b97f36b24f7476a72ca86ab8764a","observation_id":"e81255b8-ca8b-4fa4-a25f-17e737f2a235","resolution":{"observed_at":"2026-08-04T07:56:47.157332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-04T07:56:47.291212Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:47.291212Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:c71b5d0f1071b70b331e1422a92c92f177a44013a43aad6aa8486a3790ca78a2","observation_id":"cf0f3b42-89d9-4fe8-b040-d0d9f591fd22","resolution":{"observed_at":"2026-08-04T07:56:47.291212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-04T07:56:47.435790Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:47.435790Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:f2665a42f0c3bbb30c9af1ba228b2710b16f067da8c07bc5c1fca6db919b3bae","observation_id":"1525c82c-fdbb-405e-a361-e760530203a1","resolution":{"observed_at":"2026-08-04T07:56:47.435790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.09582","last_updated":"2018-10-27T00:19:00Z","snapshot_observed_at":"2026-08-14T18:35:54.421277Z","submitted_at":"2018-08-28T23:50:22Z","title":"Breaking the Beam Search Curse: A Study of (Re-)Scoring Methods and Stopping Criteria for Neural Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.09582","snapshot_observed_at":"2026-08-04T07:56:47.604970Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:47.604970Z"},"links":{"cited_paper":"/paper/1808.09582","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:3bd5f8d7d5a48b1bc74e888afa9cdfb1e004b27c11152d1a8ab2445484144968","observation_id":"0f56fec8-7d61-4596-9512-7fee015ef8da","resolution":{"observed_at":"2026-08-04T07:56:47.604970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:56:47.764276Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:47.764276Z"},"links":{"citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:eb16370659d138617185c11c952718b94d906cb99e5f20cb5f38bd556d18673e","observation_id":"4314658c-e392-409d-8aa4-778ee98c19c7","resolution":{"observed_at":"2026-08-04T07:56:47.764276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06737","last_updated":"2025-06-26T20:39:38Z","snapshot_observed_at":"2026-08-17T04:10:46.126733Z","submitted_at":"2025-02-10T18:03:36Z","title":"VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06737","snapshot_observed_at":"2026-08-04T07:56:47.849322Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:47.849322Z"},"links":{"cited_paper":"/paper/2502.06737","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:7e95e5d3f8426ac778de4d26bcb1d3e4e19f0954850752f131a7937eb0ac6dc5","observation_id":"f4f44dfe-ee49-448d-9142-681886b99854","resolution":{"observed_at":"2026-08-04T07:56:47.849322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11782","last_updated":"2025-02-06T15:37:52Z","snapshot_observed_at":"2026-08-16T20:58:20.513341Z","submitted_at":"2024-10-15T17:01:21Z","title":"G-Designer: Architecting Multi-agent Communication Topologies via Graph Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11782","snapshot_observed_at":"2026-08-04T07:56:47.964740Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:47.964740Z"},"links":{"cited_paper":"/paper/2410.11782","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:ba9988997c9db8166a5637018304e3a326098cd1469dec38c90df8ab3783d2eb","observation_id":"525660d8-24af-4269-b8ea-866c6bd7e667","resolution":{"observed_at":"2026-08-04T07:56:47.964740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:56:48.047690Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:48.047690Z"},"links":{"citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:a7268e3bfd6f6c0e6b5cec232cdc8e723559f96140a94682abb4e72862d4acb1","observation_id":"efbc73d8-16ad-4a69-b59b-a06923dfcd0d","resolution":{"observed_at":"2026-08-04T07:56:48.047690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","latest_version":3,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-19T17:41:43.749101Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2510.24803."}