{"as_of":"2026-08-14T13:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:96753c275c48efdaea1f2b79ce5b5514c847dc6dbb261f1939874a8acb3c9251","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:20:14.079797Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11681/citation-record","integrity":"/paper/2411.11681/integrity","json":"/paper/2411.11681/citation-record.json","paper":"/paper/2411.11681"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.755730Z","title":"G.; Guo, Z","venue":null,"work_id":"fd4cc18f-b7ae-47dc-9511-21a96f73caa9","year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.855145Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:5d050fa7e01baa973aba7ebb2589ffcaa36d23920cc351f8d03d8422ebef2464","observation_id":"4064787b-f7f6-443e-8f16-7f71e4de827f","resolution":{"observed_at":"2026-08-12T18:20:14.762028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.737908Z","title":null,"venue":null,"work_id":"07b986f1-50d5-435b-8e99-522a81564223","year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.862914Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:85d2bc7364bfcdead3aad5696dde1d6e00b1cdd7c1309e2c545cd64f4aed1cc3","observation_id":"aa7c7899-4785-4ec0-a6aa-cfd9ab8ec6e0","resolution":{"observed_at":"2026-08-12T18:20:14.743311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:13.869596Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.869596Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:47afda0b386e5f8e91054d7c4c862a3b44b5fb1c1f4cec49d17598bab4cfa309","observation_id":"f80b4755-1396-47f1-9daa-b465b198ac61","resolution":{"observed_at":"2026-08-12T18:20:13.869596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T18:20:13.876021Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.876021Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:045598c6462807435cacee094418e5818ee2317b57593eb9f66ffc48d3638e52","observation_id":"06e1e333-0396-420c-ae1e-1cf16f1ec4c3","resolution":{"observed_at":"2026-08-12T18:20:13.876021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:13.883203Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.883203Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:914f7fbe989b2cec370fac858365f3b7155c09da43815f563f070bad16f3deee","observation_id":"a0454d7f-5243-4c11-bf9b-2248ba093ae7","resolution":{"observed_at":"2026-08-12T18:20:13.883203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T18:20:13.890056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.890056Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:b94efdff92f2d66c780aff5f397745fd53eb6ce1a5c951196430aa1bcee153f9","observation_id":"8043d3c7-1bee-4bd9-afa5-387d339eff64","resolution":{"observed_at":"2026-08-12T18:20:13.890056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.693570Z","title":null,"venue":null,"work_id":"8fea5bd2-6566-4f7a-a213-d7263cd02c4d","year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.896845Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:343ff55e79368ad84e153331ca431eaf8f7e8fc4e2cc76566e994f63177e5994","observation_id":"eaccdb49-ae77-4a11-a633-333202d96141","resolution":{"observed_at":"2026-08-12T18:20:14.699714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:13.902327Z","title":"J.; Shen, Y.; Wallis, P.; Allen - Zhu, Z.; Li, Y.; Wang, S.; Wang, L.; and Chen, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.902327Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:8ab455ddea26b74e04d94fb048122b80435478b3d179dc29137d1253fe240c98","observation_id":"9497a753-89b6-4f82-9ce7-188687de12d1","resolution":{"observed_at":"2026-08-12T18:20:13.902327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.661076Z","title":null,"venue":null,"work_id":"e31af7b4-7178-4a95-9696-1b22f32f8b34","year":2020},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.907171Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:aa421631ba3c8b6573cadb2ebf60bd0283ae2ed535d03ca80f95f2c1d1024bd0","observation_id":"0f71042d-a3e2-432a-9b13-8d46bdd26366","resolution":{"observed_at":"2026-08-12T18:20:14.666411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04925","last_updated":"2024-06-22T08:18:48Z","snapshot_observed_at":"2026-08-13T04:45:32.719820Z","submitted_at":"2024-01-10T04:37:38Z","title":"The Impact of Reasoning Step Length on Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04925","snapshot_observed_at":"2026-08-12T18:20:13.912332Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.912332Z"},"links":{"cited_paper":"/paper/2401.04925","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:97db0e76ea261e43f1d1d4be05428cc5872c40efe1d7b7447fee67ad139ec9f3","observation_id":"1ac934fb-3d04-40f6-91a5-53573afec9ee","resolution":{"observed_at":"2026-08-12T18:20:13.912332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-13T05:54:24.242465Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-12T18:20:13.918672Z","title":"S.; Reid, M.; Matsuo, Y.; and Iwasawa, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.918672Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:ef51074b64437a00d4f640f33a67edff6033213dba1cc052b039a7b984cfed41","observation_id":"17919b9b-4c53-43bc-83b3-d6b809a27bc3","resolution":{"observed_at":"2026-08-12T18:20:13.918672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-12T18:20:13.925085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.925085Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:cfbee768624bddf7def93fd21bf1d365f2eb579d9a8e5badaa4269c2fc5f17e3","observation_id":"bf05dcc1-26d7-43c1-8876-d01f3cb28f33","resolution":{"observed_at":"2026-08-12T18:20:13.925085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.642655Z","title":null,"venue":null,"work_id":"ff9d228c-5bb7-43b7-a943-3c99443d3ad1","year":2011},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.931585Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:910ea35c17dd6dae7c336a35b05d7f90251185f47d716dd2de1a0eb660a876d9","observation_id":"c4802d0c-712b-4a43-b151-360f2d971be9","resolution":{"observed_at":"2026-08-12T18:20:14.648304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.619452Z","title":null,"venue":null,"work_id":"87ff03ab-20f7-4560-bd58-e7eb6b7ef022","year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.937717Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:ab605af74e6eec05d4cd5522b292b4f562c49632e5fae83c547f48b9a0e794fe","observation_id":"80bd7a93-1d16-4484-a643-d5174506a6a4","resolution":{"observed_at":"2026-08-12T18:20:14.626816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-12T18:20:13.943239Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.943239Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:b228f2272f5577bffa9d105dcb9a8b886a88f2f4d568937921a220ce344ab45c","observation_id":"288e386e-b59c-470a-8802-5dd726898d8c","resolution":{"observed_at":"2026-08-12T18:20:13.943239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-12T18:20:13.949599Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.949599Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:dea0e3ae3b437bbe891b8ca7277eb78a867b26b12ffb01d4abc52627f170d021","observation_id":"3637dcc3-b26e-4069-b076-782c3ec85f84","resolution":{"observed_at":"2026-08-12T18:20:13.949599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10080","last_updated":"2023-10-16T05:21:50Z","snapshot_observed_at":"2026-08-13T05:48:49.091450Z","submitted_at":"2023-10-16T05:21:50Z","title":"Let's reward step by step: Step-Level reward model as the Navigators for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10080","snapshot_observed_at":"2026-08-12T18:20:13.956530Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.956530Z"},"links":{"cited_paper":"/paper/2310.10080","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:6ce5b6461fc475e06c7a270d8a819e6bfefd4063088bf16c29778a656c8cd1b4","observation_id":"935a371f-ddf4-4ee1-b8bc-22d547689031","resolution":{"observed_at":"2026-08-12T18:20:13.956530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.598748Z","title":"L.; Bari, M","venue":null,"work_id":"a623ced1-e793-49d3-bfc4-3cb54ae726cc","year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.964313Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:883921add6581a1780fbece6ff12d9b38e7780863d6f0a25a96f3187c02cb39a","observation_id":"69447051-366a-465c-8477-f75bb9e5cf60","resolution":{"observed_at":"2026-08-12T18:20:14.605398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:13.971334Z","title":"L.; Mishkin, P.; Zhang, C.; Agarwal, S.; Slama, K.; Ray, A.; Schulman, J.; Hilton, J.; Kelton, F.; Miller, L.; Simens, M.; Askell, A.; Welinder, P.; Christiano, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.971334Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:30def00bd99a09755c812d7fd6070915afcbbf58a53d7fc013b4605715039d1c","observation_id":"0c50e244-fe21-46ca-8f14-cea0f08fe4e8","resolution":{"observed_at":"2026-08-12T18:20:13.971334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:13.978109Z","title":"D.; Ermon, S.; and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.978109Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:39e642886f51f2217a24d6777e11a151214cd28a73ff5d0cac84ccf07d262b80","observation_id":"9a045a4e-846e-477d-a9fe-30b6ebb88054","resolution":{"observed_at":"2026-08-12T18:20:13.978109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T18:20:13.984199Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.984199Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:c91cd7f2a2901743da92f137f551fdcc9693bf4af987b077c3d54a7820d2a8f3","observation_id":"23db6937-3951-40e4-9360-c451fe2ac361","resolution":{"observed_at":"2026-08-12T18:20:13.984199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T18:20:13.990185Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:13.990185Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:bfc666ce4c97c0e9237a46c1d96546c3943ca0c8836c0dacf639f0f77a4c0d76","observation_id":"9da5c1f5-4f36-48fc-b445-30169a388486","resolution":{"observed_at":"2026-08-12T18:20:13.990185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-12T18:20:14.001444Z","title":"F.; Siegel, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.001444Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:d24e23994de6f0e6b2c1af9457f5c830c3b1594626d39737b6a00afcb3b127cf","observation_id":"69932421-385d-4f3a-9afc-315608672f4b","resolution":{"observed_at":"2026-08-12T18:20:14.001444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-14T10:08:59.886019Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-12T18:20:14.014172Z","title":"X.; Dai, D.; Li, Y.; Chen, D.; Wu, Y.; and Sui, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.014172Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:23cd945d46b1c785138f81a4ea8e81641ec6a960ee592bc496253a8a83707cb7","observation_id":"7ac11809-c912-46ac-a4e3-d6e3c29ad4a2","resolution":{"observed_at":"2026-08-12T18:20:14.014172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.555352Z","title":"V.; Chi, E","venue":null,"work_id":"e2dd9619-c404-4d14-b4c1-9302137142c6","year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.020060Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:198a234053adac1bca15dd58f915cd9ea5e1979596660e09baf921a1b34344da","observation_id":"7a8d09c2-9393-499f-af82-283e414df92d","resolution":{"observed_at":"2026-08-12T18:20:14.560218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-08-13T10:48:54.433250Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-12T18:20:14.025705Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.025705Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:ae2975aa533aaeb46594366bffc2b175212ca9730e0a890b2a3bd9777bb06bf7","observation_id":"d195a577-dc7f-4dc9-bf04-853b4077e306","resolution":{"observed_at":"2026-08-12T18:20:14.025705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-12T18:20:14.032820Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.032820Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:0bf89ef7309385caec764a702c554dc25874a2aed4da75bc73b0bfbfc8fd3a20","observation_id":"c7a366ea-27b8-4c33-909a-2a9edaa7432d","resolution":{"observed_at":"2026-08-12T18:20:14.032820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.535519Z","title":"H.; Le, Q","venue":null,"work_id":"fb830170-47d1-488c-802a-589341ac96f7","year":2022},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.038622Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:b398e346e9302d22a726026d0fa90888926023d210f7e0679367c25caf8063f9","observation_id":"573e6d72-f60c-4d78-8631-f0b8bf4e563e","resolution":{"observed_at":"2026-08-12T18:20:14.542206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-12T18:20:14.043754Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.043754Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:f12f6749b0dcde70d1cd5ebc1d9efae2d04a767fbb77c601a3a6f138ef2b3546","observation_id":"79d8f286-c094-44d7-87c7-74217c82891a","resolution":{"observed_at":"2026-08-12T18:20:14.043754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.513387Z","title":null,"venue":null,"work_id":"e9eef47b-6ed5-4df6-b5a9-c4eab5466ba9","year":2023},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.049470Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:c2529174686d3142b68432097d1431743b6e5280dbe2c94d73de10b8d4d21ff4","observation_id":"df8da85d-3057-4c60-847e-8f10c225b51b","resolution":{"observed_at":"2026-08-12T18:20:14.520712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-12T18:20:14.055687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.055687Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:c3909b324810aeba6c32648f6a075724db28890e75eead4f2a9cd93faa8422fc","observation_id":"ec768db9-f861-464d-ae29-35ae60d00303","resolution":{"observed_at":"2026-08-12T18:20:14.055687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-14T03:57:25.019190Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-12T18:20:14.061179Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.061179Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:57b80c2658f5c797151f4dff148219fa72d392367192be3d9983a8b9af2031c7","observation_id":"e065f485-159f-40ea-b431-68dd1d3c3f96","resolution":{"observed_at":"2026-08-12T18:20:14.061179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-08-13T00:19:13.755361Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-12T18:20:14.066939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.066939Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:b7b605cd62aa988730cfa191b1961f3e209ea731ff533b6c79d1de33d672f567","observation_id":"948fde31-2f2d-4ef5-8106-19293324a369","resolution":{"observed_at":"2026-08-12T18:20:14.066939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.073328Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.073328Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:4fbf87ac9d67009ff76009bb948a9fd258f4273c2fab4363d13d35ef6ac0cdaf","observation_id":"3e0b9875-2783-407a-a813-3cbad5e146a6","resolution":{"observed_at":"2026-08-12T18:20:14.073328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:20:14.079797Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T18:20:14.079797Z"},"links":{"citing_paper":"/paper/2411.11681"},"observation_digest":"sha256:664c360234796af240baf516f6ae166c7415afbaca8533eb8ffb8fc8eaf0879d","observation_id":"de6d25ca-9a10-465f-b98d-d47e637beaef","resolution":{"observed_at":"2026-08-12T18:20:14.079797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11681","last_updated":"2025-05-14T14:01:23Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T12:40:54.322573Z","submitted_at":"2024-11-18T16:03:51Z","title":"PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2411.11681."}