{"as_of":"2026-08-06T18:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f3307f9f8c60ce4c0b0341eea8977f250a398a8c2009ff45bcc954fe886041e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:40:39.974766Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T09:42:04.234036Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-01T22:07:45.419539Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-20T09:41:59.979595Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2408.07199"},"observation_digest":"sha256:b88357eb707091e5b0e2046f5ecf7d869e909fe2ccaad598d464000f6731b43b","observation_id":"ded0495b-0a64-467b-9aa0-caf6eaca9810","resolution":{"observed_at":"2026-05-20T09:42:04.237687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-13T15:51:29.022336Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2412.21187"},"observation_digest":"sha256:0bc8e87df66a8fa545fa1a4daf04a6fd7f1d89714e6d0de48e563d8dfbafa7bc","observation_id":"547c4f5f-6ffd-45f1-9c91-fac1ba3bd1f3","resolution":{"observed_at":"2026-05-13T15:51:29.518054Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T21:20:59.128986Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2501.09686"},"observation_digest":"sha256:9a4dd3b11ef0548dfe1df634a3b48fccf97db7f0fb65fd47ebc37119f96bbdf5","observation_id":"6f125f57-580a-479a-98b2-a7d853c4db5d","resolution":{"observed_at":"2026-05-15T21:20:59.490615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-07-31T07:01:13.724738Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T15:04:22.690503Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2503.12937"},"observation_digest":"sha256:4f2e7b50777223d576d70376a251184a053fb66c5ed241c5c7330890d89077f2","observation_id":"b40e4971-2e58-423d-a19f-11be2b6f416e","resolution":{"observed_at":"2026-05-16T15:04:22.805429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2510.04595","last_updated":"2026-04-12T08:00:47Z","snapshot_observed_at":"2026-08-04T00:21:27.591930Z","submitted_at":"2025-10-06T08:49:04Z","title":"SpikingMamba: Towards Energy-Efficient Large Language Models via Knowledge Distillation from Mamba","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T09:44:53.290259Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2510.04595"},"observation_digest":"sha256:e32c99459188f8527228f21f2d11559d1a87f63c53cfac5b2a9dd0c0ffe32aa1","observation_id":"183659f9-af00-406b-ad67-4fea6c4eb65c","resolution":{"observed_at":"2026-05-18T09:46:12.439895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2510.10649","last_updated":"2026-04-16T14:51:36Z","snapshot_observed_at":"2026-07-06T22:32:27.698678Z","submitted_at":"2025-10-12T15:06:53Z","title":"Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T07:20:01.505216Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2510.10649"},"observation_digest":"sha256:d8a83a6d1aac5da7b725009f00d7708473b54eaf6e3f24154e3562e38dcb70bf","observation_id":"54ce838a-b3af-4aa0-ae8c-c181090fcbff","resolution":{"observed_at":"2026-05-18T07:21:04.436629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2605.09492","last_updated":"2026-05-20T15:55:09Z","snapshot_observed_at":"2026-07-06T23:21:35.327066Z","submitted_at":"2026-05-10T11:57:39Z","title":"APCD: Adaptive Path-Contrastive Decoding for Reliable Large Language Model Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-12T05:22:25.475956Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2605.09492"},"observation_digest":"sha256:791d6c7a1cb2e3afc08be322b9c59621b64b00bb36d29fef7da35ab9a5b8a5d8","observation_id":"eec809d2-b0ab-4299-903e-b35cfb1d93e6","resolution":{"observed_at":"2026-05-12T05:26:25.191736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2406.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":"2523ac3a-94a4-4667-a2ce-de8ecadb2936","year":2024},"citing_paper":{"arxiv_id":"2605.11974","last_updated":"2026-05-12T11:31:18Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:31:18Z","title":"Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-13T07:32:58.404947Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2605.11974"},"observation_digest":"sha256:39a6a221184e19f590da9cde24d4d12dd76b4952aae96469cb211b415c834545","observation_id":"3dd2b738-438b-4692-8fc8-673e0334ace8","resolution":{"observed_at":"2026-05-13T07:37:29.952562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2406.10858 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:569657b76718c02cc929bce7848613c59d82cf9b0198c4bebda531246501e34a","observation_id":"7080c4b6-4ef2-4eaf-87ae-ec831fef7d5b","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-02T08:40:39.974766Z","title":"arXiv preprint arXiv:2406.10858 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:39.974766Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3a14e8e1eb5a95e1b0c5e37f2f2528aa8a7b8f454d74ebd0a85bfcfcbaf924ca","observation_id":"a9acd4b2-4ebd-42bf-90a9-62837c84ed50","resolution":{"observed_at":"2026-08-02T08:40:39.974766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10858/citation-record","integrity":"/paper/2406.10858/integrity","json":"/paper/2406.10858/citation-record.json","paper":"/paper/2406.10858"},"outbound":[],"paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2406.10858."}