{"as_of":"2026-08-19T10:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5913d6bf85efd9f633acf238ec12ed3ccfa35072240f16d7e1c0b148f816019","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:39:13.949389Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27888/citation-record","integrity":"/paper/2607.27888/integrity","json":"/paper/2607.27888/citation-record.json","paper":"/paper/2607.27888"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:39:11.095503Z","title":"InInternational Conference on Learning Representations, volume 2024, pages 21246– 21263,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:11.095503Z"},"links":{"citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:6284da57c10cb204c6bb1287eab63b99518556e7c9960d25b2cb731e7bf82576","observation_id":"3d621b43-55bc-4517-9498-680bc761f185","resolution":{"observed_at":"2026-07-31T23:39:11.095503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-31T23:39:11.337777Z","title":"Deepseek-r1: Incentivizing reasoning capa- bility in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:11.337777Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:c4fe6379a627d29641efd1c8ea89c757faf5ec693053e64d415399bb16883d28","observation_id":"edd6685a-cf3e-4f98-a13a-aa63b8682c38","resolution":{"observed_at":"2026-07-31T23:39:11.337777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-31T23:39:11.428331Z","title":"Reinforcement learning via self-distillation.arXiv preprint arXiv:2601.20802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:11.428331Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:f2e2c7a94adaa985073b6368912c29c74539b0f15d98dfe662a46e1ae7c6f280","observation_id":"322fe685-36cd-4ad0-8c23-39f7df92f425","resolution":{"observed_at":"2026-07-31T23:39:11.428331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-08-14T14:46:28.605827Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-07-31T23:39:11.506494Z","title":"arXiv preprint arXiv:2603.07079,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:11.506494Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:63895045038e23c879d1210d97d64a7ccb9fe461de31e96177868450473524ed","observation_id":"8f920095-11f5-4120-ae17-c4e1d2a8c330","resolution":{"observed_at":"2026-07-31T23:39:11.506494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-16T16:55:23.982163Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-31T23:39:11.667302Z","title":"Vineppo: Refining credit assignment in rl training of llms.arXiv preprint arXiv:2410.01679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:11.667302Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:e925169ca6be17e7595e916384cd22b00536f7282b4b9285b384bffae56a8af8","observation_id":"61fc87b8-3b93-4468-85a1-b746303ea32b","resolution":{"observed_at":"2026-07-31T23:39:11.667302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-16T14:21:03.535260Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-07-31T23:39:11.831350Z","title":"Distillm: Towards streamlined distillation for large language models.arXiv preprint arXiv:2402.03898,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:11.831350Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:7c7084c0256a8280a204e18d79a35ee2f7f1e56cb78717e737bc72b5cd55cae9","observation_id":"c1b745d8-005e-434f-8ad3-6f3bbae76750","resolution":{"observed_at":"2026-07-31T23:39:11.831350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-07-31T23:39:11.998170Z","title":"Tulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:11.998170Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:ddc3bc1ee9a4729efbd7ffcc798e9da9ec154cb87234f01db4971855f008a391","observation_id":"16e5ab63-285d-4a4f-9d20-c3d3a8f84e86","resolution":{"observed_at":"2026-07-31T23:39:11.998170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:39:12.155460Z","title":"Unifying group-relative and self-distillation policy optimization via sample routing.arXiv preprint arXiv:2604.02288, 2026a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:12.155460Z"},"links":{"citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:e4f8df674da12a95301f4e136217464c6c3a22caf6e04eb40e9517c6832aaa2b","observation_id":"183c51a9-b916-4a7d-9171-b06bf3c2cfdd","resolution":{"observed_at":"2026-07-31T23:39:12.155460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-31T23:39:12.344922Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:12.344922Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:de82219b00b22cb2f414b1b1c46f6054239ca11bfcf0c54a620ec1a26c19eebb","observation_id":"8c4addac-5f3d-4248-b34d-7bf335645e1f","resolution":{"observed_at":"2026-07-31T23:39:12.344922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-07-31T23:39:12.628880Z","title":"MAA and Math-AI","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:12.628880Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:741eb3af28007e4aa0778c5446c5fd1dab9ee3132a852ab8eb9fceb806dc42d2","observation_id":"eb090669-7c15-4964-ad5d-345e27283d08","resolution":{"observed_at":"2026-07-31T23:39:12.628880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:39:12.988092Z","title":"Grpo-𝑙𝑎𝑚𝑏𝑑𝑎 : Credit assignment improves llm reasoning.arXiv preprint arXiv:2510.00194,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:12.988092Z"},"links":{"citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:3daedac46086e5796d60e585e09626c2f51e9cf54852712c8fcf7c66b18feea1","observation_id":"77ad272d-02cd-4f1c-93bf-3346b51c8861","resolution":{"observed_at":"2026-07-31T23:39:12.988092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-31T23:39:13.080946Z","title":"Privileged information distillation for language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:13.080946Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:46a3872118df700ab57bbb45b4984fb188b7803b4f9939e1ddb94ac9c97327ce","observation_id":"b1cba096-2ea0-40f9-8879-457da848da60","resolution":{"observed_at":"2026-07-31T23:39:13.080946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T23:39:13.177100Z","title":"Deepseekmath: Pushing the limits of mathe- matical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:13.177100Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:2e1b884cdbd821b2e1624f507e22532401fa9916d30b3586b80d5f3c0e769a18","observation_id":"6b1bbf5c-41cc-4576-a408-91fe4a20ffee","resolution":{"observed_at":"2026-07-31T23:39:13.177100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:39:13.289349Z","title":"Gtpo and grpo-s: Token and sequence- level reward shaping with policy entropy.arXiv preprint arXiv:2508.04349,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:13.289349Z"},"links":{"citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:fc4eeddcb9a85ce3c2337c5866df4449b2407c1faf975e3b7d0800483508c759","observation_id":"31693278-5f59-40cb-9706-7d287d222e25","resolution":{"observed_at":"2026-07-31T23:39:13.289349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-15T06:47:01.322120Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-07-31T23:39:13.429089Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms.arXiv preprint arXiv:2506.14245,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:13.429089Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:0f9ae0e176e8a662e216c1bcc2411c25e11ab86e1713069c8b2219fd301bc79b","observation_id":"e44d51b0-8ae4-4ad0-9230-592978058a1f","resolution":{"observed_at":"2026-07-31T23:39:13.429089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-31T23:39:13.580396Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:13.580396Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:41fd8304a75d18c362eb0b39a03ad65780168a9d502b8eaa1abbe8a014856445","observation_id":"de69374a-2a35-4ff7-8f60-df09525962c5","resolution":{"observed_at":"2026-07-31T23:39:13.580396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-07-31T23:39:13.725332Z","title":"Self-distilled rlvr.arXiv preprint arXiv:2604.03128, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:13.725332Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:4ffde18e7e03d40f1461277d0ef605f454167757700eb96d03b81a139aaef96e","observation_id":"ab64159d-5729-4a3d-acd0-d45d501f6fb3","resolution":{"observed_at":"2026-07-31T23:39:13.725332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-31T23:39:13.864937Z","title":"Siyan Zhao, Zhihui Xie, Mengchen Liu, Jing Huang, Guan Pang,FeiyuChen,andAdityaGrover","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:13.864937Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:7b0c15139c1e3dd548ac8e3944032190cb56274dd86ba8df1b80147247fb1bb0","observation_id":"0f42df2f-2808-4c07-af13-d728d899ca50","resolution":{"observed_at":"2026-07-31T23:39:13.864937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:39:13.949389Z","title":"We consider only the clipped policy-gradient term and omit the KL regularizer","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:13.949389Z"},"links":{"citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:4ab407f2d5065c39ab3910c9508c4fea4994cd491923fb268928b1b0672be1ca","observation_id":"a5030ae9-4750-458a-b979-ebf7638713f3","resolution":{"observed_at":"2026-07-31T23:39:13.949389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-08-16T02:55:53.932381Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11709","snapshot_observed_at":"2026-07-31T23:39:12.802081Z","title":"A 40- problem benchmark derived from the 2023 AMC 12A and AMC 12B competitions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:12.802081Z"},"links":{"cited_paper":"/paper/2606.11709","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:a73c182ef199302d8e2af8819087f8dfb658402861b587e5ac5c4745647a27ff","observation_id":"118f39d8-b5a0-459f-9439-56551cfedf7d","resolution":{"observed_at":"2026-07-31T23:39:12.802081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00674","last_updated":"2026-05-15T17:10:37Z","snapshot_observed_at":"2026-08-17T12:39:54.496393Z","submitted_at":"2026-05-01T13:56:34Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00674","snapshot_observed_at":"2026-07-31T23:39:11.134603Z","title":"Beyond benchmarks: MathArena as an evalua- tion platform for mathematics with LLMs.arXiv preprint arXiv:2605.00674,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:11.134603Z"},"links":{"cited_paper":"/paper/2605.00674","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:0e8c40742e365d0b90636d3d2c59ba77abd93bfc84dab8bb88da25af48bbae4c","observation_id":"ada1cf51-ab70-4f6c-a054-2c96ffe3a358","resolution":{"observed_at":"2026-07-31T23:39:11.134603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:39:11.249027Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:11.249027Z"},"links":{"citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:ab408eddd083dec1f479dce10c336001ebca7f2760d0e9724df31ca285b54978","observation_id":"4c37452a-6277-4cc4-bf04-a4aa8b7de2ee","resolution":{"observed_at":"2026-07-31T23:39:11.249027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2607.27888."}