{"as_of":"2026-08-23T08:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2fe6da042fd131f847af49dec52d70fb1f6d4d225a085323e6565f78d0422c01","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T14:25:07.006233Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07976/citation-record","integrity":"/paper/2607.07976/integrity","json":"/paper/2607.07976/citation-record.json","paper":"/paper/2607.07976"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.512699Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633–638","venue":null,"work_id":"f01253de-58e9-4b0f-a91e-4ef797517a24","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:02bbf8f7118822eabc797ebc34a9652dfee3c7d0cb06d1b6fd38db1e05ffc5fd","observation_id":"6f939aa2-c97f-4ece-a945-caa962951124","resolution":{"observed_at":"2026-07-10T14:27:07.513959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.211","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"O lympiad B ench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":null,"work_id":"7b3c92e2-292d-4caa-8dbe-e949ccf083a8","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:c6b61b4ca17a25dabed55f9ed750a6373100467fd62c37d37abe02d765c16835","observation_id":"62f0072d-42cc-49d5-8032-ab5669f3fbfa","resolution":{"observed_at":"2026-07-10T14:27:07.150173Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:25.422554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:25.422554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.520833Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"aaf7b4c6-38c4-4c86-8301-75004f0fbf0d","year":2020},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:2bf96913bb36e3a6749318dab14cb41abd30901a6c6587ccb7a23d102db4a871","observation_id":"889c4786-37d5-48d0-b766-416aac88aafa","resolution":{"observed_at":"2026-07-10T14:27:07.522253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.508829Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":"54813747-7e4c-48be-bc31-034b0958cd20","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:7d4adad993b68df3e4f48e3ae6f9c8a8560e436cfba41bd472d5a505c5dfef0d","observation_id":"371fe2a7-ef04-4efb-918f-889151363546","resolution":{"observed_at":"2026-07-10T14:27:07.510160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.518215Z","title":"URLhttps://openreview.net/forum?id=IkmD3fKBPQ","venue":null,"work_id":"a4ec2d55-a9f2-49e3-9178-005d082a00f9","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:826e498766a4651b0707744b3c5a8637f769a166edd573886e0da83ecdc1e28f","observation_id":"5ca50a82-9f01-4344-85cb-904541018532","resolution":{"observed_at":"2026-07-10T14:27:07.519445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.16158","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.360614Z","title":"Execution-grounded credit assignment for grpo in code generation.arXiv preprint arXiv:2603.16158, 2026","venue":null,"work_id":"104a4156-d36a-4e15-8f04-bf795d67e387","year":2026},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:bb091c40d9445644ca2dc67695b10f857c9f0784522fe42359e5ab50d18e341a","observation_id":"d9cacb44-7e90-4b73-813b-888370759ec5","resolution":{"observed_at":"2026-07-10T14:27:07.362244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.518886Z","title":"Ramasesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman-Solo, Yuhuai Wu, Behnam Neyshabur, Guy Gur-Ari, and Vedant Misra","venue":null,"work_id":"b7c2e9af-42d2-4b07-9e68-e5eaaa27b3cf","year":2022},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:a33f6b38bb94b499c0e2c6c90330ff6ddf40bab77d5636b7f6af37017cbbde61","observation_id":"8f841fa7-bbd9-4c3c-80e9-94cd255008cc","resolution":{"observed_at":"2026-07-10T14:27:07.520180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:2ec9bb20b0f6f36f81b675cb924802f7dcc5df13e49fca4ac428b502bc7f8f17","observation_id":"c6b3cc15-1af5-43fc-a7ed-70a27c62fdc7","resolution":{"observed_at":"2026-07-10T14:27:07.380941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.513002Z","title":"Heterogeneous adaptive policy optimization: Tailoring optimization to every token’s nature,","venue":null,"work_id":"7077b45a-d731-4f08-a91d-57d9c4ab17a5","year":null},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:8dc606dcdbaa30af4bc7b4daac337a7b37e776ab879ae64fd0975d8158ebfe36","observation_id":"3c72e548-1c77-44d7-a5c6-9aee68ec78be","resolution":{"observed_at":"2026-07-10T14:27:07.514418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16591","last_updated":"2026-04-29T06:03:04Z","snapshot_observed_at":"2026-08-20T03:15:55.138448Z","submitted_at":"2025-09-20T09:30:25Z","title":"Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature","version":2},"cited_work":{"arxiv_id":"2509.16591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.16591","snapshot_observed_at":"2026-07-10T14:27:07.370554Z","title":"Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature","venue":"cs.CL","work_id":"cfba6900-dda2-48f5-bf23-d8cbf1d39a3a","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2509.16591","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:6b6138bd7336e7c1c799dacf11b9a709a4e6c93c251b748851f637fac1b7a236","observation_id":"d853adc5-ed7e-40fa-8fcc-0e2ba6282484","resolution":{"observed_at":"2026-07-10T14:27:07.371938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.510745Z","title":"AMC23: American mathematics competitions 2023 test set","venue":null,"work_id":"56b53682-6b06-415b-b830-33ff04f3e940","year":2023},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:523b7c33fcfbdd38c4f772a559c73abebc1035a72e732c147bd5790cd425c7b6","observation_id":"d5004d3a-3942-49af-8c16-a1ef2d2c52fc","resolution":{"observed_at":"2026-07-10T14:27:07.512049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.516747Z","title":"Grpo- λ: Credit assignment improves llm reasoning, 2025","venue":null,"work_id":"fa96673f-eefe-4018-86b8-51c534b5bf53","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:a824dcd0f85469a9753b79d57c53ceed7bbc4de94d1ddca7f0c78de7350a4a8d","observation_id":"bf9449d8-30be-46c4-91ce-3ad63950abf8","resolution":{"observed_at":"2026-07-10T14:27:07.518110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-21T17:04:32.090035Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:6c871f2212fe084d60e556397e1b926d3d1e160b80c6700391e19f8b77452d68","observation_id":"43e0cafc-c7ab-40f5-b264-040dd8c5f203","resolution":{"observed_at":"2026-07-10T14:27:07.384161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:5699a910c382f6ae0265857e42b72b4345beebc53d7f79eda40bf9ef107e8035","observation_id":"6ab7f1fc-f10e-4e0c-a54e-7d8c23c246df","resolution":{"observed_at":"2026-07-10T14:27:07.366684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.04349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.358056Z","title":"Gtpo and grpo-s: Token and sequence-level reward shaping with policy entropy.arXiv preprint arXiv:2508.04349","venue":null,"work_id":"c337a3f9-8f7e-4f6a-b463-5f4193cee20b","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:4317c393737de77899035ba7b620169bcb96f2b2f11f262704564aec7264e9a3","observation_id":"e66dfbd5-cc9b-494f-9305-edaa05cb4812","resolution":{"observed_at":"2026-07-10T14:27:07.360085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.516380Z","title":"verl: V olcano engine reinforcement learning for llms","venue":null,"work_id":"4ae20b96-9778-4c02-914e-a1e02b7db19a","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:8f640255363b95759cbce65112124033fab02938fb0ad02036fa4f40c494662b","observation_id":"c4b2a6d7-bbc5-4613-9c20-d6e97f25b4ac","resolution":{"observed_at":"2026-07-10T14:27:07.517642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.498324Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"1fa2936e-92bb-492e-bfb6-c61bd9bd1b3a","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:4c732e0be915d2bce8f52235d8e134e67f01222722ab5ac17fb182cd50218ac4","observation_id":"a476cc92-eedb-4256-9b16-207b25f08939","resolution":{"observed_at":"2026-07-10T14:27:07.499701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.496383Z","title":"Neural text generation with unlikelihood training","venue":null,"work_id":"0caa69df-186d-4ad6-b03e-ace718564d7e","year":2020},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:58e8711136574ebb02e6dcf5d0cc175525d439c2143e874ddb5350ec494a5c7a","observation_id":"dd27a7bb-7cf1-493e-a2b6-7b234622c20e","resolution":{"observed_at":"2026-07-10T14:27:07.497765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.500292Z","title":"Self-ensemble: Mitigating confidence distortion for large language models","venue":null,"work_id":"e181bfb9-7038-4ba4-bdee-73b42508d402","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:f6e894932d354214deb3290e045c41dbca1089ec6d705623396bc091645686f7","observation_id":"8a490e27-cb6f-4625-a5fb-a8c44d8a8a0d","resolution":{"observed_at":"2026-07-10T14:27:07.501760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.514967Z","title":null,"venue":null,"work_id":"03b2ed94-65b1-43ad-a5e8-b0f5c746c575","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:85f9731702de043079ebce724a4a5d76ccbd8d3a032eb064c1e2738764d63039","observation_id":"226c4206-eba7-4215-ba25-34ba9a82457d","resolution":{"observed_at":"2026-07-10T14:27:07.516170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22305","last_updated":"2026-06-21T02:19:17Z","snapshot_observed_at":"2026-08-17T17:04:07.691142Z","submitted_at":"2026-06-21T02:19:17Z","title":"Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2606.22305","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.22305","snapshot_observed_at":"2026-07-10T14:27:07.375901Z","title":"Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning","venue":"cs.CL","work_id":"a7b2a380-d9b4-479b-be52-c508b755ebe3","year":2026},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2606.22305","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:42ec29582779f95626e67e2bfc76254ce2d71fb6e8994f066e0c14ce00340153","observation_id":"e54299af-ac5a-4999-9d10-86526f99c937","resolution":{"observed_at":"2026-07-10T14:27:07.377916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:ea6f6fcfbb90c53861f83e57f677b9bc33d0e6b23e4289ce17c5a1515776ee67","observation_id":"be331791-00b3-4a40-975e-9490a234aa7a","resolution":{"observed_at":"2026-07-10T14:27:07.365296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.14209","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.367238Z","title":"Int: Self-proposed interventions enable credit assignment in llm reasoning","venue":null,"work_id":"32156c79-bbf0-4b3a-8319-d728be4814e8","year":2026},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:2259ca8badfc11b23dabf55aa56973043e3f1313d56270f0afa139cfa527a696","observation_id":"103c5305-bbf0-425a-91ae-708c593246de","resolution":{"observed_at":"2026-07-10T14:27:07.369395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:67105e3b9727be4907e8d933c455d15322b3c6dd793af96231e1f4c07947864b","observation_id":"de480b0e-a72d-4343-9e30-f44cbd760865","resolution":{"observed_at":"2026-07-10T14:27:07.374977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.522779Z","title":"American invitational mathematics examination (AIME) 2024","venue":null,"work_id":"4c9005f1-7796-4f60-b41f-5fee2717e833","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:4eb7a770cef48e8ea5ae51a914525aabcb4b38210cba7cc86b5a77de72e383da","observation_id":"552159d3-a99d-4695-b361-2ce62ababa40","resolution":{"observed_at":"2026-07-10T14:27:07.524036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.511196Z","title":"American invitational mathematics examination (AIME) 2025","venue":null,"work_id":"015829c9-e4dc-4d0f-b381-89be24596f99","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:edbac23d8e0a7a2bdb00a7b68fdaade6c8303c88fda2e166015cda6ff280c03c","observation_id":"f0ae9229-216b-4b9c-8ece-02462de4d7f8","resolution":{"observed_at":"2026-07-10T14:27:07.512495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-21T02:04:30.074424Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:065b9da034aee1fdc1a59e1146a9d35e7d653bc1e311b054020ac16cc13d7108","observation_id":"d144154f-0194-4292-88c3-3a36c45b58a6","resolution":{"observed_at":"2026-07-10T14:27:07.148343Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":11,"verified_fuzzy":14},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.07976."}