{"as_of":"2026-08-05T14:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48e1acb748150f47be40ad20cc5f8520757103855a9d7f0f40b11e2c8470d05a","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:32:16.230452Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:23:30.079906Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30420","snapshot_observed_at":"2026-08-02T07:23:30.079906Z","title":"arXiv preprint arXiv:2606.30420 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:30.079906Z"},"links":{"cited_paper":"/paper/2606.30420","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:eaf6019037c7eda414e36b27d49b99d3b7d91ab5d423985e3959706336c30997","observation_id":"79e6168e-577f-4be5-ba8a-bb1cfab2dcca","resolution":{"observed_at":"2026-08-02T07:23:30.079906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.30420/citation-record","integrity":"/paper/2606.30420/integrity","json":"/paper/2606.30420/citation-record.json","paper":"/paper/2606.30420"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-02T09:32:14.708381Z","title":"Accelerating large language model decoding with speculative sampling.arXiv preprint arXiv:2302.01318,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:14.708381Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:0d82afcc4b67cd9e9fc5ca2068583ab157a4f9d33135b48dfe1db5b56b3c0a28","observation_id":"1b286e9c-2af6-409b-83e6-3e0dc315ae09","resolution":{"observed_at":"2026-08-02T09:32:14.708381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04140","last_updated":"2026-07-01T03:04:05Z","snapshot_observed_at":"2026-08-04T11:33:53.462174Z","submitted_at":"2025-10-05T10:38:55Z","title":"Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04140","snapshot_observed_at":"2026-08-02T09:32:14.999192Z","title":"Leviathan, Y ., Kalman, M., and Matias, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:14.999192Z"},"links":{"cited_paper":"/paper/2510.04140","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:06cc79fa28012c9a913bb3c6d8ef4446f59bc2b417df8242077727b9aaa1e62b","observation_id":"c4049426-a120-4ed8-bbac-f7e342565507","resolution":{"observed_at":"2026-08-02T09:32:14.999192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09340","last_updated":"2025-06-11T02:44:10Z","snapshot_observed_at":"2026-07-06T21:40:07.249021Z","submitted_at":"2025-06-11T02:44:10Z","title":"RePO: Replay-Enhanced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09340","snapshot_observed_at":"2026-08-02T09:32:15.097798Z","title":"Li, S., Zhou, Z., Lam, W., Yang, C., and Lu, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.097798Z"},"links":{"cited_paper":"/paper/2506.09340","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:07b15ecf51ca0a7479936000bf47686d758924af090bd48963646ebfe3db69fc","observation_id":"7e20029b-a397-4cf4-a48f-87237f56c469","resolution":{"observed_at":"2026-08-02T09:32:15.097798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-02T09:32:15.163530Z","title":"Deepseek-v3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.163530Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:91a9189775caf1472e981dda5a1e6684e3847d399f3c221190fc133e87c1b699","observation_id":"28a77773-05bb-45a8-9677-2b533f386e3b","resolution":{"observed_at":"2026-08-02T09:32:15.163530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14117","last_updated":"2024-07-19T08:34:23Z","snapshot_observed_at":"2026-07-06T18:48:53.833921Z","submitted_at":"2024-07-19T08:34:23Z","title":"Rethinking Visual Content Refinement in Low-Shot CLIP Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14117","snapshot_observed_at":"2026-08-02T09:32:15.225984Z","title":"Rethinking visual content refinement in low-shot clip adaptation.arXiv preprint arXiv:2407.14117,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.225984Z"},"links":{"cited_paper":"/paper/2407.14117","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:c4c91b5dbd3bf5f2c22d71c379e11e53a01d37751634ed686ed1e83530cfdf72","observation_id":"88ce81f3-b224-4549-a5a6-bd6f3475d16f","resolution":{"observed_at":"2026-08-02T09:32:15.225984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:32:15.408939Z","title":"https://thinkingmachines.ai/blog/on-policy- distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.408939Z"},"links":{"citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:c16ec6e5da9d00375a127efe1c0ff7d43801df6e5a5cefc22081173c91e34b77","observation_id":"ebc7516d-45b9-46d4-ae73-c842eadf7ec7","resolution":{"observed_at":"2026-08-02T09:32:15.408939Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T09:32:15.469553Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.469553Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:26c710394e020a70503498feceff3fa2ae006e6ac63740279df18a2146ac3b8a","observation_id":"46386856-93fc-4390-8536-0a77a634251d","resolution":{"observed_at":"2026-08-02T09:32:15.469553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-02T09:32:15.610023Z","title":"Kimi k2: Open agentic intelligence.arXiv preprint arXiv:2507.20534,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.610023Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:c42de1a17c89acdc4a0f70a456b6653fc3df8dbf8f4d2be41a231fa2b8f49578","observation_id":"a216cc0c-c6e2-40fe-b94a-47990d50c1e2","resolution":{"observed_at":"2026-08-02T09:32:15.610023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-02T09:32:15.699226Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning.arXiv preprint arXiv:2506.01939,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.699226Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:d6240b3ca824cb4b81995d23466dc0fc478f5958b849f7d56f2c2b7474a38d95","observation_id":"6db0e7ed-3cb0-48b5-bb3d-71c657f378fe","resolution":{"observed_at":"2026-08-02T09:32:15.699226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:32:15.760120Z","title":"Quantile advantage estimation for entropy-safe reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.760120Z"},"links":{"citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:539d2a574560508e2610d79e90f0e16e1a536a42b0ef36ac85d9c307bbf22e30","observation_id":"42e7bb3d-c57d-4e99-977a-cb77b34051a2","resolution":{"observed_at":"2026-08-02T09:32:15.760120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T09:32:15.855961Z","title":"Yang, A., Yang, B., Zhang, B., Hui, B., Zheng, B., Yu, B., Li, C., Liu, D., Huang, F., Wei, H., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.855961Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:a721ce80c3a8340659dab09824e927f093e721c59c8b25b672fa4bd21e2bfa91","observation_id":"8845f0ac-26f2-429b-8ffa-f9e0d774395e","resolution":{"observed_at":"2026-08-02T09:32:15.855961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-02T09:32:15.949222Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.949222Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:5aadbd6aad74b3aae61269e8d960ab6a5409a9e6602219e846893aa279b446ec","observation_id":"45f2d38e-7cf3-41da-98eb-e44bb217ec08","resolution":{"observed_at":"2026-08-02T09:32:15.949222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:32:16.137794Z","title":"F., and Cheng, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:16.137794Z"},"links":{"citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:320c146327fb9fa7bba44daffc33fa801511edcc92c2d61191966d075ba66d9c","observation_id":"fd9f26d3-69e3-426e-a660-13a15d4e4569","resolution":{"observed_at":"2026-08-02T09:32:16.137794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-01T02:52:13.412687Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-08-02T09:32:16.230452Z","title":"Rlep: Reinforcement learning with experience replay for llm reasoning.arXiv preprint arXiv:2507.07451, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:16.230452Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:9148ef51133f0fd1c28af00ee453c63f44551ca83405974b83fc6c33bdbc9079","observation_id":"e9e37322-2c65-4c7c-9231-098e61e842ed","resolution":{"observed_at":"2026-08-02T09:32:16.230452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T09:32:15.540371Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.540371Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:0cf59cb2d6b3dd1368d7ea489da7ecbee20633a348715a3066bf926296718aac","observation_id":"2d8f3f81-f7d0-4d5a-a3a9-023ea96beba8","resolution":{"observed_at":"2026-08-02T09:32:15.540371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-02T09:32:14.770209Z","title":"X., Zhang, Z., and Wei, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:14.770209Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:695ad2ebc0380ae17eb57e3be71d7d70ea91684e98e58d7c872c3b9ddc8055ea","observation_id":"762ab9cd-ba14-4cd8-b8a8-54b961580eeb","resolution":{"observed_at":"2026-08-02T09:32:14.770209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-07-06T21:12:51.325430Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15619","snapshot_observed_at":"2026-08-02T09:32:15.287630Z","title":"Adavip: Aligning multi-modal llms via adaptive vision- enhanced preference optimization, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.287630Z"},"links":{"cited_paper":"/paper/2504.15619","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:bb4e263003d5d305ee1fb2c9959efe39c6b2c6cb24d97141dbc8aa6058ed887c","observation_id":"d05ecd30-59cf-4ae0-81dc-2c38046ca202","resolution":{"observed_at":"2026-08-02T09:32:15.287630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T09:32:14.841013Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:14.841013Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:b5ade2493df45206d9abb9e75e8920a1b218dba784a064362c1e05a039ee846f","observation_id":"a348c0b9-b62c-4b34-9f49-d751d50e7444","resolution":{"observed_at":"2026-08-02T09:32:14.841013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-02T09:32:14.933068Z","title":"Jaech, A., Kalai, A., Lerer, A., Richardson, A., El-Kishky, A., Low, A., Helyar, A., Madry, A., Beutel, A., Car- ney, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:14.933068Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:9b901bcb7198851a40766f9a0f7fc3ffc12d94fc74e3052c72979f3b3043fe43","observation_id":"cf5cb84c-5b23-49cd-9758-8fb274e39f43","resolution":{"observed_at":"2026-08-02T09:32:14.933068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2606.30420."}