{"as_of":"2026-08-07T19:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c4e6272185748c701284b1eea942cb6c689ab4604b97c07fe0e9f2ccb54bd61c","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:34:57.251159Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24833/citation-record","integrity":"/paper/2607.24833/integrity","json":"/paper/2607.24833/citation-record.json","paper":"/paper/2607.24833"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:52.667421Z","title":"2026 , note =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:52.667421Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:d0746feceaf62cd151d8a9aacd2ac20f058a8a6d9c85dd40104205a6e8101bfd","observation_id":"81b18e99-c7e4-4435-892c-76782d9ce4ee","resolution":{"observed_at":"2026-08-01T07:34:52.667421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:52.720900Z","title":"2025 , note =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:52.720900Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:f6043b14a230e2bf4b9d8fa09bf15b407434b659256a022cb6601b30bab3e872","observation_id":"244961c9-8f48-4f6b-8f4c-cce26612c28c","resolution":{"observed_at":"2026-08-01T07:34:52.720900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:52.808847Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:52.808847Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:1e9d7c63f27c0c34f4c676e47d6f7252782970464d631cd1fe923dd0d2cb3912","observation_id":"04b29a83-3f63-4861-b4e5-29a1d2c9d395","resolution":{"observed_at":"2026-08-01T07:34:52.808847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T07:34:52.905598Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:52.905598Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:6dd03abe6aff62e0f8939dd8dc80b82e937f297a2e690a841d7f450514add8ca","observation_id":"ef391fe9-6136-4169-a24a-8f0556461d0b","resolution":{"observed_at":"2026-08-01T07:34:52.905598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.022906Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.022906Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:420648ea20224a828f1f4fd25d5280eb353712295211a074702433512413bc3a","observation_id":"6bacec8d-f120-4ce3-a2b7-db03af9e9a12","resolution":{"observed_at":"2026-08-01T07:34:53.022906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T07:34:53.089892Z","title":"arXiv preprint arXiv:1707.06347 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.089892Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:51b6e68ca57cff113bd4d5a148d87d5fbb33abee1dcabb07b64e5319a0816670","observation_id":"87a9d1a3-6d2d-4968-946a-4afa7233e0eb","resolution":{"observed_at":"2026-08-01T07:34:53.089892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.172408Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.172408Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:aaf5b3114e761973452e5645537e4001391327ad985cc9401e8ddfb42a556ddd","observation_id":"4cd58a9d-cc36-4cf6-98aa-2e3635c3c67f","resolution":{"observed_at":"2026-08-01T07:34:53.172408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.287453Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.287453Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:26776396005c81e5d3389790606cfbd525224a0406f28cf3be1285ecefd1af1f","observation_id":"35971f69-dcd6-420b-b6df-2ec85b50d6cf","resolution":{"observed_at":"2026-08-01T07:34:53.287453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.352958Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.352958Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:2d9e9988199bb9ff0b9612d0592e3a502c6497b63518898270d8b706443932ce","observation_id":"56b98f94-39ec-4418-b207-d4eaaeecbfb5","resolution":{"observed_at":"2026-08-01T07:34:53.352958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.462245Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.462245Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:2f9915a5783fe0150b7fe4a35acde2e8bf9339d45ca31a648d045438a3e088bc","observation_id":"03fce6f1-890c-438b-91ae-5704d09df196","resolution":{"observed_at":"2026-08-01T07:34:53.462245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.578840Z","title":", booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.578840Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:054de2b6ae89d868e78e67bf8fa5a931921a8090149421d9b175811afa85f5d3","observation_id":"6a91bba5-0c5d-40b4-823a-56c3226fb3c6","resolution":{"observed_at":"2026-08-01T07:34:53.578840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.652970Z","title":", journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.652970Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:c4cd2a205e86af6669dfc802f0cf27b83f5ed16ca8d02db318a37f6ab5a31183","observation_id":"501596e3-1294-47b5-ae47-ff65e4dff05b","resolution":{"observed_at":"2026-08-01T07:34:53.652970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.721806Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.721806Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:5cd98e6023c2f88eb5a30a4d3602554bcd5d7ad2039524b9449555e18f1321ba","observation_id":"ebb1ed94-b1b7-42a9-8472-a027ac6eb1e8","resolution":{"observed_at":"2026-08-01T07:34:53.721806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.842119Z","title":"and Zhang, Hao and Stoica, Ion , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.842119Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:4fd6b73452e511a2f757d68fc3909d0f7895e8f5b8f351ccc4d334b249ac178d","observation_id":"caa7f80d-8fa4-40ef-9fb1-2d1aef61493f","resolution":{"observed_at":"2026-08-01T07:34:53.842119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:53.929243Z","title":"2025 , note =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:53.929243Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:7776091ed72472c347493205c2231cbbb5d57649a92280fb68f58a7b155fd1b5","observation_id":"1df552fc-4245-4de6-ab8b-e5cb5d41a851","resolution":{"observed_at":"2026-08-01T07:34:53.929243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.016895Z","title":"2023 , note =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.016895Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:23818e41b49ddad3f894c19f1da11efc4929e25f513c8ea9c4dbf1d63bd835da","observation_id":"ecadc99e-6b6c-40d1-b1cd-007ea25f2f97","resolution":{"observed_at":"2026-08-01T07:34:54.016895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.072903Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.072903Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:f6953f4156bc93fb6f4ba3ca4afb4dddae600fbee9a96149e963f053dab27638","observation_id":"27bc778d-a9ab-4877-a035-5bc786942a90","resolution":{"observed_at":"2026-08-01T07:34:54.072903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.177432Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.177432Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:c5c5c25662a9c1da74ad814e35aee73d6579b30fd4092f59d7e2526fe13144ff","observation_id":"5b691810-3838-4793-961b-6550e5a5eb06","resolution":{"observed_at":"2026-08-01T07:34:54.177432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.255689Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.255689Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:b2589959ef2a83316bc9c2fb551ff1ef040d50692f3dd948295e4296c0f32693","observation_id":"e7a4c51a-2945-45bc-a7bd-2a6e11a2109a","resolution":{"observed_at":"2026-08-01T07:34:54.255689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.337048Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.337048Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:9f3bcd89c981bc450a2f16db64c60bc40d43561f3c16f33fdb6244e39b3ad89e","observation_id":"8569224e-5a1b-4503-bc37-8c8a8ad3c12c","resolution":{"observed_at":"2026-08-01T07:34:54.337048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.455969Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.455969Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:2713a9c00954d35cf220fea6e8810318ba3bf2f04019954ff3c21ceebfb8ecbc","observation_id":"a0fd8522-fee6-4c9a-b44e-29d9c7ae87e5","resolution":{"observed_at":"2026-08-01T07:34:54.455969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.537997Z","title":"Don't Tell the Answer, Truly Guide the Reasoning During","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.537997Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:275b2684cf65c444bbd669126a8028ee84cc526e95d32d6eeba302964f451822","observation_id":"7d5b5313-5282-441e-9b9e-0622dcf199e2","resolution":{"observed_at":"2026-08-01T07:34:54.537997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.601137Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.601137Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:b435cd8f6b28558b4e447f7640bdc1acb90b16a83f53ceab37d48e494bb9ee64","observation_id":"8c9d8cfe-5ecc-4540-9d30-8741ced11c91","resolution":{"observed_at":"2026-08-01T07:34:54.601137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.701839Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.701839Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:ae1b59c725bba42b6db502a4b34617d4ee65db4f4f332dc0c5ac1af71d5a3152","observation_id":"45429833-a9ff-4208-938f-93cba4343624","resolution":{"observed_at":"2026-08-01T07:34:54.701839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-06T22:01:12.035442Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06923","snapshot_observed_at":"2026-08-01T07:34:54.765756Z","title":"arXiv preprint arXiv:2509.06923 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.765756Z"},"links":{"cited_paper":"/paper/2509.06923","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:7de95ab684a256901c50dbc0c0d3273f24c0045048bdd9065d5d02ac4c7c0438","observation_id":"26c06b32-36c7-43d3-ba09-8a252be4e03a","resolution":{"observed_at":"2026-08-01T07:34:54.765756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:54.942938Z","title":"Boosting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.942938Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:0406f6d27a58be461a3eb60fc98cd4c46ac29c486cc4a8ef592ce891259fd8f3","observation_id":"b6635fc8-6287-485f-9f4f-f0b72cdaf244","resolution":{"observed_at":"2026-08-01T07:34:54.942938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.055430Z","title":"Train at Moving Edge: Online-Verified Prompt Selection for Efficient","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.055430Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:cc09eed9c665149b4e5e466375515ff34b98fbe2cd0694392c40c81336eb82f5","observation_id":"3dfea157-c72a-4a0e-aaac-d803c40e3597","resolution":{"observed_at":"2026-08-01T07:34:55.055430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.112071Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.112071Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:628eee988eb3ce530654612ec3d97adde69bc4ab33dcc577b9dfad9913d3c9a5","observation_id":"19fca2ce-0a71-4027-b71a-d83b82273fa7","resolution":{"observed_at":"2026-08-01T07:34:55.112071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.220532Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.220532Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:f5c322191f4998526a2088841a7cf3c3fe0064fe5ca896f8af7e520f2a2b195a","observation_id":"0733587a-51d5-43fe-bd4f-8fb3e44c8c28","resolution":{"observed_at":"2026-08-01T07:34:55.220532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.301544Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.301544Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:cae25d61ce874ccd4e6df4a4894bc79ea664136a2264a5df80014d5cad77546d","observation_id":"6156148b-691e-451a-9ee1-c8ad2f6d81d7","resolution":{"observed_at":"2026-08-01T07:34:55.301544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.388018Z","title":"Measuring Mathematical Problem Solving With the","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.388018Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:4f9d9c36f8dee95efd3a5964cd4bc023c3ea80cd6bf5f74e1caba5f26538486c","observation_id":"c30af885-3f78-4ee6-8acf-9c45f11113fd","resolution":{"observed_at":"2026-08-01T07:34:55.388018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T07:34:55.532748Z","title":"arXiv preprint arXiv:2110.14168 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.532748Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:2da8b7965b6cc7479eced4d98cc202677aa3936adb68cefee7aa85574cfb1bfe","observation_id":"2172d4fc-2eaa-4f1a-bd87-a8cd7a30081e","resolution":{"observed_at":"2026-08-01T07:34:55.532748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.602336Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.602336Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:51b2b55b0032f9e68a072534c9f0b18192baaebdc6bc09057f04e9b177a24b8e","observation_id":"30538229-4d0d-43fc-8c6b-b9800ed7363b","resolution":{"observed_at":"2026-08-01T07:34:55.602336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.683543Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.683543Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:10702b0cf619a46061f26eb51479bb135c5c7934829cc23bc18d86d3e06cb840","observation_id":"02d054e1-546e-4910-b105-ac5b7fbd7c13","resolution":{"observed_at":"2026-08-01T07:34:55.683543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.763796Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.763796Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:e6552a8674a11153c3b2320e6c25d4d11183cce7ed321fd3bf1044c0e638de42","observation_id":"036d2c91-1866-401b-bfe9-3eb6cbb782ba","resolution":{"observed_at":"2026-08-01T07:34:55.763796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.870328Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.870328Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:13277d19689017b19171449038d410d9027c837656bfd90ea99d76574c11a27d","observation_id":"d372dc61-e76c-4364-9a82-5502f9bf78b9","resolution":{"observed_at":"2026-08-01T07:34:55.870328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:55.960507Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:55.960507Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:495705b00d7e6e31a9e6a5bd61f472ccb965f2ef27c460d7f415a4a1e866267d","observation_id":"72e1f0de-0a34-46c2-a54b-8f58af08b9a5","resolution":{"observed_at":"2026-08-01T07:34:55.960507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.046520Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.046520Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:648aeec278104d04db6991b61e647c93703a96715cc93f0ad06bc47a8f515a75","observation_id":"0b6b5067-8c38-4037-b5e7-595390f58244","resolution":{"observed_at":"2026-08-01T07:34:56.046520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.122271Z","title":"Back to Basics: Revisiting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.122271Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:8db66fcd2f515f6dd59aaaf0f2f1b63b9c8840e6717b84b5f0c796618a509170","observation_id":"c956bc34-fda9-4db0-b9a6-724bbd67aa86","resolution":{"observed_at":"2026-08-01T07:34:56.122271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.231813Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.231813Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:b58d10a7d0dc80ea8a98f56803a60a0f343852e52f31f2be078b3ad6d014555b","observation_id":"53302985-149c-4556-896b-0afd4b18c722","resolution":{"observed_at":"2026-08-01T07:34:56.231813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.376887Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.376887Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:8de30878634af163ae124c00383017893f9bbf3dada7cf7aa8dddaa4315d33e7","observation_id":"897bbd8e-ef9a-4d1b-a8bc-958357b59bb2","resolution":{"observed_at":"2026-08-01T07:34:56.376887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.525374Z","title":"Reinforced Self-Training (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.525374Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:24fe2b1f37c5787677713c29ac466bcfb6555283926288e9d7252d23f5c83676","observation_id":"1535bde9-33fa-4139-9187-8d966b499f80","resolution":{"observed_at":"2026-08-01T07:34:56.525374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.646520Z","title":"Transactions on Machine Learning Research (TMLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.646520Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:1f1f574160e2a1e051fba766c1c58941bf8718e0250383f24a1246d2507a6ed1","observation_id":"2a60d578-c1c2-4792-8300-0387304d60ce","resolution":{"observed_at":"2026-08-01T07:34:56.646520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-01T07:34:56.790463Z","title":"arXiv preprint arXiv:2403.04642 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.790463Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:d7446500be9d3570e3cbd4033ed8fa2f2ea376ed64fcfb60e741f0bb81624c3c","observation_id":"46f0c937-c1c1-42b7-b42e-7b9169cd431c","resolution":{"observed_at":"2026-08-01T07:34:56.790463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:56.971940Z","title":"2016 , note =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.971940Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:741341c2d922c38aaa3af7b413a148264b65eb2b65c6f473c994be4e1dcce40d","observation_id":"389b8b2e-45e0-4354-bbc4-4edca3600dab","resolution":{"observed_at":"2026-08-01T07:34:56.971940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:57.087681Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:57.087681Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:0c0488239e131af44965bc2637f9b979f859cd6af2d97d7ec42363d64ab42bf9","observation_id":"b79782fc-1867-4cda-847b-521e8cb4e170","resolution":{"observed_at":"2026-08-01T07:34:57.087681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-01T07:34:57.162319Z","title":"arXiv preprint arXiv:2107.03374 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:57.162319Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:fa9d55112a8a36741e2959e3c590ec47e350944b60173be8b169f87c95fd4435","observation_id":"294c8b0e-9dfd-4cb3-8a34-8b5fa2165ff2","resolution":{"observed_at":"2026-08-01T07:34:57.162319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:34:57.251159Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:57.251159Z"},"links":{"citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:6db35c049021229fda86ecafd55a2d135d678a8987439f85d3cd1f1cfab1dda7","observation_id":"f533e7ed-2f38-4c6f-8b49-9056c522fab1","resolution":{"observed_at":"2026-08-01T07:34:57.251159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2607.24833."}