{"as_of":"2026-08-08T02:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:232b72a041e49eabebb3e13efb9fa9da2b37cf867cd7f6ba914af8c01272fbe2","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T01:31:13.934392Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27610/citation-record","integrity":"/paper/2607.27610/integrity","json":"/paper/2607.27610/citation-record.json","paper":"/paper/2607.27610"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:06.316159Z","title":"Geometry3K : A large-scale multi-modal geometry reasoning dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:06.316159Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:6f619c84eeaa364a63b28aafd234c1a7c777b87cf7c0eb1eefe4991712a13590","observation_id":"1c25651b-a4b8-4a13-aeb0-bdf29e2d307b","resolution":{"observed_at":"2026-07-31T01:31:06.316159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:07.118429Z","title":"Lewkowycz, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:07.118429Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:a1e530ad3baf02991585fb35e833d0c5bd53cd1934d79a60d6c6fe03a967913e","observation_id":"1a2e794c-f80d-46eb-a986-786232dd9f50","resolution":{"observed_at":"2026-07-31T01:31:07.118429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:07.900017Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:07.900017Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:92978b7d6b6ea01dc5b654fbc374c3719480dabaee57b397822c4386cde3f712","observation_id":"e42e9094-2009-45f7-8f7d-221c4ca2ea4a","resolution":{"observed_at":"2026-07-31T01:31:07.900017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:07.999383Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:07.999383Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:ac0c3b8c354cbef3fa1a50f827d89795adb1e69a0987dd61ef33d44ac201f261","observation_id":"dda7602f-c96d-4072-b9ad-4d6df2434769","resolution":{"observed_at":"2026-07-31T01:31:07.999383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:08.053283Z","title":"American mathematics competitions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:08.053283Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:d4ef39c93ba558a49ee94f72b0f708c07c3ffbb1283e27055a87d4e88e2cc981","observation_id":"1f2ced7f-357b-4639-a531-89f053522748","resolution":{"observed_at":"2026-07-31T01:31:08.053283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:08.165443Z","title":"American invitational mathematics examination, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:08.165443Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:c0ff3e15a096bcf5158d0725b705869146c6ca7e694301a5823d90acb6d34f2b","observation_id":"f05134d8-55f1-48e8-a3e1-31d07740462e","resolution":{"observed_at":"2026-07-31T01:31:08.165443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:08.249377Z","title":"American invitational mathematics examination, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:08.249377Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:b51393f89d2f1aa6689acca98a5dd585fd876cd80cfd95713468ed03d96feac9","observation_id":"d8f33ec3-3cbe-474d-b9fd-6bda0f7826f5","resolution":{"observed_at":"2026-07-31T01:31:08.249377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:08.322722Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:08.322722Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:8ed74a567e6511e13f290249c159e680e72826f7572623b6f086963a7d50ce32","observation_id":"10637e71-34e5-48c8-a440-83d3d5910da7","resolution":{"observed_at":"2026-07-31T01:31:08.322722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:08.449175Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:08.449175Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:3ccedc42f8faedc8bae9d965253dbd2cc50502fa577399e28c9295f343162873","observation_id":"8270d4cd-e7c3-406d-8fa7-f5f095e98d88","resolution":{"observed_at":"2026-07-31T01:31:08.449175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-31T01:31:08.916088Z","title":"Sheng, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:08.916088Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:4f67535f99382512004de71bb34da1e3f1c772489461c0ce2a05306aaf3c52d8","observation_id":"8b12c017-dd4e-4f1f-8514-87f5bc8b950c","resolution":{"observed_at":"2026-07-31T01:31:08.916088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-07-31T01:31:10.028378Z","title":"arXiv preprint arXiv:2405.07863 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.028378Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:111b9ec5bb4966e60c1cc2d30497e7f3efab58fda3d629a823c5294a0b9acaf7","observation_id":"315cf590-106e-40bb-96e7-5b1ee7ab8bac","resolution":{"observed_at":"2026-07-31T01:31:10.028378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-07-31T01:31:10.106143Z","title":"arXiv preprint arXiv:2310.12773 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.106143Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:07b2b2af7ed86dc0b981c66eeee2b4089828bf2f6ba93d00b28596c05b6cd966","observation_id":"cb355ebc-f8b7-45be-baec-e2f1b4b86ec4","resolution":{"observed_at":"2026-07-31T01:31:10.106143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-07T18:08:01.409989Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-07-31T01:31:10.167491Z","title":"arXiv preprint arXiv:2307.04964 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.167491Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:5f47454526bb358fb0c35c47a7168a36f207d8ab56c324c3def76f1303d03fc6","observation_id":"5b45bfb3-0e3c-4249-b41b-dc6be31f009c","resolution":{"observed_at":"2026-07-31T01:31:10.167491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-31T01:31:10.230567Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.230567Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:61c2617bdbb60fce3d3ca147163d2835ed7b8229c67f70cc39312491dd6a52c1","observation_id":"99c4092e-3461-4594-a35f-0f79c6d9c8b9","resolution":{"observed_at":"2026-07-31T01:31:10.230567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-07-31T01:31:10.370517Z","title":"5: Scaling reinforcement learning with llms , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.370517Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:008cc09b9194bce040f4684f1f6782435eeff62e84d09e567e0f6276d3817f43","observation_id":"0d071ac7-eea3-4461-aa21-e75dd95511bb","resolution":{"observed_at":"2026-07-31T01:31:10.370517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-31T01:31:10.439137Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.439137Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:00eac8107a42ef529cda93132213b55893e6a8935794556a04a62525b3055e70","observation_id":"aa2862f8-7d5d-4704-b836-75d1b55ce5a3","resolution":{"observed_at":"2026-07-31T01:31:10.439137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T01:31:10.541870Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.541870Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:76aadcb5c79683088f8243c1fcb83c8945ac43c71ef55aad64fa3e3788920e8b","observation_id":"f6bfdf97-439a-4c01-b640-5c1342779ad2","resolution":{"observed_at":"2026-07-31T01:31:10.541870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-31T01:31:10.613174Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.613174Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:fcbdc8d5849cca78bceff6b93ae093d8ee605c5749e7c8e65f254562749e9f1e","observation_id":"87f0f94c-469b-47e6-bc78-222da6881ad2","resolution":{"observed_at":"2026-07-31T01:31:10.613174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-07-31T01:31:10.682350Z","title":"arXiv preprint arXiv:2501.03262 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.682350Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:b523c3ffd6dd5fa5211ed6c7e48ba668a72e4fa32db0bc5f3b8de0eb7b1a8e43","observation_id":"bd59f526-a25a-444f-b760-3d3d64719d89","resolution":{"observed_at":"2026-07-31T01:31:10.682350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-07-31T01:31:10.784324Z","title":"arXiv preprint arXiv:2504.05118 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.784324Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:381966a316c7fcb389cf29c801571baa52c597dc2befcdc103abc618af886de6","observation_id":"3eec7c2b-382b-4f92-bdf7-c3502409e3d2","resolution":{"observed_at":"2026-07-31T01:31:10.784324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-31T01:31:10.823817Z","title":"arXiv preprint arXiv:2410.01679 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.823817Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:c9d1ef3b63800ca289a194b89fb6bcc4abac31935191ef1ed0b65ad225c8423c","observation_id":"3494809f-a207-4435-950f-a4ad60214071","resolution":{"observed_at":"2026-07-31T01:31:10.823817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:10.875349Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.875349Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:7639e155bf3d02f9baa41c4077fc7791b36b632122f15200974dc9044f2b858d","observation_id":"cee83150-c3c7-40dd-9acf-6b0203a2add4","resolution":{"observed_at":"2026-07-31T01:31:10.875349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-07-31T01:31:10.957470Z","title":"arXiv preprint arXiv:2502.03387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.957470Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:71575aaad090663ad973c6b71ed6459b2a8256c0df85e0c6c32707440b43e9c6","observation_id":"a3f8a8f8-5aba-43a7-9ab0-4c93541a3f3c","resolution":{"observed_at":"2026-07-31T01:31:10.957470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-07T18:12:08.883357Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-31T01:31:11.009307Z","title":"arXiv preprint arXiv:2502.11886 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.009307Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:82dd808cc6e0e367eb075dc5f199fe38726f34ba3ae42476caded9f166b7b23e","observation_id":"fd9d861c-ef6a-4fd8-b5e1-be805572c6a1","resolution":{"observed_at":"2026-07-31T01:31:11.009307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-07-31T01:31:11.152141Z","title":"arXiv preprint arXiv:2503.24290 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.152141Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:43065fe0c722d0d57827e33af30954fbd9f805b28a940ee53ec22db9b624f625","observation_id":"702dcb8c-7dca-4c49-a568-d82c8a3d717a","resolution":{"observed_at":"2026-07-31T01:31:11.152141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-07-31T01:31:11.290872Z","title":"5-math technical report: Toward mathematical expert model via self-improvement , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.290872Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:94c2c136d147908bc4dcb1065682d460722c1620ea8e5e8f0974b972b19c93a5","observation_id":"792a1834-98fb-490f-9da1-117a075cb528","resolution":{"observed_at":"2026-07-31T01:31:11.290872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:11.391974Z","title":"arXiv preprint arXiv:2504.05185 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.391974Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:80c5dd8c4fe3e340b61ca5c8e70ecff51dc28821f0e056183ea577b57d57defb","observation_id":"8ba65db4-5faa-4a7f-86b7-dcf9cc0c9b58","resolution":{"observed_at":"2026-07-31T01:31:11.391974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-07-31T01:31:11.492967Z","title":"arXiv preprint arXiv:2505.24864 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.492967Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:0f975e67a1cb95a2a6ea1be731cab92f46e0613fd31d259eff686390b226fdb1","observation_id":"7df0f2db-156f-4f71-9816-5ef0710f6e4a","resolution":{"observed_at":"2026-07-31T01:31:11.492967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-07-31T01:31:11.565942Z","title":"arXiv preprint arXiv:2502.01456 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.565942Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:65897274a9713a1941d2313fa223b2f3e91dd86037c45934628bdec510abc418","observation_id":"f6dbc0bb-644e-4bdb-bb01-bed382450bf1","resolution":{"observed_at":"2026-07-31T01:31:11.565942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:11.625036Z","title":"CoRR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.625036Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:358a9a6d404f5f139bfc6b2da4b1ecfad1261b20e2111f4962c17bf9861e8d26","observation_id":"930b2c14-c88c-4ef8-b913-27f7d821d268","resolution":{"observed_at":"2026-07-31T01:31:11.625036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:11.703930Z","title":"arXiv preprint arXiv:2504.03380 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.703930Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:785e2be74d33000df7cf7e9af5e8089962d309ed027ac8d41825677031d5fa13","observation_id":"0747bebd-a698-4172-b9c2-dd88e52bec97","resolution":{"observed_at":"2026-07-31T01:31:11.703930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:11.761008Z","title":"arXiv preprint arXiv:2505.14970 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.761008Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:152af2be344a03eebba52347738a293018e1f90a3a32f4c4721f1f2bb8f49c75","observation_id":"1b5556f5-4edb-4997-aeee-d5c16e842f80","resolution":{"observed_at":"2026-07-31T01:31:11.761008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:11.867963Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.867963Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:a172a0095bc67067f54c07e783eba7ea35ca70ea8c146c146953624c7fcb7343","observation_id":"36364a43-6149-4376-b5fa-f611755097e8","resolution":{"observed_at":"2026-07-31T01:31:11.867963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-31T01:31:12.021984Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:12.021984Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:92ff32f16be8927e1ac3348fedf542cbf64451f19a9f200f97d35ee34b8b12c9","observation_id":"adb31b98-a7ef-4df7-8dc0-2e0aa0eb353a","resolution":{"observed_at":"2026-07-31T01:31:12.021984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-07-31T01:31:12.159431Z","title":"arXiv preprint arXiv:2503.18892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:12.159431Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:3e00b5cb5e8b6d6ec3608762b3dfc142d2e8459e8dbe7d8000d189ef4bcffc97","observation_id":"38ecddab-cd45-44c6-8b44-cf8bcc30b43e","resolution":{"observed_at":"2026-07-31T01:31:12.159431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:12.274537Z","title":"2025 , note=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:12.274537Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:0e96421d0d5791e8b02d851a5d3d6eadec8cbfad936be8cd11af68ffef76839c","observation_id":"07682476-ca62-424f-b24f-6345fb6cb488","resolution":{"observed_at":"2026-07-31T01:31:12.274537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:12.455435Z","title":"arXiv preprint arXiv:2506.06632 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:12.455435Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:dd5bcd49f82bae1ead76d929cdf8bf4ca4336c26a513e02e6da4b50dc8f5abb1","observation_id":"dfa8554c-6293-44e7-a104-36f1bc2a8a40","resolution":{"observed_at":"2026-07-31T01:31:12.455435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:12.623436Z","title":"arXiv preprint arXiv:2507.04632 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:12.623436Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:9692e8b469b42b6744a523045baf8b7047fb4e0fcd3f5cf3507576b448343de0","observation_id":"377c639e-e952-4a10-8880-d3d53aa9a529","resolution":{"observed_at":"2026-07-31T01:31:12.623436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:12.742811Z","title":"arXiv preprint arXiv:2510.26374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:12.742811Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:95d0b7aebbc9465a239c92d5bcc980bba44b83dfdc01fa6de0b049c10d4a795a","observation_id":"9aebdfc7-abc6-4beb-b6c9-61d9447eab84","resolution":{"observed_at":"2026-07-31T01:31:12.742811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06167","last_updated":"2025-07-10T15:41:04Z","snapshot_observed_at":"2026-08-07T10:37:03.707334Z","submitted_at":"2025-07-08T16:47:16Z","title":"Skywork-R1V3 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06167","snapshot_observed_at":"2026-07-31T01:31:12.828360Z","title":"arXiv preprint arXiv:2507.06167 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:12.828360Z"},"links":{"cited_paper":"/paper/2507.06167","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:bc52579ebc9a2d4509bf342ff5b50542ac9e30f28cf8ec198483dbfa8c170b3f","observation_id":"1923581c-b5b5-43b4-9a48-b9c46c031552","resolution":{"observed_at":"2026-07-31T01:31:12.828360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15900","last_updated":"2025-04-29T02:51:19Z","snapshot_observed_at":"2026-08-07T16:00:13.989975Z","submitted_at":"2025-04-22T13:41:26Z","title":"SARI: Structured Audio Reasoning via Curriculum-Guided Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15900","snapshot_observed_at":"2026-07-31T01:31:12.944244Z","title":"arXiv preprint arXiv:2504.15900 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:12.944244Z"},"links":{"cited_paper":"/paper/2504.15900","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:2db837906d14a6f617138a9ff272cd643c8523ca5ebdbd66246dd8003645f68b","observation_id":"766c45ec-8a99-43e3-a963-464210332c12","resolution":{"observed_at":"2026-07-31T01:31:12.944244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-31T01:31:13.083776Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:13.083776Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:ad8cab9e22bc3aa6099d724ca129de56f82aec681e1ab8dac3a02b983e6c384f","observation_id":"89327f97-d0b1-43a8-8056-6442326d0c24","resolution":{"observed_at":"2026-07-31T01:31:13.083776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-07-31T01:31:13.281507Z","title":"arXiv preprint arXiv:2305.20050 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:13.281507Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:8c90874804d653805f503bd590140d05f8688671837796fb43a879bd0e82e61b","observation_id":"a77d461a-1e81-4245-af87-5d07bf159cc7","resolution":{"observed_at":"2026-07-31T01:31:13.281507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:13.378010Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:13.378010Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:92fe5d92cbad69c814d70d2fd18b53d3c1274ccaac0210a8bf74093babc1b3fa","observation_id":"d3a1e6b3-a337-4407-918e-62e938e91314","resolution":{"observed_at":"2026-07-31T01:31:13.378010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:13.500869Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:13.500869Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:b22760b1cf0248bf6f88183b5f1608c4f261c2ac0f73743e7b111eff207ac017","observation_id":"33b5bc53-574a-4a61-ade5-2ae3eb70cddb","resolution":{"observed_at":"2026-07-31T01:31:13.500869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:13.573035Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:13.573035Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:a311a19b3831bb10cbf490f5653b8916acd6cb5b2e69b02118f934f26b510e27","observation_id":"60a3ae54-73f1-45a5-8f40-5a3bf36882b5","resolution":{"observed_at":"2026-07-31T01:31:13.573035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-07-31T01:31:13.671595Z","title":"arXiv preprint arXiv:2402.14008 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:13.671595Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:733d742b631173d96889ce11385a5373ac2c71fcc787e13d7ee8fa57564cac28","observation_id":"1605788e-062c-4a43-bf1f-d7193c42c3ac","resolution":{"observed_at":"2026-07-31T01:31:13.671595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T01:31:13.817728Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:13.817728Z"},"links":{"citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:f93fdb45fc88a89af707c8a7fadf548e2d99fe4cb2742b886fb63ad097bc12ae","observation_id":"f43e396d-7111-4f40-90fd-1522543e5d7d","resolution":{"observed_at":"2026-07-31T01:31:13.817728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-07T16:09:18.755046Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-31T01:31:13.934392Z","title":"Bartoldson and Bhavya Kailkhura and Fan Lai and Jiawei Zhao and Beidi Chen , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:13.934392Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:da4ad5893601fbe25cae14ee6b9700e26a9230b67958a9d262e8413bee9f79a6","observation_id":"90c868fa-b460-46cc-b1cf-3190f1bd4b4e","resolution":{"observed_at":"2026-07-31T01:31:13.934392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2607.27610."}