{"as_of":"2026-08-24T02:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d17967dd71413f2f0d0d3917ae15910fc6df3ef2c5d93786a4a2c20c9c16fdf","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:23:27.192432Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08224/citation-record","integrity":"/paper/2608.08224/integrity","json":"/paper/2608.08224/citation-record.json","paper":"/paper/2608.08224"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:26.220225Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.220225Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:07da6e14c1e05b5794bd3bfcd759ea514a8f0411ba51230e0fb9631650fdf39a","observation_id":"a055507b-9cc2-4844-a9cf-fb1774a5aa21","resolution":{"observed_at":"2026-08-12T00:23:26.220225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:26.300358Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.300358Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:08995371ef0faf4256baf3b28913f5bb4f56661b814b824f220fb8960dec3bb0","observation_id":"09c720e4-4280-4d93-a8f4-76a21bb0f01c","resolution":{"observed_at":"2026-08-12T00:23:26.300358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-12T00:23:26.325949Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.325949Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:61f39bac969a6f2c6f35e2a2bf4257c8fc24b5312cb4e65969cac9f180f390ea","observation_id":"5772d3d2-5b68-4017-a57a-0ea646db5f5c","resolution":{"observed_at":"2026-08-12T00:23:26.325949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-12T00:23:26.354692Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.354692Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:4d67be35ff18e9cf263391b2f1e7a61d4a725c91d559c2cfe85569a8d1650d6e","observation_id":"9c0a9770-474b-407e-9c5c-14dab82bd794","resolution":{"observed_at":"2026-08-12T00:23:26.354692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-12T00:23:26.373998Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.373998Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:37790ad4d584835e1e49aa7de7c268f58ea6e489c78c47686bdfaf3a1bcfd43e","observation_id":"eb2c0d45-5c10-44cf-a228-dfb3972a0ee7","resolution":{"observed_at":"2026-08-12T00:23:26.373998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:29.132981Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year=","venue":null,"work_id":"86f564e8-2190-4228-a18e-6ce6d0ae907b","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.387998Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:61abe88cb00f087301c468fdf6bf42f629d7a3fa7785dc4eadbd0455a804fe4b","observation_id":"22bcd684-565c-4e41-8d61-2288361cbb08","resolution":{"observed_at":"2026-08-12T00:23:29.161951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:29.077300Z","title":"and Liu, Alisa and Dziri, Nouha and Lyu, Shane and others , journal=","venue":null,"work_id":"d4c78d62-4f9d-4166-8ede-dd536cb30f09","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.394372Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:41fd6454b60d6d520e8a50632c9c1f0123e1110b7986159b2197ae3412bbec4d","observation_id":"0b41890b-103d-4d18-bc7f-3367627a6fef","resolution":{"observed_at":"2026-08-12T00:23:29.121004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:29.061721Z","title":"2025 , howpublished=","venue":null,"work_id":"44624326-76ff-4caa-ad69-c93ea08decf5","year":2025},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.399464Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:b022cbe7573b3ad27774fffbe5120941cd1b2e74e02c2715449719bff797d54b","observation_id":"f722d4af-9da7-437c-8511-7ce41877fd62","resolution":{"observed_at":"2026-08-12T00:23:29.066668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:26.405038Z","title":"2025 , howpublished=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.405038Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:fd5fea561771be0cb8a6599adec7a26faf0f68b2333e573f581840081a2e44ad","observation_id":"9dbc91ec-8d30-4a85-b75b-e4f0c38f2c53","resolution":{"observed_at":"2026-08-12T00:23:26.405038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-20T13:30:51.994408Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-12T00:23:26.430231Z","title":"arXiv preprint arXiv:2506.14965 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.430231Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:b778da58764f442c1be043bfe7fbc7494573439906290dacbd4f8b55881aefac","observation_id":"6c499c69-1e6a-4d53-a4d7-96b1c097a1c8","resolution":{"observed_at":"2026-08-12T00:23:26.430231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05547","last_updated":"2026-08-05T16:57:37Z","snapshot_observed_at":"2026-08-19T02:40:24.388078Z","submitted_at":"2026-02-05T11:06:37Z","title":"Multi-Task GRPO: Reliable LLM Reasoning Across Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.05547","snapshot_observed_at":"2026-08-12T00:23:26.510719Z","title":"arXiv preprint arXiv:2602.05547 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.510719Z"},"links":{"cited_paper":"/paper/2602.05547","citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:d7edcca45c9fec99ee9cb768d65b8ab9868faf042d98c05e11c482c920c8be06","observation_id":"0d8c7570-6afc-4257-a1ac-c80131a63690","resolution":{"observed_at":"2026-08-12T00:23:26.510719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:29.034668Z","title":"Proceedings of the 7th BlackboxNLP Workshop (EMNLP) , year=","venue":null,"work_id":"fcc4980f-75bc-4197-bc4d-0595ffce530c","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.566066Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:b48777c948585b0b9b3363a16d17649120419b38e3c9e579e9ddb767dec89d1c","observation_id":"8a5937d4-b8bf-4ee2-aa04-5d674c99f2c2","resolution":{"observed_at":"2026-08-12T00:23:29.039496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:26.601514Z","title":"2021 , howpublished=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.601514Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:579b73a586eaf3c177d0664e848ef2fa45bd6c45872b26323db698ca799e1ced","observation_id":"fed65094-a888-4d86-afe9-656b5468259c","resolution":{"observed_at":"2026-08-12T00:23:26.601514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:29.007653Z","title":"2023 , howpublished=","venue":null,"work_id":"fddcaa27-208d-4a71-b87d-fb528c1ddb4e","year":2023},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.633873Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:42c919d2e004e7a277347548b3792cd0a36b6cbf0c0b28c2da48de47ef3f250a","observation_id":"b8a92781-348e-4b16-ab7a-85198e2ba2b4","resolution":{"observed_at":"2026-08-12T00:23:29.013927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:26.682339Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.682339Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:1509ed1da9204500cadda75d87ef462601fa2ac302e5aaa9bfb95edc0eb2ea61","observation_id":"1ff3eea1-771f-4546-982b-10489d92c7f5","resolution":{"observed_at":"2026-08-12T00:23:26.682339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:26.691452Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.691452Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:70dec98bba2caf7549da0b4561afc6e7fd2f7bdf78969b9e34a57e3e3d43c787","observation_id":"ed7e3211-8d88-4d3a-a7ad-dc791b4dd4e6","resolution":{"observed_at":"2026-08-12T00:23:26.691452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00745","last_updated":"2024-03-01T18:43:51Z","snapshot_observed_at":"2026-08-20T01:26:34.437000Z","submitted_at":"2024-03-01T18:43:51Z","title":"AtP*: An efficient and scalable method for localizing LLM behaviour to components","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00745","snapshot_observed_at":"2026-08-12T00:23:26.696774Z","title":"arXiv preprint arXiv:2403.00745 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.696774Z"},"links":{"cited_paper":"/paper/2403.00745","citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:a4c3a867a2d59f82e5053c26afe7511df98f11aa8b7e251c4fb8f5ef1c3c2b75","observation_id":"99ffb5c0-1972-4a93-9f01-27fb72ec9e53","resolution":{"observed_at":"2026-08-12T00:23:26.696774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:28.971298Z","title":"International Conference on Machine Learning (ICML) , year=","venue":null,"work_id":"b2085ec6-cb4a-4e33-b481-e7c9fa51d476","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.708725Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:b8e1f506b7682051aeb7d4a4b9026eed7ef8d2d26b6c7da87455ff20716d5a40","observation_id":"929fb0ac-c46e-42ab-b4af-5b9dbcef26c6","resolution":{"observed_at":"2026-08-12T00:23:28.976791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:28.953742Z","title":"Conference on Language Modeling (COLM) , year=","venue":null,"work_id":"68618820-1727-4739-8c49-ca548abee201","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.713646Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:4c92c8f4ba77077238b6eeb97d14f9014c10836a979a8e3106f246ca83cc89b4","observation_id":"0da3dfd1-fdf3-449d-8e36-71e9348a3295","resolution":{"observed_at":"2026-08-12T00:23:28.960239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:28.817474Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":"e68f5ecf-edc1-49b0-bd77-435787e969b3","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.719130Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:9ed9d9a18bd7b38236264c0ac32a33084fc4c38972d3cbe9b7223b2c1517a0c2","observation_id":"c1ae0d81-43fa-47ad-b972-961ca6787fdc","resolution":{"observed_at":"2026-08-12T00:23:28.905324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:28.714815Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":"1f64e358-1d71-41a3-8deb-912431e31acd","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.724014Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:e078769889027f56600bd00b09536be4e00f766ed931da76b567d32620053f8d","observation_id":"40aa5ad5-69f2-477b-b54b-c4e866773d13","resolution":{"observed_at":"2026-08-12T00:23:28.720643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:28.658473Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":"cc1ce686-5337-4770-82f9-54aca0f0d763","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.729024Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:6bbe8dc475b5c0d83655af97aef7c18f736f96d5e9da601a1c65a67f27b3089e","observation_id":"95492037-5286-4823-8135-0a378bec20da","resolution":{"observed_at":"2026-08-12T00:23:28.702207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:28.465643Z","title":"Biochemical Journal , volume=","venue":null,"work_id":"b65a0aca-0c69-47b6-ab58-75e96747958b","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.753658Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:a1e6e30f9a04c1f254ee197bbd0d53d1c5737091b8af94fe7f64bf575b4999c9","observation_id":"058f235b-cfc3-438f-83cf-8f2350d2fd1d","resolution":{"observed_at":"2026-08-12T00:23:28.554302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:28.448530Z","title":"Symposia of the Society for Experimental Biology , volume=","venue":null,"work_id":"29edd2b6-6e82-48c2-9dbb-9691b3b8454e","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.812215Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:78a2f53108022feae8d4e50453826f28ea81015b0c41b935ac59b18aad09d48e","observation_id":"e13722e8-4788-4939-99e7-6d1074321f8b","resolution":{"observed_at":"2026-08-12T00:23:28.454334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:28.432289Z","title":"European Journal of Biochemistry , volume=","venue":null,"work_id":"d2be3e22-9266-4e5c-9c95-3403270e4033","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.858760Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:07f614fe2552cbe84805c4a656a1be28fcf4fe2353a029e147508610704ac7cf","observation_id":"53fea1a3-e560-45cb-96f3-d204d2cfea1a","resolution":{"observed_at":"2026-08-12T00:23:28.437656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:28.211246Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year=","venue":null,"work_id":"ca890f02-f27f-4f10-b584-0afd8da08de4","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.878863Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:ec0c9cf76da8d4a42d228d1e883fc8f2fad5e4d5bf6b1934b29840199fa2aac8","observation_id":"224f42e4-896b-4004-aaae-8cac7f066e53","resolution":{"observed_at":"2026-08-12T00:23:28.326734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:26.887253Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.887253Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:2138e17f9ec1b57571ea53d1523e0d7f72e0d39799cd8def6bb9ba57cf11f8b8","observation_id":"fe57f195-1991-42d7-8e57-dddc10f14c5b","resolution":{"observed_at":"2026-08-12T00:23:26.887253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:28.120757Z","title":", journal=","venue":null,"work_id":"feb1e9c8-abbc-454f-9382-9854bc775c94","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.895086Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:ce97a62a3e1ca104b5583939878d27d32e26fff855ef515f324344390182936b","observation_id":"afcf2de7-4c10-4195-9f03-ad7185b12932","resolution":{"observed_at":"2026-08-12T00:23:28.186855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:27.901536Z","title":null,"venue":null,"work_id":"778cda72-8602-4562-99f1-68f83589ed58","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.900837Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:7f72123c56cb87752e633c35559bf3fcf8b1169a1892b91a2ae25134865c9ddc","observation_id":"01d8e8d1-7353-4217-bbae-6cf437d6c40a","resolution":{"observed_at":"2026-08-12T00:23:27.974523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:26.905757Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.905757Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:b1a72c2bf4515b3cbff776ff151ac1e83762c8c66ddb52fe3aa357f01e7163a7","observation_id":"220f296b-cbe5-4803-8af7-48e389d3ba3d","resolution":{"observed_at":"2026-08-12T00:23:26.905757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-12T00:23:26.910603Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.910603Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:5fe848997add24b4aec5c0424ff3f2a79ec28eaf3f9908179d0ce4bc800d99eb","observation_id":"075ce667-b95c-41ae-bc44-1f86246c8002","resolution":{"observed_at":"2026-08-12T00:23:26.910603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:27.871988Z","title":"Measuring Mathematical Problem Solving with the","venue":null,"work_id":"7dac2df6-830a-48ea-97b7-22a84d6a7da0","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:26.983319Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:62fc35352d614e8d75b6a017468cc34f41ef1d789be57718ff4a84c149affe54","observation_id":"37a31f4b-bfc3-48aa-9dc2-10cd029b6215","resolution":{"observed_at":"2026-08-12T00:23:27.877469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:27.856463Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year=","venue":null,"work_id":"7d8be40f-0b1d-40e9-897b-8c1038fefe88","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:27.076333Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:25df2d688cd666b7d82fcc1d732c9a260007d95ec2c38dd08fc3dc63ca7338bc","observation_id":"a94e6974-09dc-4b80-9d13-f51a57224350","resolution":{"observed_at":"2026-08-12T00:23:27.861633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-12T00:23:27.156108Z","title":"arXiv preprint arXiv:2108.07732 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:27.156108Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:5cb7a7fc6a4a922a24c230e784c6b8edab25527b1ba3571cc28766255b747798","observation_id":"9fdf7d35-340a-4d6a-8cf9-a938314e233e","resolution":{"observed_at":"2026-08-12T00:23:27.156108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:27.643942Z","title":"Is Your Code Generated by","venue":null,"work_id":"4dc64f18-3bd9-4893-b89f-0c5feedaf81f","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:27.162185Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:06363aacda86f324acef054d4722605e2c2a6eea18c6479fa9956475cf3132c0","observation_id":"de6ecf71-5e42-44d0-a878-ea08ad374705","resolution":{"observed_at":"2026-08-12T00:23:27.742907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T00:23:27.167588Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:27.167588Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:ff5c99e7a6b8d795ba2423296917a955e53b9eb2c3ce5519464a3f261cb6da40","observation_id":"5ebbaaee-44c4-4e00-85b0-e1a2c16fc801","resolution":{"observed_at":"2026-08-12T00:23:27.167588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:27.494306Z","title":"and Ermon, Stefano and Rudra, Atri and R","venue":null,"work_id":"0c46c005-f409-49bc-9289-dc70ba2aae94","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:27.173533Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:a0e99849691bc6d10475db97be3166216dbef6fb939e6e8fec4747aaa4bc8aad","observation_id":"4815e24e-f3ed-4b71-85e6-06cec19a1fdc","resolution":{"observed_at":"2026-08-12T00:23:27.499733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:27.410525Z","title":null,"venue":null,"work_id":"53c2c4bb-6861-4d3d-904d-a4d346eb2af0","year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:27.178674Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:211f77e8bd18abaadac3c8fb65edcfc72b62bc3c39a6720aad417a2829b62a92","observation_id":"e1b7bc2a-7a62-4734-a5f1-e4910240fe1f","resolution":{"observed_at":"2026-08-12T00:23:27.482296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:23:27.183472Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:27.183472Z"},"links":{"citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:e056252a8ba4325f096f315d461d090b1c32f719a8657808e8e20da0cd8169cd","observation_id":"596ff04d-1672-46f6-aabb-f8cd0c9bef7b","resolution":{"observed_at":"2026-08-12T00:23:27.183472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-12T00:23:27.188092Z","title":"arXiv preprint arXiv:2412.15115 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:27.188092Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:e70333d268ac2b63a04fc75137f2819ad69356708b0cb9f4b6029673d8772589","observation_id":"1eaa5a27-8834-4c94-9767-111c41ff01fa","resolution":{"observed_at":"2026-08-12T00:23:27.188092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T00:23:27.192432Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T00:23:27.192432Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.08224"},"observation_digest":"sha256:d4df0282b407dd9d31b9964f58a4cee1a662f06df8aeb1856f9bdaea845a79fe","observation_id":"283f2359-6c66-4766-8286-f628810b91a9","resolution":{"observed_at":"2026-08-12T00:23:27.192432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08224","last_updated":"2026-08-08T16:44:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T04:54:20.469219Z","submitted_at":"2026-08-08T16:44:47Z","title":"Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.08224."}