{"as_of":"2026-08-08T17:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:042e55315ade4c1623408a49b226e863034c664734cadbe2f2a86406a7badab7","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:44:15.804741Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.23730/citation-record","integrity":"/paper/2509.23730/integrity","json":"/paper/2509.23730/citation-record.json","paper":"/paper/2509.23730"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1705.07830","last_updated":"2018-03-02T16:02:24Z","snapshot_observed_at":"2026-08-03T16:43:36.460747Z","submitted_at":"2017-05-22T16:19:21Z","title":"Ask the Right Questions: Active Question Reformulation with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07830","snapshot_observed_at":"2026-08-04T14:44:13.454741Z","title":"Ask the right questions: Active question reformu- lation with reinforcement learning.arXiv preprint arXiv:1705.07830,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.454741Z"},"links":{"cited_paper":"/paper/1705.07830","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:2a837b26d36f06c0b32cc6aca3aac4443397d11aff575d29213a222765cf8206","observation_id":"62e5f660-7ad1-4646-bbbe-0adcc5b60b7c","resolution":{"observed_at":"2026-08-04T14:44:13.454741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-04T14:44:13.604742Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.604742Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:ec1ad45fa1fd0c4e4fdcd9692a4f2af93367178b67fe8a6aefee4c27803436d0","observation_id":"a2f5499a-556a-4cb9-b502-68a2b81a64ec","resolution":{"observed_at":"2026-08-04T14:44:13.604742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T14:44:13.895720Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.895720Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:6e7efc68ad2ffd8bfb9251c3479b7727f5a556bae04bf0e45506a62d7b7e594e","observation_id":"25a5375b-e003-47f6-9baa-ed17c4240004","resolution":{"observed_at":"2026-08-04T14:44:13.895720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-04T14:44:14.374747Z","title":"Tulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:14.374747Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:3cd2267540b32107ff15468b7a3dfadd5485e15f45c574dee480fbc7fce8ed30","observation_id":"5584dfa7-3459-46be-a689-c1addf41cc4a","resolution":{"observed_at":"2026-08-04T14:44:14.374747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07787","last_updated":"2025-05-12T17:39:56Z","snapshot_observed_at":"2026-08-07T15:47:47.386772Z","submitted_at":"2025-05-12T17:39:56Z","title":"Learning from Peers in Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07787","snapshot_observed_at":"2026-08-04T14:44:14.634746Z","title":"Learning from peers in reasoning models.arXiv preprint arXiv:2505.07787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:14.634746Z"},"links":{"cited_paper":"/paper/2505.07787","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:b8a3e65199e7df9632d6d7b41aef50d79866adc3846bd93d0d8c173da361e18c","observation_id":"c27b8e1e-b6de-48bb-b66c-bb51be424721","resolution":{"observed_at":"2026-08-04T14:44:14.634746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-04T14:44:15.364737Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.364737Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:602773ddec43a1f8bd1106c490a26d2137a0c0220490b1ffc0247842f4d1c6e2","observation_id":"8e1918c7-94ee-40ac-9f42-91e812559d95","resolution":{"observed_at":"2026-08-04T14:44:15.364737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T14:44:15.514854Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.514854Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:785185ddd64177cbbc7a28290bf1a6e2c36448dcb228a2225b0419acd55bf8a9","observation_id":"20978142-4479-40fd-9c6a-255df20375c9","resolution":{"observed_at":"2026-08-04T14:44:15.514854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08852","last_updated":"2025-04-29T12:17:52Z","snapshot_observed_at":"2026-07-06T19:31:49.052556Z","submitted_at":"2024-10-11T14:27:56Z","title":"Conformalized Interactive Imitation Learning: Handling Expert Shift and Intermittent Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08852","snapshot_observed_at":"2026-08-04T14:44:15.684741Z","title":"Conformalized interactive imitation learning: Handling expert shift and intermittent feedback.arXiv preprint arXiv:2410.08852,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.684741Z"},"links":{"cited_paper":"/paper/2410.08852","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:0357adb3b4a194584d6905e9df1a51ea0fd2759263579fcbc618ce8a61c628da","observation_id":"94a462c1-b579-4624-9661-c2d3ac48cf7a","resolution":{"observed_at":"2026-08-04T14:44:15.684741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:44:15.804741Z","title":"expert_id","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.804741Z"},"links":{"citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:c5d8412f0df8ffc51c7e52e7dbf3801234f1e18eb3f037a5900921fb32f5c54d","observation_id":"d43ee754-cc80-4702-8db6-99c0c8b8987a","resolution":{"observed_at":"2026-08-04T14:44:15.804741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-04T14:44:15.083396Z","title":"Kickstarting deep reinforcement learning.arXiv preprint arXiv:1803.03835,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.083396Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:abde81fe109afb9ccaf14c2578f19cd96d345fa3b7c57f2baf5f26ce11e718e9","observation_id":"1f63d06b-0b17-4988-93e5-828fe488091a","resolution":{"observed_at":"2026-08-04T14:44:15.083396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07181","last_updated":"2024-01-14T01:09:48Z","snapshot_observed_at":"2026-07-06T17:15:14.689584Z","submitted_at":"2024-01-14T01:09:48Z","title":"Reinforcement Learning from LLM Feedback to Counteract Goal Misgeneralization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07181","snapshot_observed_at":"2026-08-04T14:44:13.214742Z","title":"Reinforcement learning from llm feedback to counteract goal misgeneralization.arXiv preprint arXiv:2401.07181,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.214742Z"},"links":{"cited_paper":"/paper/2401.07181","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:838ae8eb72603d60ce0990471886ce4f4369ca35efefc2cdec519747ff716a9e","observation_id":"42c1ec05-700d-4cb7-896e-f6bbea0b035f","resolution":{"observed_at":"2026-08-04T14:44:13.214742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04692","last_updated":"2024-06-07T07:04:10Z","snapshot_observed_at":"2026-08-07T21:51:22.136369Z","submitted_at":"2024-06-07T07:04:10Z","title":"Mixture-of-Agents Enhances Large Language Model Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04692","snapshot_observed_at":"2026-08-04T14:44:15.199364Z","title":"Mixture-of-agents enhances large language model capabilities.arXiv preprint arXiv:2406.04692,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.199364Z"},"links":{"cited_paper":"/paper/2406.04692","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:46c80fa49b81c644a74d05ed1a5cc291655848b971a378ab8f7a59d161c2d5b3","observation_id":"85a9474b-8731-4776-94e3-93d4f31e777e","resolution":{"observed_at":"2026-08-04T14:44:15.199364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19409","last_updated":"2024-04-30T09:57:21Z","snapshot_observed_at":"2026-07-06T18:07:34.924208Z","submitted_at":"2024-04-30T09:57:21Z","title":"Countering Reward Over-optimization in LLM with Demonstration-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19409","snapshot_observed_at":"2026-08-04T14:44:14.954740Z","title":"Countering reward over-optimization in llm with demonstration-guided reinforcement learning.arXiv preprint arXiv:2404.19409,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:14.954740Z"},"links":{"cited_paper":"/paper/2404.19409","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:18a7f72d487a7cdb7f6a8508ef36e352b313b7a275aa0727daaba596996c65eb","observation_id":"b595ddec-1e1b-43db-a522-d74a07f306cf","resolution":{"observed_at":"2026-08-04T14:44:14.954740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-04T14:44:14.079997Z","title":"Training language models to self-correct via reinforcement learning, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:14.079997Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:a0b7868081cd18ecc63f99fc234d8f3ee68fa592ffbae141a2597329b2a47c00","observation_id":"ef26b841-6810-43db-a517-287c105c63db","resolution":{"observed_at":"2026-08-04T14:44:14.079997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-04T14:44:13.758213Z","title":"Critic: Large language models can self-correct with tool-interactive critiquing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.758213Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:f564f45bad194a687d841fc5387eb5d7ebf6114498ab78890e13b8a9dbed2c1a","observation_id":"88d3d7c3-21f4-4525-8edf-18976e896cfc","resolution":{"observed_at":"2026-08-04T14:44:13.758213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01894","last_updated":"2025-04-14T10:25:47Z","snapshot_observed_at":"2026-07-06T19:44:43.248608Z","submitted_at":"2024-11-04T08:50:52Z","title":"Efficient Active Imitation Learning with Random Network Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01894","snapshot_observed_at":"2026-08-04T14:44:13.324744Z","title":"Efficient active imitation learning with random network distillation.arXiv preprint arXiv:2411.01894,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:13.324744Z"},"links":{"cited_paper":"/paper/2411.01894","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:19ca634306ca020f2d05da297c8d30f1168d4ba7355321750f1da5d958720d16","observation_id":"638047fa-cab6-415b-9a0d-e9249938123c","resolution":{"observed_at":"2026-08-04T14:44:13.324744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09782","last_updated":"2024-06-06T13:22:26Z","snapshot_observed_at":"2026-07-06T15:43:27.458645Z","submitted_at":"2023-06-16T11:37:15Z","title":"Full Parameter Fine-tuning for Large Language Models with Limited Resources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09782","snapshot_observed_at":"2026-08-04T14:44:14.782933Z","title":"Full parameter fine-tuning for large language models with limited resources.arXiv preprint arXiv:2306.09782,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:14.782933Z"},"links":{"cited_paper":"/paper/2306.09782","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:829978b97b5ac8518dd656ef5ca1ea30c58d89b245179384105cb2aa1e8726c7","observation_id":"96ef28e7-a304-45d7-97b6-74c9564ba4ed","resolution":{"observed_at":"2026-08-04T14:44:14.782933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T08:43:28.613998Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2509.23730."}