{"as_of":"2026-07-27T13:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:560c524d7f5ce84fbcf121ad6af464e4b88fff9f90aa18db377281363244c43d","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T11:36:29.670003Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-27T06:30:09.085275+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.16399/citation-record","integrity":"/paper/2601.16399/integrity","json":"/paper/2601.16399/citation-record.json","paper":"/paper/2601.16399"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.17644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the sample complexity bounds in bilevel reinforcement learning.arXiv preprint arXiv:2503.17644","venue":null,"work_id":"44be00c5-df2c-4bd9-b2dc-33c2e9bcd328","year":null},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:5930aae34574a83a47c06ceb64a3847cdc767669d7dcf720c79cb494f00899b8","observation_id":"adef480a-570d-47bf-a625-58295ecd19ec","resolution":{"observed_at":"2026-05-16T11:37:48.710780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.02246","last_updated":"2018-02-06T22:10:14Z","snapshot_observed_at":"2026-07-06T06:22:08.261855Z","submitted_at":"2018-02-06T22:10:14Z","title":"Approximation Methods for Bilevel Programming","version":1},"cited_work":{"arxiv_id":"1802.02246","doi":"10.48550/arxiv.1802.02246","metadata_source":"pith","pith_arxiv_id":"1802.02246","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Approximation Methods for Bilevel Programming","venue":"math.OC","work_id":"6dc5827d-9f27-4b17-85f5-737868bf1692","year":2018},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"cited_paper":"/paper/1802.02246","citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:b7f39371ac99560591ef31c71fa9338abb28b6b5141463a8a1deb3c2be40323e","observation_id":"89a21b52-0f2a-416b-85f2-8f8b344bb7fe","resolution":{"observed_at":"2026-05-16T11:37:48.714049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09532","last_updated":"2025-01-23T14:39:05Z","snapshot_observed_at":"2026-07-06T19:15:29.988880Z","submitted_at":"2024-09-14T21:04:11Z","title":"Using Synthetic Data to Mitigate Unfairness and Preserve Privacy in Collaborative Machine Learning","version":2},"cited_work":{"arxiv_id":"2409.09532","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.09532","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ef188a6d-e698-458c-8f45-69228e5c354b","year":null},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"cited_paper":"/paper/2409.09532","citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:5a0ced6bcf4b18947bbc08726f6abab77f47d77a7675cd08331ece0fc5bf8ea8","observation_id":"4dae121b-13fd-45aa-af4e-7832f379d756","resolution":{"observed_at":"2026-05-16T11:37:48.717263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16087","last_updated":"2024-12-24T06:17:53Z","snapshot_observed_at":"2026-07-06T19:07:20.444206Z","submitted_at":"2024-08-28T18:34:54Z","title":"Unlocking Global Optimality in Bilevel Optimization: A Pilot Study","version":2},"cited_work":{"arxiv_id":"2408.16087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.16087","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unlocking global optimality in bilevel optimization: A pilot study.arXiv preprint arXiv:2408.16087","venue":null,"work_id":"7ff11e65-e633-4e83-b043-a0cfef7ef5d6","year":null},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"cited_paper":"/paper/2408.16087","citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:505e395647857cac5784e3e77c3a085b9106eb41e9ea9b68c358047d4cb9c571","observation_id":"f9d736c9-7058-4291-8ee5-1deef649af6a","resolution":{"observed_at":"2026-05-16T11:37:48.707143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08808","last_updated":"2025-08-05T16:27:52Z","snapshot_observed_at":"2026-07-06T20:35:39.606945Z","submitted_at":"2025-02-12T21:44:06Z","title":"A First-order Generative Bilevel Optimization Framework for Diffusion Models","version":2},"cited_work":{"arxiv_id":"2502.08808","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08808","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A first-order generative bilevel optimization framework for diffusion models.arXiv preprint arXiv:2502.08808","venue":null,"work_id":"1e43c1d3-e688-4c16-8cf1-f9671576c0c6","year":null},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"cited_paper":"/paper/2502.08808","citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:c746b11b515632e49b7256c9e01434fd280f30693da9e54bad068013ff538837","observation_id":"832a16cd-8b5a-49e2-b2d3-141cd30ea64f","resolution":{"observed_at":"2026-05-16T11:37:48.720397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"samples drawn from the stationary distribution, instead of continuously generated Markovian samples","venue":null,"work_id":"14b4ef1c-3dc4-4576-8e8d-2252ec7eb5bc","year":2019},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:2808408bfb0bbe17b72eb61b88fa99a25f27179fc1e763c130fc06a754040f92","observation_id":"dbe74d4e-3258-4936-8d81-71e298b05384","resolution":{"observed_at":"2026-05-16T11:37:49.334005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"406a970f-5d3d-46a1-ad28-0bf0fa83efa8","year":2022},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:30a346a602b22f1fb730fad9160cacb693a6e55ac8fe612a238e43e4313b5b2b","observation_id":"d00c2528-db7a-41b6-9dc8-6faead6554b2","resolution":{"observed_at":"2026-05-16T11:37:49.361030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We defer the proof of the lemma to Appendix E.15","venue":null,"work_id":"e90c9da7-2928-4c70-b5fe-ae1fe5b6434e","year":2022},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:838082e69c9b9dc68e440f0163d089ca8362ac217fa014f2fd411d04055bb343","observation_id":"0e26ac44-9db9-4719-bc4e-1e79df3b33d2","resolution":{"observed_at":"2026-05-16T11:37:49.352671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The bound onE[ε V,L k+1]can be derived using an identical argument","venue":null,"work_id":"bb14076f-3270-4aa0-9128-d6e3c1781775","year":2023},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:88c28922c98b82ba9ecb223f7fbceda2ab67e9432fdcf2c9a9602d2fc12c789e","observation_id":"af1f6328-adbb-4abb-afb2-374ce51bcf54","resolution":{"observed_at":"2026-05-16T11:37:49.355006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"dπ′ ρ = 1 2 dπ1 ρ + 1 2 dπ2 ρ .(93) We use ˆdπ ρ to denote the extend discounted visitation distribution over state and action such that ˆdπ ρ(s, a) =d π ρ(s)π(a|s)","venue":null,"work_id":"7a51e88f-728f-4ed8-893f-8b69e8f55008","year":2022},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:383793f1a4a48369955c4297ea34dcd66be50db1e3615456a68725d70d35bffa","observation_id":"3008e215-0487-45ad-bf9d-82daddfcb7a0","resolution":{"observed_at":"2026-05-16T11:37:49.348635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bb4b5398-20f6-4ce5-aa81-8ef89b9980e3","year":2022},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:042c145333c6d63a50ef00f305b9dc60ee759a1b26ac13c6b872b35817225092","observation_id":"a68be447-d618-411f-a2bf-70406579b392","resolution":{"observed_at":"2026-05-16T11:37:49.358849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4d75d129-8769-40a3-a569-e1fcf945afd3","year":2021},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:78a25e4d5c382e07a55de4b3b2974cc7f20b6e51c0727ae1fa84685552029dc1","observation_id":"070d11a7-e6c1-4848-8c1b-6be95407178b","resolution":{"observed_at":"2026-05-16T11:37:49.346332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adapting the result from Shen et al","venue":null,"work_id":"48dc06c8-c5c8-42b3-8d56-1816980b1342","year":2019},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:469e52773e0d692f9704b7953a1d55a5f8ff894277e8f1e80f5784e6947c382f","observation_id":"e3f8a955-3391-455f-aa0e-ecd769f02bdd","resolution":{"observed_at":"2026-05-16T11:37:49.350782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a133a045-c91b-4ba9-a343-8e8cd69fb5f8","year":2023},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:5cc03c1e337b9e9fc56a4140ab25e5a44124a9047b9d4d684a57f91135318a74","observation_id":"11785769-1754-42ce-9fd0-bbd9cb90af09","resolution":{"observed_at":"2026-05-16T11:37:49.356926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b9ffabdc-06c7-4a9a-9dbd-0f0f846b7023","year":2020},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:36cb4d5fc1f6580475f7b31d049d10440707456528ffd826f22985e1b7a2db28","observation_id":"76feface-f4b8-4422-acea-fe3b4cddcc08","resolution":{"observed_at":"2026-05-16T11:37:49.344349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Therefore, ∇2 τ,θ Jτ(x, πθ) = 1 1−γ ∇θEs∼d πθρ , a∼πθ(·|s)[E(πθ, s)].(126) Zeng et al","venue":null,"work_id":"24b48b37-eb17-4b14-ba2c-b8751662702d","year":2022},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:3894faa644582325175785b14e4e35916d346360c43a192c888b81cbaf6c4e08","observation_id":"00dd948d-1eb9-4bca-894e-6bfa89214a90","resolution":{"observed_at":"2026-05-16T11:37:49.340200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We next show the smoothness ofΦ w,τ","venue":null,"work_id":"860d2f65-e385-4c2d-ae8b-c2f561226ae7","year":2023},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:7cf77d14892c324d1ccfdf7578bfc1194e84d3b30294b47d7f155579e00c3e59","observation_id":"da26f9de-4db2-459c-95d4-c04607036254","resolution":{"observed_at":"2026-05-16T11:37:49.342077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kwon et al","venue":null,"work_id":"9b46e582-d081-4efd-95a3-ec651eb0d7ba","year":2023},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:f802eac0986d036fc4f3157a4e6c405855ea50ed279632b185bb84e7363b6048","observation_id":"b3a24f6b-eef7-47aa-8e05-5b18de37ac11","resolution":{"observed_at":"2026-05-16T11:37:49.336075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This implies∇ 2 x,θJ(x, πθ) =∇ 2 x,θJτ(x, πθ)","venue":null,"work_id":"04da9314-3733-4fba-9135-e86665320e07","year":2022},"citing_paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T11:36:29.670003Z"},"links":{"citing_paper":"/paper/2601.16399"},"observation_digest":"sha256:3a4a0b0944e6b23d2f2c34b478fb63882a06130a722e9bc69a4e99dcd07b127f","observation_id":"a82a87b7-ce37-474d-90c8-842842db5674","resolution":{"observed_at":"2026-05-16T11:37:49.338025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.16399","last_updated":"2026-04-21T21:37:12Z","latest_version":6,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T22:42:48.338004Z","submitted_at":"2026-01-23T02:12:24Z","title":"A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":5,"verified_fuzzy":14},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"thesis":"As of 27 July 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2601.16399."}