{"as_of":"2026-08-09T22:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2fc3d11053be87ccecd6d636a6eb3f120f797e75f60f61bdb02b6964182128f0","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:38:17.524753Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28849/citation-record","integrity":"/paper/2607.28849/integrity","json":"/paper/2607.28849/citation-record.json","paper":"/paper/2607.28849"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:04.983680Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:04.983680Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:2f2d3cf4028d5d7319e3e7c73aac19c4650a2c31325e49cda5b3e814088f306a","observation_id":"c28f9b18-bbc3-4277-ad60-06600159a845","resolution":{"observed_at":"2026-08-03T01:38:04.983680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:05.069083Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:05.069083Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:e15899e48c8f2225262b94f0bfb77958f15985498eb47480727b9a8c508cc443","observation_id":"49fb158f-ee80-471f-8117-556f09c45514","resolution":{"observed_at":"2026-08-03T01:38:05.069083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:05.180446Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:05.180446Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:9d6de51fb543c2d4d8f90fd83e3d23a5fd27bdfedc0e10140ea19330bc4151c9","observation_id":"49ef8a6c-115d-4e69-a887-f8a1c003e1c0","resolution":{"observed_at":"2026-08-03T01:38:05.180446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:05.336812Z","title":"Transactions of the American Mathematical Society , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:05.336812Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:fe014bd62ca7a19e670d0b65a635e08c8f473e968917a549fb5eb90448f4f840","observation_id":"1ab8b205-260b-4ed4-b472-e92aeb857194","resolution":{"observed_at":"2026-08-03T01:38:05.336812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:05.441225Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:05.441225Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:af0ae53c19857cb23000ef76c4343e4ab35e8b50fa3c7444e96a277a3e18dcf9","observation_id":"c637d383-b70c-40d8-8fd3-0a76d616d16b","resolution":{"observed_at":"2026-08-03T01:38:05.441225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:05.531438Z","title":"ACM Computing Surveys , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:05.531438Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:5ef0728a8a50b04a6ea9ac40592c4e0e63a1a04196260a154022c136e3d8b797","observation_id":"6a96938b-8d7a-442d-b9be-8c311b60e7a4","resolution":{"observed_at":"2026-08-03T01:38:05.531438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:05.537609Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:05.537609Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:7ec143deb2023ec9ea15d78b4f61f744ed9d131b956369022bef658b83bba3a2","observation_id":"88a255fe-c820-4126-a8e9-c3a2c24fd8bf","resolution":{"observed_at":"2026-08-03T01:38:05.537609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:05.640440Z","title":"Discrete event dynamic systems , volume=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:05.640440Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:60b079dd9ddc9a7bf5ce1a5e4a05d64852f4c17fb6b23d9f6fb044c4a288aa6e","observation_id":"57ccfd05-f3d6-49ff-b6c9-8ab3838f382d","resolution":{"observed_at":"2026-08-03T01:38:05.640440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:05.748091Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , author=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:05.748091Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:551a7a1277186dccf3190f5b69509d2c00c5c6b13c3a9f235c27efe791cc6e3b","observation_id":"e73ffb67-6baa-4052-b152-07752b99b9e7","resolution":{"observed_at":"2026-08-03T01:38:05.748091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:05.852582Z","title":"Proceedings of The 25th International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:05.852582Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:d478d193e68a8157239545f6e61655680b98113dab439174416e9c3462d0be83","observation_id":"81225104-755b-4bce-ae65-84556bb6ef70","resolution":{"observed_at":"2026-08-03T01:38:05.852582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:05.986598Z","title":"The Annals of Statistics , volume=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:05.986598Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:3fbb4616e7508ac2897e724ee6cc1a93e8be4ee7cdb3e90d3a167e8ce52bc852","observation_id":"a3c28d24-487b-49bc-998e-3cee22d07373","resolution":{"observed_at":"2026-08-03T01:38:05.986598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:06.188028Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:06.188028Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:dd91f9b416a9b627801ccfab37a442622e01b1a251d75523ce0283aee6c9e060","observation_id":"1535ffaa-49e8-4e3a-91c8-b7f42d595259","resolution":{"observed_at":"2026-08-03T01:38:06.188028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:06.319759Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:06.319759Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:ece9c9f4bf103f08833578ac37c5d2d5dabdf25fb76f7ae355b2a9455a4f39e3","observation_id":"d27635a8-52a8-472e-b27c-207734a50213","resolution":{"observed_at":"2026-08-03T01:38:06.319759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:06.409452Z","title":"SIAM Journal on Optimization , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:06.409452Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:1febbb70cbd580587092d9d39ad903bd0201d722918831591aee6e49474069a2","observation_id":"5eafe6ca-e609-4f41-9f17-67ebcc8040bd","resolution":{"observed_at":"2026-08-03T01:38:06.409452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:06.575637Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:06.575637Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:4e1740c6123e6c465acc06560c04ca72a088c493a182c36f40f24022b5c71a36","observation_id":"48d24ec4-5bc0-4ec7-958f-fb3f699ed043","resolution":{"observed_at":"2026-08-03T01:38:06.575637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:06.744793Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:06.744793Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:fce5a041d7359b01b6d6527e35f2efa0c6c2c5e9e0153930899558278a207f62","observation_id":"837a4e77-0e6e-4d74-ade3-34d630dd3c0b","resolution":{"observed_at":"2026-08-03T01:38:06.744793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:06.919694Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:06.919694Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:0c4355787b4c7e0e4506391923c5f720c0d98048f6607fe116a7db272090c5c0","observation_id":"732215e2-5213-49cf-beb7-551289a4ba7a","resolution":{"observed_at":"2026-08-03T01:38:06.919694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:07.123010Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:07.123010Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:98529fb64972e296d044d3d8617c8f62d253aa0370c40442f64894112d5399e8","observation_id":"bf0f806b-80d3-4371-96a6-b5be1b7e882b","resolution":{"observed_at":"2026-08-03T01:38:07.123010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:07.296665Z","title":"Achieving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:07.296665Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:b6763de2be6a20f0e5653f4dba2a266f7dd16cbd91cfa2c7f450ba72ce5d3029","observation_id":"8f08e37c-7f78-4730-8623-6ca9c5be4f6c","resolution":{"observed_at":"2026-08-03T01:38:07.296665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:07.470619Z","title":"The Thirty Seventh Annual Conference on Learning Theory , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:07.470619Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:d177177d9a30351e5adeeea90b229896b11dda217f8608493569943473fa00b2","observation_id":"ab0dd64c-2172-43df-a944-ae67a172d696","resolution":{"observed_at":"2026-08-03T01:38:07.470619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:07.585904Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:07.585904Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:528be780cd50a4843842915a9a7c640b5cf22019540242c4e0fbe5eb25b02176","observation_id":"5ea8b51f-a70a-41bc-8d1b-6fc94a62ac27","resolution":{"observed_at":"2026-08-03T01:38:07.585904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:07.722810Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:07.722810Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:721f44cda2203403468a628c76642f4027bd4295c753de07228d9f9c74d6c4a7","observation_id":"af5b95e7-653e-4d94-a557-d8694868e209","resolution":{"observed_at":"2026-08-03T01:38:07.722810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:07.909600Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:07.909600Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:ef3cd8526b9fca41b9fd002942fa12a6c924b18449fe51bc1801bc8e05629321","observation_id":"0693f69b-c049-4711-81ab-0d0c59a768f3","resolution":{"observed_at":"2026-08-03T01:38:07.909600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:08.061723Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:08.061723Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:6f7532589a84dee0487a88e60c9e18f1b77246ad19f1e6a42dc28a25f2ac3142","observation_id":"f6d16884-8312-4054-88b6-9cca8c3b9044","resolution":{"observed_at":"2026-08-03T01:38:08.061723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:08.371099Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:08.371099Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:f0a530a5b2f6e64b6e4cf7d502d6c42b7f4a99c8177100e47d1639d7d49fcabf","observation_id":"08757f36-08e7-4b28-a2a2-a2dc298820e5","resolution":{"observed_at":"2026-08-03T01:38:08.371099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:08.526342Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:08.526342Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:78a8c4501334408dfdbc73c9cb9f0406a00e15d11ad0f88b455f247bd9b499ef","observation_id":"09b136e8-5a20-4752-92ed-6a0b8e66baf7","resolution":{"observed_at":"2026-08-03T01:38:08.526342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:08.681330Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:08.681330Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:77cdab034a3f6a11996ed268a0f2124c05e83a53414571308af0fec81a18547f","observation_id":"7af85630-865e-4f6f-ae42-1697ccf35208","resolution":{"observed_at":"2026-08-03T01:38:08.681330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:08.852503Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:08.852503Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:041f591100f170725520078515d907bb96e115375f43ba05c5a4f41d39cec6de","observation_id":"964167ea-9a96-4eab-a80a-438c8b7f8c8b","resolution":{"observed_at":"2026-08-03T01:38:08.852503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:09.015756Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:09.015756Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:377265a6d76a752c4fb3800fa24fc73234bf016806e9ef43961a4cc9292536bc","observation_id":"b485b2b1-4be4-400f-8782-a06e9f4758d5","resolution":{"observed_at":"2026-08-03T01:38:09.015756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:09.194011Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:09.194011Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:e0fa161939b0428dad06b810c084e7d53b06c4f95373e4641e4f2eddeac948d5","observation_id":"186d857c-ad96-4350-b245-4c2c41a12a1a","resolution":{"observed_at":"2026-08-03T01:38:09.194011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:09.371976Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:09.371976Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:97afd13f50876794749be019d7a01490e3178f3e4d0edafeaaa20c4b85516856","observation_id":"8c7ab054-43b0-4803-bf8d-dc14ac0e8936","resolution":{"observed_at":"2026-08-03T01:38:09.371976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:09.719811Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:09.719811Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:73414b9c9b6d78b34f4260f90ae31119feb2b1a881a370bccf1b69c32ab4ed4b","observation_id":"a3e092d5-ee07-4d3d-8cc0-ab33bce62574","resolution":{"observed_at":"2026-08-03T01:38:09.719811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:09.915422Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:09.915422Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:312b903d9b91768f1a865406c2204a155a0fd7683ae1936c5b084fade4272bc2","observation_id":"f670da16-86a0-4b33-83ba-721ea174dea8","resolution":{"observed_at":"2026-08-03T01:38:09.915422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01123","last_updated":"2022-06-08T16:36:24Z","snapshot_observed_at":"2026-07-06T12:43:17.428867Z","submitted_at":"2022-03-01T18:20:01Z","title":"A Primal-Dual Approach to Bilevel Optimization with Multiple Inner Minima","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01123","snapshot_observed_at":"2026-08-03T01:38:10.112895Z","title":"arXiv preprint arXiv:2203.01123 , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:10.112895Z"},"links":{"cited_paper":"/paper/2203.01123","citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:5861b914d3cabb7ea7e5d6f9a483d85c9bb07455fdefabf6c13e5f212a3556ac","observation_id":"35db6e36-4bb4-4fa1-a5bb-f64797bf50a1","resolution":{"observed_at":"2026-08-03T01:38:10.112895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:10.328062Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:10.328062Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:37b8ec400eec476c3dae9fbea7c105ffff43274ca1e91b762c0f87f9b7b14f5a","observation_id":"60113249-390b-4d88-9f70-62adf99e31e4","resolution":{"observed_at":"2026-08-03T01:38:10.328062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16164","last_updated":"2024-01-29T13:50:56Z","snapshot_observed_at":"2026-08-09T16:36:17.571417Z","submitted_at":"2024-01-29T13:50:56Z","title":"Constrained Bi-Level Optimization: Proximal Lagrangian Value function Approach and Hessian-free Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16164","snapshot_observed_at":"2026-08-03T01:38:10.550633Z","title":"arXiv preprint arXiv:2401.16164 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:10.550633Z"},"links":{"cited_paper":"/paper/2401.16164","citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:254111c5f6a7b81386acb4a89c6ec89f63ccf2db2067a5a97fc123db37161240","observation_id":"3098a4ee-8670-40f8-8dbd-da1fccb9bee1","resolution":{"observed_at":"2026-08-03T01:38:10.550633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:10.719704Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:10.719704Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:a5cfd2c17abe5af48681b748a5da43fdc316ef6aafb3196cf045eb7d9d752944","observation_id":"609fe3e8-a3a6-4064-9fca-f3cad2a6d322","resolution":{"observed_at":"2026-08-03T01:38:10.719704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10148","last_updated":"2024-08-26T01:08:49Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T15:59:36Z","title":"A Primal-Dual-Assisted Penalty Approach to Bilevel Optimization with Coupled Constraints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10148","snapshot_observed_at":"2026-08-03T01:38:10.892564Z","title":"arXiv preprint arXiv:2406.10148 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:10.892564Z"},"links":{"cited_paper":"/paper/2406.10148","citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:1da57669418c01e40b0f504bcdef06f2089f6a8179b54c31cdd077b356fd8c10","observation_id":"5488a5ea-ae64-4ef2-bdc5-665c3d1181ee","resolution":{"observed_at":"2026-08-03T01:38:10.892564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01992","last_updated":"2024-06-04T06:22:04Z","snapshot_observed_at":"2026-08-06T15:55:37.131724Z","submitted_at":"2024-06-04T06:22:04Z","title":"Overcoming Lower-Level Constraints in Bilevel Optimization: A Novel Approach with Regularized Gap Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01992","snapshot_observed_at":"2026-08-03T01:38:11.039361Z","title":"arXiv preprint arXiv:2406.01992 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:11.039361Z"},"links":{"cited_paper":"/paper/2406.01992","citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:338a7aba06c28c93588d37e668e526cf47bedba6ffcd9d92242a04eca8b83780","observation_id":"60dbdb57-9856-44df-9558-af99d04b24e2","resolution":{"observed_at":"2026-08-03T01:38:11.039361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:11.159317Z","title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:11.159317Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:0a1a93f54385ca307bbb022737e95d886a6d195ebcd7aa7f4cce5b2ed6d3297a","observation_id":"741bff12-a885-441b-8db1-eba0c5ca921a","resolution":{"observed_at":"2026-08-03T01:38:11.159317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:11.345028Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:11.345028Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:f8e9f07dc436391bbc4e2bea32d399689c20fe2e9ce4dbbe5df31c7e18f09474","observation_id":"6ffa621c-4e94-41b8-af86-ad0f694fe813","resolution":{"observed_at":"2026-08-03T01:38:11.345028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:11.479219Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:11.479219Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:88f40010854024f73ab91e94cf04097d4661912d39f2939bb0bf46c6a69c36db","observation_id":"a71d71ed-70b8-40b0-af22-9e7bc2c2483d","resolution":{"observed_at":"2026-08-03T01:38:11.479219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16761","last_updated":"2024-01-20T16:41:48Z","snapshot_observed_at":"2026-08-09T04:53:44.768191Z","submitted_at":"2023-06-29T07:57:47Z","title":"Moreau Envelope Based Difference-of-weakly-Convex Reformulation and Algorithm for Bilevel Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16761","snapshot_observed_at":"2026-08-03T01:38:11.581927Z","title":"arXiv preprint arXiv:2306.16761 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:11.581927Z"},"links":{"cited_paper":"/paper/2306.16761","citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:7720ab260fe9b20e3ceafb2f0ec5ea894184211a324c2190b618d3b888579594","observation_id":"b9047e26-5b17-49fa-9a3d-1778c3dcc3cf","resolution":{"observed_at":"2026-08-03T01:38:11.581927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:11.676775Z","title":"The 41st Conference on Uncertainty in Artificial Intelligence , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:11.676775Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:1fdb98b155597e9f2a6347895e8f856e6500948c9b8b5885c3b047e77538ed78","observation_id":"2138561e-7247-4079-8953-06405e56133e","resolution":{"observed_at":"2026-08-03T01:38:11.676775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:11.849269Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:11.849269Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:1193a4071b37c5f586638c413cc988a44b9a3f62b0f93e3da6a80af751eeedc9","observation_id":"5e40740b-555d-4e6e-b8ae-c03b42f3f7ac","resolution":{"observed_at":"2026-08-03T01:38:11.849269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:11.967535Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:11.967535Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:876aebfc828c7b2e9987c1b930b1e78c34cb0942dd793f4488dffda098cf22e0","observation_id":"cb6f2930-7796-4432-9f07-b00068a59b26","resolution":{"observed_at":"2026-08-03T01:38:11.967535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:12.095784Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:12.095784Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:af148e7a276f458ec2cb98f71c6b1a972f949274bbb49543280b3259253f45b0","observation_id":"f7d9bbd5-10a9-4254-a140-b13d162286a9","resolution":{"observed_at":"2026-08-03T01:38:12.095784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:12.243346Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:12.243346Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:72aa5121ace52056714f15c196b64f13e50aa25fc41725930b12e3efd1fb3733","observation_id":"b09a1365-b114-40fc-8905-a5a353e7f649","resolution":{"observed_at":"2026-08-03T01:38:12.243346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:12.427776Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:12.427776Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:c1f1758a154e53fe9adc79fc13268cb3a3d35567ee236268ff3ddd14def55023","observation_id":"d582b873-ef11-469f-8dc3-f2dd9c01c648","resolution":{"observed_at":"2026-08-03T01:38:12.427776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:12.545732Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:12.545732Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:2eb5f722e448d5ce1780750173f99d79022d27ebb3bed9dc058fc447a93f3c9f","observation_id":"5ed50b1d-b9f2-4c2a-972d-514f2aff04d5","resolution":{"observed_at":"2026-08-03T01:38:12.545732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:12.659802Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:12.659802Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:efd57cff4c035a4997ea5c68b0f8f895f0b57accea784e7b764efa7f59ce483f","observation_id":"fd4d0336-27a4-4edc-b12c-f63e3c48264d","resolution":{"observed_at":"2026-08-03T01:38:12.659802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:12.710646Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:12.710646Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:cbf4a778c9009399c5ca0b16ff06da6b28b97d6909ade21beacd9aa187fe952e","observation_id":"8d5d77f6-a0f8-4f30-ad90-c39de05054f8","resolution":{"observed_at":"2026-08-03T01:38:12.710646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:12.786066Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:12.786066Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:d65c137ad2f7c2024b6aa5960716d2395ca1ac0d923c0e583c2118b618a96283","observation_id":"8c51a27f-23b9-4fbc-b077-3b787a275c63","resolution":{"observed_at":"2026-08-03T01:38:12.786066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:12.896743Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:12.896743Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:6e1db88d720903c3b24f80c04a04fbcf99ae24a0cfafe4394b4914c327554f74","observation_id":"d544a1a1-2cef-4a0e-b75d-1e21dc148dfc","resolution":{"observed_at":"2026-08-03T01:38:12.896743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:13.028560Z","title":"Proximit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:13.028560Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:29aa41a623cde812e7b2d2dea70696004f63e5958c03856ae0f6a511d5fe49bd","observation_id":"6867598f-3099-4a6e-9a93-67b5083f9df5","resolution":{"observed_at":"2026-08-03T01:38:13.028560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:13.271739Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:13.271739Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:8a79789bedd57c94bed54c84c2ccc1921e4e5f40d96606f92f7acdf043349e11","observation_id":"712e6e42-a804-4177-9f35-d9962d08bfc1","resolution":{"observed_at":"2026-08-03T01:38:13.271739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:13.426999Z","title":"Stochastic subgradient method converges at the rate O (k^","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:13.426999Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:0ca0cfae4140156f3d94856950871ac8699f69afdc29f430f8bfb8fd37bd3da6","observation_id":"a5820e00-2ec8-47fc-8ca9-5bf222dea30a","resolution":{"observed_at":"2026-08-03T01:38:13.426999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:13.531338Z","title":"1998 , publisher=","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:13.531338Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:d904ee06f5fd244f360ca3b298d214f16325331385eb3cb8833bc8edfc38b6d2","observation_id":"93ebc01c-ce6a-4537-873a-0739c978e5c2","resolution":{"observed_at":"2026-08-03T01:38:13.531338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:13.605734Z","title":"Linear convergence of gradient and proximal-gradient methods under the polyak-","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:13.605734Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:cb662625c125ed06c725fd09e4c08f4020bbb8612d052bd9bbf242fa93b0b828","observation_id":"59bde824-0e8c-4cb7-8b12-86e7ecf6ad6a","resolution":{"observed_at":"2026-08-03T01:38:13.605734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:13.773082Z","title":"Journal of optimization theory and applications , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:13.773082Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:18375ad560ddf336778aacc4c87a5b90048fe34268eefe80dd6a910ff57e98c4","observation_id":"9fb91b90-fe22-47e1-b85f-0a8e7d5b3086","resolution":{"observed_at":"2026-08-03T01:38:13.773082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:13.853872Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:13.853872Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:626017d47d3dbf1dc6f7fa29204d222e71fcf1abe8225b4fa96bc29eba89d444","observation_id":"c056d98d-c618-4cc8-873a-a723fb634635","resolution":{"observed_at":"2026-08-03T01:38:13.853872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:13.920858Z","title":"the method of paired comparisons , author=","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:13.920858Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:f0a13bdae8cd1d4afc9e0b86920f1a8c148f4550f6a86a7b20f41815fd0fa274","observation_id":"58139e5a-04a2-48af-826c-9d09242ba63f","resolution":{"observed_at":"2026-08-03T01:38:13.920858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:14.008895Z","title":"International conference on artificial intelligence and statistics , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:14.008895Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:dbc1e260208288b3f3f7f4696bff622dadc6d6b606c877d5306babf7cc02e8a7","observation_id":"46c1542f-40df-47f6-bb2a-115aa7383695","resolution":{"observed_at":"2026-08-03T01:38:14.008895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:14.134298Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:14.134298Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:94c6eb96683baac07a434f065869052ac4640d429ab851e11cb4696832c7ef77","observation_id":"7a3a2cfb-c80f-481c-a4b0-8aa9e50de831","resolution":{"observed_at":"2026-08-03T01:38:14.134298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:14.542969Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:14.542969Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:d9d308fdd22223233511d1bda67f002306efd28a41838ede29e1b6961c7f8d66","observation_id":"054208e8-a618-4d8f-9e86-6974a13aeeb1","resolution":{"observed_at":"2026-08-03T01:38:14.542969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:14.625606Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:14.625606Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:3918c9936e2502c3bd9728b5caf54407b24ef10ecb4f830a49657a0f5477fc5c","observation_id":"9b405480-a436-43e7-aeae-1aa8e4e9405e","resolution":{"observed_at":"2026-08-03T01:38:14.625606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:14.679588Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:14.679588Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:c869fe19852bf0a508b25d4183d5d6784d4dbac9b2bc4c91c49255a20f150aa4","observation_id":"9569b531-52a1-415d-8947-edff58f71abe","resolution":{"observed_at":"2026-08-03T01:38:14.679588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:14.776723Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:14.776723Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:7123e7342cd9c4d505d1f43ce0cc3434501b6ea321e7f61152977c63ff13962f","observation_id":"280f8ce0-bc32-4436-b5eb-1a34e2b35c4b","resolution":{"observed_at":"2026-08-03T01:38:14.776723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:14.867203Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:14.867203Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:ca0f320af0dc510b9a1d4aad644cd6568154799ca6d02d0b723568d89499bac0","observation_id":"ad0deca7-af27-4be3-917e-68b43fb6a1f1","resolution":{"observed_at":"2026-08-03T01:38:14.867203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:14.952155Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:14.952155Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:f4d15d81fbedc8aea350d147b5d187528a8ea18e23ced7b4f737d55bee563728","observation_id":"4854c676-f930-4be6-9102-640ecdc9a6b0","resolution":{"observed_at":"2026-08-03T01:38:14.952155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:15.037266Z","title":"and Zhao, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.037266Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:11ef091107ea3d8d8168b7616c4c1fe56f1993f4994b3ae3b8a6a3533b4d741a","observation_id":"c1491627-caf0-4f02-956a-8d8b9c2634ce","resolution":{"observed_at":"2026-08-03T01:38:15.037266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:15.111843Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.111843Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:99a22f8a4534c950d3353e5114fd6dac0c907a5a7a312f0c4126518398e6f05f","observation_id":"bbd99c33-baaa-42d9-8b19-597a626c16ca","resolution":{"observed_at":"2026-08-03T01:38:15.111843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:15.171698Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.171698Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:f5cb22d59c5f7fd599456070c47c72c3355d27e6be95050323f9b0309f34db39","observation_id":"722ec001-36bb-4bb2-a63c-61d61ce91454","resolution":{"observed_at":"2026-08-03T01:38:15.171698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:15.328055Z","title":"U., and Aggarwal, V","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.328055Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:cd2ae2ea75c482783355de8ef00c116bc89d4782cb621bc54730d0ff14ad07b5","observation_id":"228788f7-1672-48d9-9eaa-313353ff86bc","resolution":{"observed_at":"2026-08-03T01:38:15.328055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:15.397070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.397070Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:ae443138a53b84c306a8631d4a6acfbf79fdb638c4606770d3853eae65f46245","observation_id":"92106f54-6fc8-488d-adc8-186dd6a38d5b","resolution":{"observed_at":"2026-08-03T01:38:15.397070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:15.461194Z","title":"S., Pasupathy, R., and Aggarwal, V","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.461194Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:62d0e263ff44c9b9650486dd5314a9f2856b37821b4e8925ef5e8c51a8348c62","observation_id":"4d235133-44a4-492a-8263-4e8054939c74","resolution":{"observed_at":"2026-08-03T01:38:15.461194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.02246","last_updated":"2018-02-06T22:10:14Z","snapshot_observed_at":"2026-07-06T06:22:08.261855Z","submitted_at":"2018-02-06T22:10:14Z","title":"Approximation Methods for Bilevel Programming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.02246","snapshot_observed_at":"2026-08-03T01:38:15.537353Z","title":"and Wang, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.537353Z"},"links":{"cited_paper":"/paper/1802.02246","citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:2d47889be51f063eeff82639976daf6172907e690c191b5dc8b376615a09a228","observation_id":"f6359638-8bc2-4283-93ab-9d30d441396d","resolution":{"observed_at":"2026-08-03T01:38:15.537353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:15.614105Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.614105Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:834635bb57e17a998b5810124c203434d3a876e794db574c49e747f6edcf726d","observation_id":"1aeb9dc2-2752-44fd-94ad-272ed2980abe","resolution":{"observed_at":"2026-08-03T01:38:15.614105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:15.713752Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.713752Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:85b6b904bf20c8569e77fdf838f764e13627b80b23d419c4f38a69f2eb582e37","observation_id":"a141b86a-829a-4fbf-a8ba-b8239a62a818","resolution":{"observed_at":"2026-08-03T01:38:15.713752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:15.791091Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.791091Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:efb2e20880b4431b323e72edc3ac84392651f1da0959be626ec1a989a93fd658","observation_id":"f64caa87-99e4-4fb8-899a-07141cb840ae","resolution":{"observed_at":"2026-08-03T01:38:15.791091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:15.883588Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.883588Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:27423fb4dae1108dff9962b70857df6bdfaad12c1bef0000e6d040c4b2678eaa","observation_id":"78cce6ce-b1e3-4e0e-8b08-7c38d46759b3","resolution":{"observed_at":"2026-08-03T01:38:15.883588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:15.959960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:15.959960Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:5230d373cd4ef109c976477d1457b53de383194271cf0cab8151b9efec58d934","observation_id":"4c57dba8-c0ee-4e8c-b92a-8ab38eeda842","resolution":{"observed_at":"2026-08-03T01:38:15.959960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:16.041306Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.041306Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:167945430beea8c59d1ee9af5c3eda706a289eb9dc2f12999e9b4d83da4e5648","observation_id":"cce51860-4769-4bb1-925a-e5c072201367","resolution":{"observed_at":"2026-08-03T01:38:16.041306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:16.152427Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.152427Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:af93ea82753c99bf8312b2dfa4fb4a81e42e6bfc73c1d6f13d39ca4f4d936e94","observation_id":"ddcb0d4f-ec5a-451e-89d2-75d07b83707f","resolution":{"observed_at":"2026-08-03T01:38:16.152427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:16.235023Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.235023Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:7ac456a581c950b79289f8973474917f3a3272e27e011115b70517bfcb0e450d","observation_id":"5ae78788-d5a7-4f2f-b1f5-1e31c6b27bc7","resolution":{"observed_at":"2026-08-03T01:38:16.235023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:16.345052Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.345052Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:3c2aaf6b7bd5d3c13d84c02f6709fd3a2dfb1f657f4f0afa9112c89f34de0884","observation_id":"c69bfb1e-2001-483a-890d-2b3a2925b72a","resolution":{"observed_at":"2026-08-03T01:38:16.345052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:16.421015Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.421015Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:62756c2a98702dbd3ed10d2b854c01471e15e7b1f1013d8e5830950cef131176","observation_id":"ec1e3bf9-ebb8-4f5e-b112-3a37a542c0fe","resolution":{"observed_at":"2026-08-03T01:38:16.421015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:16.494178Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.494178Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:f5083ee6214d43555c6d60aed58dbb526ca54db5b339d1af335eb7a905ce6873","observation_id":"105e5df8-ca7e-43d5-b6c8-991002da3fc2","resolution":{"observed_at":"2026-08-03T01:38:16.494178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:16.534166Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.534166Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:eab6c625434f690a0446b67688c4ac5e18dac7a51f7583a1291971b3f70815c7","observation_id":"13dac79f-7ed7-4e63-86a5-5b0bcd25bcbf","resolution":{"observed_at":"2026-08-03T01:38:16.534166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:16.631772Z","title":"and Chen, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.631772Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:ec8773ade99f46826593442b0d23fd29315d2b9d77ec7a14a7b243c4068226e4","observation_id":"25989173-818e-49a8-b151-3a8ee13715d5","resolution":{"observed_at":"2026-08-03T01:38:16.631772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:16.704747Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.704747Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:494ca2d47c0911097596cb40428b136376a2cecb5f0e57e9958f5a28e08e07bf","observation_id":"d14f801c-87b0-435e-ad01-83881b226b90","resolution":{"observed_at":"2026-08-03T01:38:16.704747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:16.795656Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.795656Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:ba0c77569f625f09a53d81ff7c33cd23556814fc944023445e602ac3e94ddcaa","observation_id":"573909b5-ea75-4f1b-a462-004c991d45c8","resolution":{"observed_at":"2026-08-03T01:38:16.795656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:16.863877Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.863877Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:e34294baef4cc62be10ce6c0b9a8723eeeef6eee355db6aa60c13b5708c3ae57","observation_id":"12a2a072-c57a-4d5c-89eb-610f52327b6b","resolution":{"observed_at":"2026-08-03T01:38:16.863877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-03T01:38:16.949810Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:16.949810Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:cd36b1604261b05df6c5bde1d9e168c75b72c249298e071c892e583a4723ffab","observation_id":"12ad3002-aee7-4be9-b01b-cb9883898372","resolution":{"observed_at":"2026-08-03T01:38:16.949810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:17.044732Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:17.044732Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:eb4e6140da33004253e08a5058feefbb2417b7156499488ecc3714b35e226c52","observation_id":"bd0e87f5-868a-45dc-b0c5-423d451e6a74","resolution":{"observed_at":"2026-08-03T01:38:17.044732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:17.144361Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:17.144361Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:64caeb2200067c749c59c8e000a9ceccc2fcf986f0db54fe90a59ea6c4e7d75f","observation_id":"237b557c-785d-4530-ace0-62394a202820","resolution":{"observed_at":"2026-08-03T01:38:17.144361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:17.240498Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:17.240498Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:36b8f4d4f95191a0f904677ded349519f6fbeea26a533ab96c4f8efbcc6e3681","observation_id":"da5ec1d8-06ec-4223-af14-d739e5193a9d","resolution":{"observed_at":"2026-08-03T01:38:17.240498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:17.414751Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:17.414751Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:d538aed3e23e017f526db00ad67fb9e5e33041749853b156a1ded350a5fade5a","observation_id":"b5b352b3-f7fe-42c9-8e96-81c73ade5f33","resolution":{"observed_at":"2026-08-03T01:38:17.414751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:38:17.524753Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-03T01:38:17.524753Z"},"links":{"citing_paper":"/paper/2607.28849"},"observation_digest":"sha256:0806e917682667658846ba3c0c6c99a94069551104b557e1571d1f06f3882264","observation_id":"c3487aaa-dee0-4ff2-8b7f-4c7aaaabdf05","resolution":{"observed_at":"2026-08-03T01:38:17.524753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28849","last_updated":"2026-07-30T21:21:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T16:36:38.948098Z","submitted_at":"2026-07-30T21:21:52Z","title":"Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 0 inbound Pith citation observations for arXiv:2607.28849."}