{"as_of":"2026-08-11T04:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:446295588645658cc282db56567058d4526de0cc269b0cd421d5775c471d34da","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:56:46.449273Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T21:50:18.827822Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T21:53:59.250802Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.04406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04406","snapshot_observed_at":"2026-06-29T21:53:59.250802Z","title":"Convergence and sample complexity of first-order methods for agnostic reinforcement learning.arXiv preprint arXiv:2507.04406,","venue":null,"work_id":"36b14c0b-1634-4f14-bc30-0b017326f78e","year":null},"citing_paper":{"arxiv_id":"2605.25507","last_updated":"2026-05-26T17:23:26Z","snapshot_observed_at":"2026-07-06T23:35:26.687529Z","submitted_at":"2026-05-25T07:11:50Z","title":"Credit Assignment with Resets in Language Model Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T21:50:18.827822Z"},"links":{"cited_paper":"/paper/2507.04406","citing_paper":"/paper/2605.25507"},"observation_digest":"sha256:c8cecc99ec97fa756953452f674e53d678b54f845e24452b63f13720a99455ba","observation_id":"2620bc73-578c-44a4-8e65-b6a2367a48dd","resolution":{"observed_at":"2026-06-29T21:53:59.252556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04406/citation-record","integrity":"/paper/2507.04406/integrity","json":"/paper/2507.04406/citation-record.json","paper":"/paper/2507.04406"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:55.609810Z","title":"Agarwal, N","venue":null,"work_id":"ab51a40e-a62d-4d86-b0a9-ba8a0f7787c1","year":2019},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.503054Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:8a3cdfb13ebe3f1da88efef823dd4853e15f9d1158bb89843daf2763b0794f12","observation_id":"4cb08db8-3aae-4918-847c-d63652e6b698","resolution":{"observed_at":"2026-08-06T19:56:55.769014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:55.300148Z","title":"Agarwal, S","venue":null,"work_id":"0466e29b-ba61-49cb-a37b-c20e95c4ad2f","year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.547698Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:adffb090809690873e02d7ccd3e16d1bb0246f8bb2462bdfd9ee3fae511a8c2e","observation_id":"dbdaa2ff-6213-445a-b08b-b46becb5f5a3","resolution":{"observed_at":"2026-08-06T19:56:55.380046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:55.149043Z","title":"Agarwal, S","venue":null,"work_id":"700860d7-0a2e-4eb1-ac26-ddac622c965b","year":2021},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.606734Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:c9cd85e117c98baed469ea2ba846789dfbb9ce7579c6518658958287b35ee6e8","observation_id":"6b73a9c2-1863-42ce-be42-c7e3235d89cb","resolution":{"observed_at":"2026-08-06T19:56:55.221806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-06T19:56:42.688874Z","title":"Akkaya, M","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.688874Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:77befcb6598d000f9cfc564f2eb1e508fa8faadee37ad28ced35ff593042b591","observation_id":"61b49577-d808-4e8c-86f4-307547fc27d8","resolution":{"observed_at":"2026-08-06T19:56:42.688874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15382","last_updated":"2023-03-13T18:33:28Z","snapshot_observed_at":"2026-08-09T00:33:58.552154Z","submitted_at":"2022-09-30T11:17:44Z","title":"Linear Convergence for Natural Policy Gradient with Log-linear Policy Parametrization","version":2},"cited_work":{"arxiv_id":"2209.15382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.15382","snapshot_observed_at":"2026-08-06T19:56:46.894140Z","title":"Linear Convergence for Natural Policy Gradient with Log-linear Policy Parametrization","venue":"cs.LG","work_id":"6537f5af-c0b3-4641-ae6c-3d504aef9f08","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.747280Z"},"links":{"cited_paper":"/paper/2209.15382","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:8ad258c790d3cb6f13101c28b3e5ed996d9af1f2ebf1c8453b17e24bf93b1838","observation_id":"3a48d8a1-0a0e-410a-ac46-4cff4b2ed971","resolution":{"observed_at":"2026-08-06T19:56:46.944973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.962894Z","title":"Alfano, R","venue":null,"work_id":"c92d6ccd-d93a-422c-9fba-7db61cdd1fab","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.814465Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:3980f83bb0b7c7303020b670c90fa128d0f28375b9e07d50438f87736df02dfd","observation_id":"ce801c2c-3810-4685-ab3a-220f890f5392","resolution":{"observed_at":"2026-08-06T19:56:55.018954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.810294Z","title":"Bagnell, S","venue":null,"work_id":"2f7b1fea-6140-4a94-be15-1fcc0cbd5c75","year":2003},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.885713Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:bc966a6dcac6c03eeaddcec787b38f7bbeee8abc27e8a1c8feac88bf16d10647","observation_id":"8e6b671c-d9e7-4ef5-821c-4d47cd8ee2f6","resolution":{"observed_at":"2026-08-06T19:56:54.892376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.687250Z","title":"Beck and M","venue":null,"work_id":"38de9b3e-d40e-4f4b-a907-06b0802976d6","year":2003},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:42.944430Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:e281a2a15833f8e25c3287db1e8ab07472030315c6344122673a110890cecc9e","observation_id":"f186f1d8-9b20-4275-9830-16d8977f5f8e","resolution":{"observed_at":"2026-08-06T19:56:54.735011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:43.005441Z","title":"Bertsekas and J","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.005441Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:44ad4738ab9f4dc236147e224093dc3555a02567d4e8187d1cb100e507346b39","observation_id":"97f64c9c-04de-44a1-994b-be8663a0da70","resolution":{"observed_at":"2026-08-06T19:56:43.005441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.494623Z","title":"Bhandari and D","venue":null,"work_id":"e3a7e5f2-8f02-4e44-a59c-d43c431ae6ce","year":2024},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.064504Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:d1e88bc514b999bc4e971d9e1ed9a84df406aee4188c6187a7edaa212bccd135","observation_id":"547c527b-ccfa-4f03-8ea5-24e8a06a458e","resolution":{"observed_at":"2026-08-06T19:56:54.591127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-09T23:24:21.399948Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-06T19:56:43.152040Z","title":"Brockman, V","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.152040Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:f381ad0c7e436b74f3d8569129aab687a8cb6ec21a4049dfd112c4e3b5ca25fa","observation_id":"87bc8901-84e5-4e6e-85c4-f8998e664b44","resolution":{"observed_at":"2026-08-06T19:56:43.152040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.338630Z","title":"Chen and N","venue":null,"work_id":"aa1ae8a7-8366-47a0-8807-69ea86ed4d11","year":2019},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.212351Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:85d037eebf4ed591bbd5984b2b7975f9fa3b3b216d14aa3aa82465047929eaad","observation_id":"5ab872a4-1a6a-414e-8a52-c7936fd1f999","resolution":{"observed_at":"2026-08-06T19:56:54.399478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.227193Z","title":null,"venue":null,"work_id":"37c6206e-8ab7-40fa-aeb5-680223091f96","year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.300680Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:35e590912283f8f58ad36130dda0b9090a83a44f7f14a6f198350f523377d8c3","observation_id":"48e2ceb8-e6fb-4ab9-b704-f57ebe9e4356","resolution":{"observed_at":"2026-08-06T19:56:54.274635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:54.068433Z","title":null,"venue":null,"work_id":"748ec436-65b3-4ca9-89cc-c20c20ab0763","year":2021},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.360615Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:ce680cfc079018813270c4398fd47b34901e33ecc032d6e54796dd6c90af06a0","observation_id":"804cb60b-5951-4213-b16e-7a914deb3133","resolution":{"observed_at":"2026-08-06T19:56:54.151302Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.900049Z","title":"Even-Dar, S","venue":null,"work_id":"8f133ce5-e0f6-4c6d-bbb1-a3ac0ca7702e","year":2009},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.432264Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:e4d5349491d0a429d7448ac740afc61d86ea8808181d2a9aa2dff776afe2c83d","observation_id":"a06fdf79-8f4e-42fb-84b7-6db34e66bf27","resolution":{"observed_at":"2026-08-06T19:56:53.948994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.791864Z","title":"Frank and P","venue":null,"work_id":"9d0c66eb-9455-4f0e-9984-a265ddafa7c0","year":1956},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.522085Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:4b113ceea20f49da2acdc0bb9072998010e81018b6f6741c8c7d175a8d0d9397","observation_id":"079b41e2-47de-40bc-b4f7-951c094d2321","resolution":{"observed_at":"2026-08-06T19:56:53.847496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.685385Z","title":"Geist, B","venue":null,"work_id":"de14ce60-0215-4123-bef6-3a0efe2fcc52","year":2019},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.591388Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:de0239a020643c9f359d6ef6029b988bc3ab4410d90327e63a8da72230ec48ad","observation_id":"9310e645-84f7-40a6-9ea1-1965563cdac1","resolution":{"observed_at":"2026-08-06T19:56:53.735537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.544236Z","title":"Grudzien, C","venue":null,"work_id":"5d31eec7-a844-41f4-96e5-1076f497d8bb","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.686563Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:15c56233ec391328c305622817fe592e65578e358540abef5d43267ca83cfd97","observation_id":"2c9851d6-064e-4a23-8846-181e764637b3","resolution":{"observed_at":"2026-08-06T19:56:53.615558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.290997Z","title":null,"venue":null,"work_id":"f2aa65ca-d9ab-4286-9c9c-77257f27a7c0","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.771531Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:4f338273df33fc09810eb2865e32f35f4a9957aa75673e78bab933722f36f8ca","observation_id":"b7889c24-92d6-4d34-aabd-ab55574468bb","resolution":{"observed_at":"2026-08-06T19:56:53.403754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:53.086461Z","title":"Jiang, A","venue":null,"work_id":"cebf869e-7d07-4f9e-a3f1-b000ba111cb7","year":2017},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.849683Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:48034718437f05d2c244f5dbddd424b2450b6b51b3d702b150ee285d22510b7a","observation_id":"ecf22019-93fd-48c5-95ea-a2dbafacc3e2","resolution":{"observed_at":"2026-08-06T19:56:53.193150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:43.964974Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:43.964974Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:370501a2f13acce874a5207aeef3dabfc3075f1b2307a0a15ff5930474428264","observation_id":"8c056add-ab94-4309-b6a6-d07d9a185a6a","resolution":{"observed_at":"2026-08-06T19:56:43.964974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:52.913231Z","title":null,"venue":null,"work_id":"747b1163-e23f-4363-8893-bfdc3c4a67fc","year":2021},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.032915Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:9d03bdf10b83c45d0bc295275752c72371b520a50ed3a5c9000077a437829d6b","observation_id":"91edb8ea-b2d1-4d47-9bf0-e0c8fa829a53","resolution":{"observed_at":"2026-08-06T19:56:52.962578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:52.686319Z","title":"Johnson, C","venue":null,"work_id":"69a91fe8-9eb6-46d5-a235-151fc22bf207","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.081985Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:a30c527af26ecdde37a3aae4a3589a82b6eb69e4dc6f3de22206e17f9d8fd5c8","observation_id":"35fa3159-72a6-4cbb-8a5b-cf9a1216ddb2","resolution":{"observed_at":"2026-08-06T19:56:52.771011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:44.118452Z","title":"Ju and G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.118452Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:8483a84cdedd3cf2bda0ea71f1931542dcf3ec2d0d494025a5e14315a8bee6e2","observation_id":"d53b4a6f-59ec-4938-a9e8-11db32de3450","resolution":{"observed_at":"2026-08-06T19:56:44.118452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:52.562281Z","title":"Kakade and J","venue":null,"work_id":"40576c11-a1e6-4c14-8642-0e273b34cb2e","year":2002},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.206945Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:c93fec25c7f540903a79ac18ab5c7a99a5b555b22cc3c6f43f5ebe3d36808b21","observation_id":"f740fd37-05e7-4b81-98ff-3815c1399566","resolution":{"observed_at":"2026-08-06T19:56:52.627089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:52.353116Z","title":null,"venue":null,"work_id":"2ab82e69-d2d9-485f-afef-ab1bcbb4673a","year":2001},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.259673Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:fdfe592191c92a1b69f95c0d8a8cb144098c586c88e72b308477f189221ebd3f","observation_id":"1903ff39-ddfb-4e94-afbe-12a827d4d68b","resolution":{"observed_at":"2026-08-06T19:56:52.430002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:52.149531Z","title":null,"venue":null,"work_id":"4ac4cd0c-82b0-4efe-9ecd-f95aba00e569","year":2003},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.340317Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:268db43af7eec252218813489303c984c31667469791146b8bf11b62a77e5a23","observation_id":"ddfe54ef-ab21-4ae8-a771-db1415b3773c","resolution":{"observed_at":"2026-08-06T19:56:52.280873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:51.850405Z","title":null,"venue":null,"work_id":"99059028-45b2-4ee0-a837-1690e2525955","year":2014},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.430229Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:93cbff7b69aac9b98d991dde07176fe14c17866c71a82fd3a67b4bcbdd1e7f30","observation_id":"c0b326c0-3e58-4e44-ac3b-562e6b3de904","resolution":{"observed_at":"2026-08-06T19:56:52.014064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:51.574942Z","title":"Krishnamurthy, A","venue":null,"work_id":"d059eff2-bc7b-4714-b3d5-1f9fae888bb0","year":2016},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.528849Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:cd38f2de6961603c9f8160305d14e8ac054128e214fdee1efb1217e25a018fbf","observation_id":"720d198c-24d4-4ccd-935c-171fc5b54a64","resolution":{"observed_at":"2026-08-06T19:56:51.690570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05405","last_updated":"2025-04-07T18:19:56Z","snapshot_observed_at":"2026-08-07T16:07:50.083861Z","submitted_at":"2025-04-07T18:19:56Z","title":"The Role of Environment Access in Agnostic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2504.05405","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.05405","snapshot_observed_at":"2026-08-06T19:56:46.700343Z","title":"The Role of Environment Access in Agnostic Reinforcement Learning","venue":"cs.LG","work_id":"2f4a0da4-b52b-48a8-88e8-f5249b3564d5","year":2025},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.589686Z"},"links":{"cited_paper":"/paper/2504.05405","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:a8bbcecc37d84168dc9bd60cadb80b6b60b87a7e193a8a567434844946db5b93","observation_id":"ae6355d2-53d5-4006-bf07-89d30cbf6a5e","resolution":{"observed_at":"2026-08-06T19:56:46.744379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:51.309762Z","title":null,"venue":null,"work_id":"621a20f3-36b7-4198-95c0-9b46f8b4d452","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.685036Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:35082371dcdcb27b6cd756107c71113b0ab326e43c78d8b88f0b528583ba1960","observation_id":"d876acf5-0ee3-41e2-8ec8-20c60df2ba57","resolution":{"observed_at":"2026-08-06T19:56:51.426378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:51.078788Z","title":null,"venue":null,"work_id":"a48d8204-47d6-4101-986e-1d13d2a46352","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.771130Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:dc2f8d83a4388ee9bc8eb56e51047bc5743971d23147a0aa1ae7027e6f5a37a5","observation_id":"03a6ccb3-1981-4cd8-807d-e40dd642b1fc","resolution":{"observed_at":"2026-08-06T19:56:51.193656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-06T19:56:44.872943Z","title":"Lillicrap","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.872943Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:04fc677298623ea0eb6a642189d96b15cb8b77d3e761e19783ae54fa9c7677b0","observation_id":"e35fad7d-dc00-45b0-8e3d-b8c41e659f7f","resolution":{"observed_at":"2026-08-06T19:56:44.872943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:50.806522Z","title":null,"venue":null,"work_id":"29e2de63-27da-4f78-9450-09741429344d","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:44.947341Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:8f2dd067ba240635a7ae5d051670ce88635572040bb6a2082debce46dce18518","observation_id":"64c2c14a-8925-4eef-a705-67621c5bbb64","resolution":{"observed_at":"2026-08-06T19:56:50.941668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:50.504747Z","title":"Mannor, Y","venue":null,"work_id":"9020c3fd-75b3-4a99-ae12-a59d1c078fea","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.029546Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:0d4bcf6458e747bb95872026c6005ee0fbfe5052bf22f062942da2d50e51a693","observation_id":"a697fa0a-93a3-4c4f-b1aa-0fd84058bc08","resolution":{"observed_at":"2026-08-06T19:56:50.644861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:50.349664Z","title":null,"venue":null,"work_id":"4e68413a-c76c-43b6-a523-9ef39448579e","year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.085461Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:46464d13e3b341249eabe995197c1e23fc2ed6911ee31e8c881882576ebf0d39","observation_id":"cb8f30b9-858a-4f1b-81d2-396965c6b071","resolution":{"observed_at":"2026-08-06T19:56:50.415231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:50.023785Z","title":null,"venue":null,"work_id":"125a65b4-359e-4fc6-8fcf-cc38e996f8f4","year":2021},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.156647Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:45a3b36eec8fa9b52b79125b9e17060874d0221a76d1e26aaa15f16b39edf93a","observation_id":"e36d6700-19b9-46a5-8b72-d5fb045699fb","resolution":{"observed_at":"2026-08-06T19:56:50.172857Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:49.762613Z","title":"Mu and D","venue":null,"work_id":"d961966b-502c-4353-8dcb-723df5d448d6","year":2024},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.224617Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:a489550c5300f547dd94f09482a6eb67b85dd19a3c5ae053e6a82576c99e1a7f","observation_id":"761e8cbe-81a7-4ae4-b549-9d4f4f221291","resolution":{"observed_at":"2026-08-06T19:56:49.885374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:49.465471Z","title":null,"venue":null,"work_id":"4eefa122-53e6-419e-8209-edb1d6e4ce92","year":2003},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.273675Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:3c870027834e51c13b13f1e88cd790d57e7460b1c9bdfe9b6ed7d97dd0e072ff","observation_id":"9bb38d44-a3da-4306-8eff-d8fcb130ff92","resolution":{"observed_at":"2026-08-06T19:56:49.566220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:49.185011Z","title":null,"venue":null,"work_id":"6d41714d-f58f-46ff-b006-723acc9eb0f8","year":1999},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.341213Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:ccd681fc844f54d9273ad40c7764232976d64b1f6b16d5cb20bf71604a4ccd1a","observation_id":"35bb5d3f-170c-4db7-9189-48206e91fa1c","resolution":{"observed_at":"2026-08-06T19:56:49.300451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:49.063082Z","title":null,"venue":null,"work_id":"f302d5c6-11bf-4aa7-899b-ac9b9da229ee","year":1983},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.401503Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:4a1a5e4dac4f0959fdd014b53621fdb84ee59e158e3724cd5748939ee27c179b","observation_id":"a2ad5e08-2779-46a3-9c82-22fd29811265","resolution":{"observed_at":"2026-08-06T19:56:49.148822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:45.428551Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.428551Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:de66374c550a7bcfb065fc116a4b350501a523aec2bb334dfd4f7872e8b44ac6","observation_id":"6d6105a0-d557-45bc-b6bb-05de768896f6","resolution":{"observed_at":"2026-08-06T19:56:45.428551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.869852Z","title":null,"venue":null,"work_id":"60c6652c-3986-47df-937b-562ef6ab1c68","year":1994},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.480563Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:7365df4a69df74c1d34a458b9c4646b59b83b84f8f44871e82cf13da3538bdeb","observation_id":"f9a7b781-900e-4d38-9026-2bc097e05bc4","resolution":{"observed_at":"2026-08-06T19:56:48.990240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.694954Z","title":"Scherrer","venue":null,"work_id":"5bde0679-0c9c-4128-a67c-371daa4b01e0","year":2014},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.538405Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:8dfc2eafe8a1f2093904456b84c8c61834ee74565c2921f71def3884bdadca07","observation_id":"a448a263-20f4-4f70-8b38-b602d42cb30a","resolution":{"observed_at":"2026-08-06T19:56:48.809612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.515614Z","title":"Scherrer and M","venue":null,"work_id":"27d7b4a5-887b-437e-8807-1e5dd884f4bc","year":2014},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.609898Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:174c22219e00a2ffc687358e6399b6922811c484d22f2d055fa3a04081608ed5","observation_id":"9b9d5221-9a52-49e0-be58-99d26e3cc2d5","resolution":{"observed_at":"2026-08-06T19:56:48.595104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T19:56:45.687253Z","title":"Schulman, P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.687253Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:a93e30f127f6e410a8886cb3edcba66befa92ab97c6388a2a2caaad908c7663b","observation_id":"920be5b2-6a53-4195-b1c6-48b0c2efd2ab","resolution":{"observed_at":"2026-08-06T19:56:45.687253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.314916Z","title":"Sekhari, C","venue":null,"work_id":"81a4aa94-1dce-41c5-9ca6-a4e7a26ced50","year":2021},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.780324Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:b583416923d58846ba5567f91734fcc02d275333bd723b5d2d35665c768ea686","observation_id":"5ea4cc05-0826-43ae-befc-31e94eb4b87c","resolution":{"observed_at":"2026-08-06T19:56:48.423747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11033","last_updated":"2025-07-06T14:24:11Z","snapshot_observed_at":"2026-08-07T18:15:05.140501Z","submitted_at":"2025-02-16T08:05:46Z","title":"Convergence of Policy Mirror Descent Beyond Compatible Function Approximation","version":3},"cited_work":{"arxiv_id":"2502.11033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11033","snapshot_observed_at":"2026-08-06T19:56:46.569107Z","title":"Convergence of Policy Mirror Descent Beyond Compatible Function Approximation","venue":"cs.LG","work_id":"2d7bead3-b15b-430a-8527-3f83b5cc3dda","year":2025},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.846402Z"},"links":{"cited_paper":"/paper/2502.11033","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:0e7c27ef0349d1a007b049cd8331d723bfef5f24755103bee0bde009b8143c60","observation_id":"85c38d33-ce5a-49fc-8843-99803980f082","resolution":{"observed_at":"2026-08-06T19:56:46.619489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:45.893634Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.893634Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:70bc2f18a753777bbadddc091e3bd96ee3c24bc33466fa4bc0ddf596b951799e","observation_id":"559703b8-d094-4d62-a071-cbcd094a8ec6","resolution":{"observed_at":"2026-08-06T19:56:45.893634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.225574Z","title":null,"venue":null,"work_id":"45d78675-d538-404b-82ba-6476ecb9b2fe","year":1999},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:45.945576Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:c85102fa675a1c91b5b08f6fb40da2311e800b45a8b8b0fd156c1caec451b801","observation_id":"4dc824b3-e8c0-4bb0-bba7-31b6446568ee","resolution":{"observed_at":"2026-08-06T19:56:48.283564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-06T19:56:46.000303Z","title":"Tomar, L","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.000303Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:a929996bf712f533b55cb2353909965d1145a90335d4d68a8810bcd82e687d5c","observation_id":"ae7111e3-ab19-47b2-b7ab-59905970265b","resolution":{"observed_at":"2026-08-06T19:56:46.000303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:46.046621Z","title":"Vershynin","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.046621Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:c4038e268e155d24f2a7514b5b987d835d3e988d7be563b0e3ceb64e5741200f","observation_id":"273af57d-c580-4457-a7e7-adf7eca57901","resolution":{"observed_at":"2026-08-06T19:56:46.046621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:48.018630Z","title":null,"venue":null,"work_id":"10ce712b-16ea-40f4-b1ae-16148ce84232","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.097993Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:ccbd13bceacbb31553ae171b61a963eaa22ac1a23ba8ba0ccd71bf0c50371158","observation_id":"d8324125-b868-4f48-a877-50282f7e2f5a","resolution":{"observed_at":"2026-08-06T19:56:48.125297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.821792Z","title":"Yang and M","venue":null,"work_id":"2c854547-356b-4dc2-a78b-28aacf6066d0","year":2019},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.150654Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:10bde6dfd41ace9e44b2a010f56f8cb683aa28f43bfcb4c8dc5c83cf4aef644e","observation_id":"a40d530f-4b33-4938-8b7d-beb633a48f0a","resolution":{"observed_at":"2026-08-06T19:56:47.950777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.653499Z","title":"Yang and M","venue":null,"work_id":"ed116a9d-70ba-48e5-a608-1c6072bae7a9","year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.198579Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:6963e7bdec40b2b536168726fcfa77846f7e98fdf01cdbd302c0d0eaab9ce04f","observation_id":"72a8ebea-8d42-452c-9d8f-24ab795c99b9","resolution":{"observed_at":"2026-08-06T19:56:47.753489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03176","last_updated":"2019-06-07T00:36:50Z","snapshot_observed_at":"2026-07-06T07:37:51.655095Z","submitted_at":"2019-03-07T20:34:36Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03176","snapshot_observed_at":"2026-08-06T19:56:46.234417Z","title":"Young and T","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.234417Z"},"links":{"cited_paper":"/paper/1903.03176","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:3b2a7e651c3df1409bcda4081da575feeab4f487a8f1c8309064cafab31074ea","observation_id":"31fb04ef-15dd-4d81-a775-2b5c09f3d042","resolution":{"observed_at":"2026-08-06T19:56:46.234417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.521044Z","title":null,"venue":null,"work_id":"f8b8fd6b-aacf-40bd-a024-6c9927880edc","year":2022},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.313633Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:d3dbefd1054f1d65045269d98d3e09b5e981a5308300d880a190974fafd2799e","observation_id":"0ceb1743-7cc5-4209-9961-2238828dca5d","resolution":{"observed_at":"2026-08-06T19:56:47.593740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.348369Z","title":null,"venue":null,"work_id":"8d515f6c-293c-4d88-92e1-666dce1e385c","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.355145Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:2f94f857001d17b0571a24d067e98de04908b8d577f4087077f92359c2ddbbae","observation_id":"a3d6a1de-b23d-417d-ad79-ace3acb4b356","resolution":{"observed_at":"2026-08-06T19:56:47.460885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.191387Z","title":null,"venue":null,"work_id":"3a049624-3fa8-40b4-a623-aafa8af330d2","year":2023},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.390450Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:dc18ec3588d53553936f308362302547549dfd2488d4780565f8b06c2e59925d","observation_id":"49d8462a-9de8-4f67-a5f1-6dcec81c199f","resolution":{"observed_at":"2026-08-06T19:56:47.282605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:56:47.046234Z","title":"Zhang, A","venue":null,"work_id":"8f7ce1e9-4245-445d-8235-2b80050d643c","year":2020},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.449273Z"},"links":{"citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:79eb5df91a8fe840f7d473465a1f2fd1eb6caa2ffb054610633538c3d8470644","observation_id":"b9a2af75-23a5-4467-a444-e72bc3caaa7a","resolution":{"observed_at":"2026-08-06T19:56:47.112733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2507.04406."}