{"as_of":"2026-08-11T10:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e136a99b1a1a3af1f5cf3326e89a71a2babaeba13f7c2393ac1fafa16f96bb98","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:01:05.049084Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20307/citation-record","integrity":"/paper/2506.20307/integrity","json":"/paper/2506.20307/citation-record.json","paper":"/paper/2506.20307"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.159177Z","title":"VO Q L: Towards Optimal Regret in Model-free RL with Nonlinear Function Approximation","venue":null,"work_id":"421be87f-15a7-4782-a3ac-fbedc5c5e1ed","year":2023},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.751681Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:791209c92b0b0a3cfddce3a292fe1b7fd8ce306c42453382def96c72c31069e1","observation_id":"29b64a58-902b-42e7-b8c8-7c39dbb83145","resolution":{"observed_at":"2026-08-06T23:01:06.164194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.379415Z","title":"Hence the right-hand side of the above inequality is a martingale difference sequence","venue":null,"work_id":"0c6bcab1-b5c5-4e53-a1f9-6ecf2b1a554e","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.038586Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:694ba09504474831e0d7e6924cb3bc3a4af343f37d1d6686724777f94ab8551c","observation_id":"c2935928-7172-4033-b4de-e0536c1748d6","resolution":{"observed_at":"2026-08-06T23:01:05.385296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03207","last_updated":"2022-01-31T16:54:53Z","snapshot_observed_at":"2026-07-06T11:16:26.441741Z","submitted_at":"2021-06-06T18:31:08Z","title":"Mitigating Covariate Shift in Imitation Learning via Offline Data Without Great Coverage","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03207","snapshot_observed_at":"2026-08-06T23:01:04.784230Z","title":"Mitigating covariate shift in imitation learning via offline data without great coverage.arXiv preprint arXiv:2106.03207,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.784230Z"},"links":{"cited_paper":"/paper/2106.03207","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:485723748f388ab626d8dad90bae55dfe7c9f254ef458a26c43463d4a0948ef0","observation_id":"d1430f1a-554f-4981-8768-5fe5da62a566","resolution":{"observed_at":"2026-08-06T23:01:04.784230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.098322Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"323d8dca-c5fc-48ec-a7d3-fa4c9105cefc","year":2017},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.794263Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:cf58801c5c839dc74c082cb74a5ea5be71ec94e1ef03f4143dd024e96d699ef4","observation_id":"df7ddbfb-ad7c-403d-8beb-40225c342e4c","resolution":{"observed_at":"2026-08-06T23:01:06.103150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.067634Z","title":"Guided cost learning: Deep inverse optimal control via policy optimization","venue":null,"work_id":"b9163c9f-c628-4abe-b6af-b2aeb6b83034","year":2016},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.804541Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:22779272ed2767e186d368e75a9d9bc13a0973ecef51783ba27092d48b521043","observation_id":"71e633ff-c691-4c30-90cf-0455709637f0","resolution":{"observed_at":"2026-08-06T23:01:06.072586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.052327Z","title":"Efficient Bias-Span-Constrained Exploration-Exploitation in Reinforcement Learning","venue":null,"work_id":"c668c18a-3cf7-421d-8a83-406f8ed62d9b","year":2018},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.809354Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:e2451174ea4a00eebbdb8518835f6884dfe6c370cd89f1b04bcc6f5052c308a7","observation_id":"7a4acd9a-846d-455d-91cc-1b8b51483044","resolution":{"observed_at":"2026-08-06T23:01:06.057428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.035916Z","title":"Ess- InfoGAIL: Semi-supervised Imitation Learning from Imbalanced Demonstrations","venue":null,"work_id":"5580d493-b191-4840-9d50-7b271ef87cb9","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.813739Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:11b9c9bea065c8392d63513f768bba366b4036337bc6b27c3c911a16046ca45f","observation_id":"45e1ea72-f27c-4164-9f2b-1e274f29568d","resolution":{"observed_at":"2026-08-06T23:01:06.041045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.004941Z","title":"Deep Q-learning from Demonstrations","venue":null,"work_id":"a0d6f5e2-515f-48fc-b967-05f7a96bfb15","year":2018},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.827906Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:fec3f9cafaab8611b1e510aefd441a2ad631061acfe6088aba40d187be38d868","observation_id":"cd84756d-95f2-4c82-a4d3-743b27f40256","resolution":{"observed_at":"2026-08-06T23:01:06.010041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.987824Z","title":"Generative adversarial imitation learning","venue":null,"work_id":"1338cc95-9773-4e34-b333-7ee717492ea9","year":2016},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.832292Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:43a68b55c9461b4819d966a0eb09e56f1e2293bb7cd86627e4d075044528d27e","observation_id":"b133a3c7-4d75-4bfa-9866-a868c4e96ac3","resolution":{"observed_at":"2026-08-06T23:01:05.993258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.953961Z","title":"3D Perception based Imitation Learning under Limited Demonstration for Laparoscope Control in Robotic Surgery","venue":null,"work_id":"5db7a9bc-e8c4-49d7-b4b4-30ffcf82043e","year":2022},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.841127Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:844b3eb0860e1205c8a54e7718e094fa660902bdd73a8e4ca6e4c77d28173829","observation_id":"91b69499-6cc8-42b8-ac7c-3b9f59206ec2","resolution":{"observed_at":"2026-08-06T23:01:05.959186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.923419Z","title":"Visual imitation learning with patch rewards","venue":null,"work_id":"d024336b-1257-4f78-af72-a8b2128ad487","year":2023},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.849975Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:1f9287a9b4ba1d29483a30a4f83b0feebe2d101d9f860e7fa2f08c0b8377211b","observation_id":"c8fc85d8-5ad0-41f3-ad6c-8e10520e6407","resolution":{"observed_at":"2026-08-06T23:01:05.928351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13213","last_updated":"2026-06-21T08:13:27Z","snapshot_observed_at":"2026-07-06T08:47:45.187408Z","submitted_at":"2019-12-31T08:16:31Z","title":"Online Learning: A Modern Introduction Using Convex Optimization","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13213","snapshot_observed_at":"2026-08-06T23:01:04.854645Z","title":"A modern introduction to online learning.arXiv preprint arXiv:1912.13213,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.854645Z"},"links":{"cited_paper":"/paper/1912.13213","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:f08a359205e87c826e19353594fcb283f07f3fb56154bb018e0252d352391b26","observation_id":"742c03b6-3d2f-41c0-bdf4-0f047d30e529","resolution":{"observed_at":"2026-08-06T23:01:04.854645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.907226Z","title":"Online Trajectory Planning in Dynamic Environments for Surgical Task Automation","venue":null,"work_id":"f1c427e8-315f-4834-8d48-65a1a3282743","year":2014},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.859792Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:92b562c6241ec7925012bed150cea582f7e98f3f6660a40b96467218a36cc702","observation_id":"3ff3c01e-d0ab-4d8d-9825-ff9e557cf0af","resolution":{"observed_at":"2026-08-06T23:01:05.911845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.871515Z","title":"Variational discriminator bottleneck: Improving imitation learning, inverse RL, and GANs by constraining information flow","venue":null,"work_id":"913712eb-52bf-4bcb-ba73-24def76eeb58","year":2019},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.868617Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:2922647aea81109869bf5875e1bbf2bed4715f731fbfbdcdd0e1ac839523b1de","observation_id":"da17bb64-0cca-4218-9a21-124f22abb2bf","resolution":{"observed_at":"2026-08-06T23:01:05.877453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.855838Z","title":"Alvinn: An autonomous land vehicle in a neural network","venue":null,"work_id":"0ed27dd8-98e5-4f10-9f74-717337f537c5","year":1998},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.873024Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:5d5a6ab8e16c00d7477a50a1d3ee1f7bbb06627787618d7058373130744ee12c","observation_id":"f879d5e7-62b6-4b22-ae25-c9e88a38667d","resolution":{"observed_at":"2026-08-06T23:01:05.860689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.823091Z","title":"Eluder dimension and the sample complexity of optimistic ex- ploration","venue":null,"work_id":"62dd6769-023b-407d-adfd-2f789f34f123","year":2013},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.887573Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:ef53d7f3d263e9ff925f995e1f49dbaa52fbe35ca3177d04553f897a4e76b26e","observation_id":"3c0ea454-4000-404a-bf68-3febb61d8b92","resolution":{"observed_at":"2026-08-06T23:01:05.829117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.807962Z","title":"State entropy maximization with random encoders for efficient exploration","venue":null,"work_id":"38b3d7d6-3ad8-4a9e-9794-9e0f960e0b82","year":2021},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.900895Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:f8cf81549faaeffd2cbad811345c51cf2eb56fafcf41c6f84a6a9cf0234fd90c","observation_id":"41ed20c2-c928-4329-931b-d583343495c6","resolution":{"observed_at":"2026-08-06T23:01:05.812856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.792240Z","title":"Optimistic policy optimization with bandit feedback","venue":null,"work_id":"08ce8d72-7898-4ce7-9387-5d7e9e786ee0","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.905816Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:d0cf89b1a97e85aa3dc8540ac1cd8f0cc295c52af236334491908e596c3f53c4","observation_id":"8062e568-92f6-4ff9-93b5-cb188b226393","resolution":{"observed_at":"2026-08-06T23:01:05.797507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.776593Z","title":"Online apprenticeship learning","venue":null,"work_id":"757fe00a-833d-4871-9973-4dd30e6f7d79","year":2022},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.910538Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:a1b3ffff3d05891446083829137d1db195358bee5b8c85f5da6384eece2b92c5","observation_id":"1b72b1f6-3135-4fe2-9106-8d1b85e3984f","resolution":{"observed_at":"2026-08-06T23:01:05.781367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.710688Z","title":"Error bounds of imitating policies and environments","venue":null,"work_id":"0724b325-b1b9-49a0-ba6e-c36c2a76d528","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.930935Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:9ebe2eb46c4556b93163af68b0ef44be331dcf27d6566d5969e3447961b0c4d5","observation_id":"5525c199-3a0c-463a-bfe5-386352dddaef","resolution":{"observed_at":"2026-08-06T23:01:05.715637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.694734Z","title":"Planning for sample efficient imitation learning","venue":null,"work_id":"45611fb3-6bcb-47a4-ad6a-10ecc8663562","year":2022},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.935986Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:069b8a10949ab8fd6364cb20d30dffc04b89bbe6ec54672defe97192c0f96c4e","observation_id":"f4a1949e-5356-4d75-8e55-016851457701","resolution":{"observed_at":"2026-08-06T23:01:05.700048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.679190Z","title":"Intrinsic reward driven imitation learning via generative model","venue":null,"work_id":"a438fd75-53b1-40ae-8da8-536ef4822505","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.940955Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:b14820052827bfab246c4ac3ac8bbf537194693a9803bc75f4f81507c1d1cf6a","observation_id":"9301e7f9-9829-4f86-b4f6-69119740d485","resolution":{"observed_at":"2026-08-06T23:01:05.684029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.663604Z","title":"Confidence-Aware Imitation Learning from Demonstrations with Varying Optimality","venue":null,"work_id":"d86f27e3-5bb7-4756-a538-02cf6df8521d","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.946103Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:af2ad878f6f7ccc18b8ea5993aeba6e533e5afb2235a984d8f0e36b40d6199ca","observation_id":"41454812-50d6-4cb2-ac40-31fe30f4c44a","resolution":{"observed_at":"2026-08-06T23:01:05.668551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.647534Z","title":"Deep imitation learning for complex manipulation tasks from virtual reality teleoperation","venue":null,"work_id":"6cfda36d-5b69-4f70-a3cb-6e20f1d29453","year":2018},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.952083Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:c4dff21fa17aa3ab8ce71bbb6594e066bb689c1c5b515f67d177cd78d3642150","observation_id":"2e8b9210-f32b-4cad-8c97-6cdc6ee02110","resolution":{"observed_at":"2026-08-06T23:01:05.652735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.631637Z","title":"Generative adversarial imitation learning with neural network parameterization: Global optimality and convergence rate","venue":null,"work_id":"4d114578-3619-414c-94ed-141947f57ab2","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.957872Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:2a22371984adad58a1350a74b07ce696cf66f862c5089b52fe488e508a599245","observation_id":"56e791c1-fa1b-4b82-9e48-a56c187039e8","resolution":{"observed_at":"2026-08-06T23:01:05.636759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2311.15238","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.169792Z","title":"A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation.arXiv preprint arXiv:2311.15238,","venue":null,"work_id":"981cb624-232f-4958-a1b8-3d40e207cf9e","year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.962898Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:81d85d7c3381206d8c699f0092dfb20522253fac5ad0bbd9b12e13e40fa2b0da","observation_id":"0a00e1f4-25c7-4b9f-9038-864e591e6e5e","resolution":{"observed_at":"2026-08-06T23:01:05.182636Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.615806Z","title":"Self-adaptive imitation learning: Learning tasks with delayed rewards from sub-optimal demonstrations","venue":null,"work_id":"b3162d59-f406-4253-b554-c306251e6c77","year":2022},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.968464Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:ecdd22c93ae3feefcf148856eea541e546b29df126c6d4dc5c96582830d44a22","observation_id":"460a07f9-20da-4e1a-bd98-1d8dd9cbda12","resolution":{"observed_at":"2026-08-06T23:01:05.620954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.599511Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":"3356fa40-b02f-46cb-9487-c6b53107dbbe","year":2008},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.973262Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:611f93c76816a23aa8a3d4d5cdb2695e702e672a782414a94456ca4dbb6350e1","observation_id":"29734fda-d086-4df7-8427-4b4a258fd90f","resolution":{"observed_at":"2026-08-06T23:01:05.604679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.562917Z","title":"Table 3: Comparison of three reward components with three attributes","venue":null,"work_id":"a1d556a8-6b99-4aed-939f-2f20642285a3","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.983256Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:7fb5ee40035f967e93d9d34575459f7516309b270922ef2d5168d034ad471dec","observation_id":"048c802e-77c7-494e-9aee-26f4ad98270c","resolution":{"observed_at":"2026-08-06T23:01:05.569475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.546426Z","title":"14 Published as a conference paper at ICLR 2025 Table 4: Demonstration lengths in the Atari environment","venue":null,"work_id":"d818607d-0e7b-463c-b091-de1fcb6dfc7a","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.987773Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:4eb643cdfdac6a4504a85f4d9082c99e2068b7a1f794425ae5aab180b009bc70","observation_id":"6b90e6a3-99bb-4dcd-b744-7602181ce3b6","resolution":{"observed_at":"2026-08-06T23:01:05.551681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.530639Z","title":"VDB constrains the information flow in the discriminator using an information bottleneck","venue":null,"work_id":"66ca9bfe-1d8f-4b44-be80-e6fbc65180cf","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.992820Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:cd557a2f99dff7229ae010e8500fc8d6955397ba95941fbbca93c879b4004a30","observation_id":"24521a19-8289-447d-955c-3a17c41e9cac","resolution":{"observed_at":"2026-08-06T23:01:05.535824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.514849Z","title":"The module is composed of several neural networks, including recognition network qϕ(z|st, st+1), a generative network pθ(st+1|z, st), and prior network pθ(z|st)","venue":null,"work_id":"80459e2e-4130-4ecb-a178-4d1e171abc6d","year":2021},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.997706Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:7c72a9ad50583c0724a683fa8983571efac7dd658ea3488a1db144722584f15b","observation_id":"e1069b43-fe6c-4bd7-93d9-ebe3814cbe2b","resolution":{"observed_at":"2026-08-06T23:01:05.519977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.499517Z","title":"State entropy estimate as bonus.Following Seo et al","venue":null,"work_id":"1111219b-47e5-4a0d-8baf-634ea3c13eed","year":2021},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.002708Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:a95fbe1fee1878da9cf23b5bbb5571ead6efc84c586f358860b93529c0fdb4ff","observation_id":"8ce758f5-e18f-48de-b356-14e6c64c46bd","resolution":{"observed_at":"2026-08-06T23:01:05.504115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.464643Z","title":"We use the same hyperparameter setting for the different experiments within a domain (Atari vs MuJoCo), apart from a multiplicative constant based on the range of the curiosity","venue":null,"work_id":"3803b776-0b62-48da-bed3-b98d65e10346","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.012779Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:a4a582965fadf3aac83641960ce36365c28cf2a04619ad2130510f805c04acd3","observation_id":"626a3192-7096-406e-b367-eccaccf50ef2","resolution":{"observed_at":"2026-08-06T23:01:05.470126Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.449228Z","title":"Improve vs Expert","venue":null,"work_id":"c1e44298-ec73-4ef3-979a-8549a70fa77c","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.018130Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:f7e13f5e3c2ed5854616bbdf21f3143f72ee2e2007159be1faa4f76eda35e7d8","observation_id":"b5b7e079-11c4-4f60-8379-ce67da842a0c","resolution":{"observed_at":"2026-08-06T23:01:05.453937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.431673Z","title":"Improve vs GIRIL","venue":null,"work_id":"09b3fa1a-00dd-43be-8498-f3c8e19ac31d","year":2024},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.023291Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:1df210930007ceee0ae972d91d12173e323399cb548960f7c6b5ae074ded439a","observation_id":"de71d438-3aa6-43c2-953c-46ad03772d60","resolution":{"observed_at":"2026-08-06T23:01:05.437406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.397972Z","title":"(2023), and (3) the analysis leads to a sublinear batch-regret, which is stronger than a sample complexity bound","venue":null,"work_id":"493660b7-3688-4b77-a257-17c2fbcbfe39","year":2023},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.033529Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:375c79d1e4daffd2a6c693ec8cff060af7607f20e100a0eeae738a5ca1740cf9","observation_id":"95168769-48c7-4292-8631-a800bebb5d95","resolution":{"observed_at":"2026-08-06T23:01:05.403114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.363268Z","title":"Then with probability at least1−2δ, KX k=1 J(π ∗,erk)−J(π,er k) ≤Hlog|A|/η+ηH 3K/2 + 2HK· p 8H 2 log(H· NF (ϵF )/δ) + 4ϵF N+γ·O s H N · H 2 +γ γ dimN (Fh) log(1/δ) !","venue":null,"work_id":"7e65ca7e-3a9c-4b34-b0a3-50a459675476","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.043470Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:9e37726d899a1eab9e3671875279390d32a0e382578ce3d4d8051f25d25fd4f2","observation_id":"b7b8e7e6-2f8c-446e-af65-50d250a2a372","resolution":{"observed_at":"2026-08-06T23:01:05.368525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.347074Z","title":"Lemma D.2(Self-normalized bound for scalar-valued martingales).Consider random variables (vn|n∈N) adapted to the filtration (Hn :n= 0,1, ...)","venue":null,"work_id":"c7f2d11c-2be5-44be-9aa5-fede055ee8ff","year":2019},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.049084Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:7bcc491a977eb55cb04c476dc040ca02138242f82afc32d170808a07ff4e86ad","observation_id":"c65daf9e-c0af-46ef-aa7d-b44bcf0bcbee","resolution":{"observed_at":"2026-08-06T23:01:05.352347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.414552Z","title":"Table 16 shows the MLP architectures, i.e., GIRIL’s encoder and decoder and V AIL’s discriminator","venue":null,"work_id":"bc0989ec-f688-4234-b480-6e5cbb5e60ed","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.028464Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:6552bb3309c4ddbac68bb510a80d3e22bd74ef9a8b304ff5cac14b2a7cf5340f","observation_id":"15ae85a1-92f2-4ddd-a953-0fecbb8f89a3","resolution":{"observed_at":"2026-08-06T23:01:05.419654Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.839935Z","title":"Toward the fundamental limits of imitation learning","venue":null,"work_id":"96070a0e-894a-4d13-a3f4-1d7ae011d0c0","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.877390Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:1fa27a504d4888d164dec81b83acf3e941d26b88530279414ed045df33e42883","observation_id":"3dca2e0c-e864-40b9-ab17-07e8e35015c4","resolution":{"observed_at":"2026-08-06T23:01:05.844783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.143740Z","title":"Relative entropy inverse reinforcement learning","venue":null,"work_id":"e411e3da-f948-44ea-b70e-bd90ca955783","year":2011},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.757294Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:b7e67c351cb1b0aae567260932a4a86362d000cabf38b3aa231e10f54544371a","observation_id":"ed4f5999-4c14-45f7-a129-809e339dc0d1","resolution":{"observed_at":"2026-08-06T23:01:06.149046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.759536Z","title":"Learning structured output representation using deep conditional generative models","venue":null,"work_id":"5cc4eeac-10a4-4b16-8315-e1b0f00dab7d","year":2015},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.915792Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:88cf7913d7fa69dce641bbc7a87758b24e6a1409c561ca2a7b7c11139e217587","observation_id":"5d5afa12-317f-4884-ad1f-fee39e977ae9","resolution":{"observed_at":"2026-08-06T23:01:05.765510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.580717Z","title":"and Bagnell, J","venue":null,"work_id":"6c039dd7-1ad6-42c2-b4fb-666342352953","year":2010},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.978061Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:3d376646a86b04a4d67c12bf1af44dbe7ed85b45b7d61ade87d2054a98433b0d","observation_id":"b5aefac0-2d17-4260-a7a9-046d7ec9f654","resolution":{"observed_at":"2026-08-06T23:01:05.586670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.970214Z","title":"Provably efficient reinforcement learning with linear function approximation","venue":null,"work_id":"9fc1de37-2474-4d77-9c97-ccca400fedf3","year":2020},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.836637Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:44cbb071cf2756f5b7678cc8ea329f94a748e1feba58ec5cc69e3c4d9347bf68","observation_id":"49dc83bb-418a-48f0-a380-a4f038286589","resolution":{"observed_at":"2026-08-06T23:01:05.975912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-09T23:24:21.399948Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-06T23:01:04.762311Z","title":"OpenAI Gym.arXiv preprint arXiv:1606.01540,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.762311Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:83098a74ca9af429a777a4e5574a41b1b88796de74efccfe91187dfe910a998c","observation_id":"d20c8eb2-84bc-45df-a5cb-92e43fa43df2","resolution":{"observed_at":"2026-08-06T23:01:04.762311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.726184Z","title":"Proximal point imitation learning","venue":null,"work_id":"f9ca5231-4ca3-470e-a81b-3de79015f5b1","year":2022},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.925993Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:26090606d3d38927e3cd04d79b25171e402bde04b18a07ac9651e4154b5bc8e5","observation_id":"ffb10c27-9f1e-4529-a1b7-1c24fc875d59","resolution":{"observed_at":"2026-08-06T23:01:05.731530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:01:04.893867Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.893867Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:ad1e8a098637dfb458af65f9fd353a345386bc6dfa9251753f0c54f342a6eb40","observation_id":"35da6538-f151-47cf-8194-bc640d1ed319","resolution":{"observed_at":"2026-08-06T23:01:04.893867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.888649Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":"04e588e2-4d59-4418-b014-64a196d14dff","year":2025},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.864194Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:ed45e9bdcb094a65b6fbcae864c17bd00793a1eb68f2876a0a3b25f382c97d60","observation_id":"9b272b49-a52a-4f0a-9472-499bc4ac3db2","resolution":{"observed_at":"2026-08-06T23:01:05.895423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.743012Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"85150a7b-c357-42ca-826e-8a08c2955c42","year":2012},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.921365Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:5c1e3f8251bfda196f58ab381c4ad53b6400e1f5a4e20a0dafb86c80b464a4b4","observation_id":"e4ddb88d-b381-4354-b3c4-c767fd83b6c0","resolution":{"observed_at":"2026-08-06T23:01:05.748282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.128513Z","title":"Extrapolating beyond sub- optimal demonstrations via inverse reinforcement learning from observations","venue":null,"work_id":"ed352f9c-a43b-4657-8c23-6853bef6981a","year":2019},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.768492Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:8d1522f30aa63256663f42e2032c6a13a244f36d65eba1c389081e0d365aae9c","observation_id":"22552bf1-f381-4fa2-b776-3e639ded67e3","resolution":{"observed_at":"2026-08-06T23:01:06.133533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.082977Z","title":"End-to- end driving via conditional imitation learning","venue":null,"work_id":"8d187e2b-21a3-4e1c-9ec7-36702b6aace0","year":2018},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.800160Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:ffd85632df5fbd12a2f8b06e80259f2e523f153b2713058eedf4bd5c883ad7f8","observation_id":"43d0ada8-eb40-4889-bc2d-e2d7d8a241d2","resolution":{"observed_at":"2026-08-06T23:01:06.088173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.03674","last_updated":"2019-01-11T17:54:47Z","snapshot_observed_at":"2026-07-06T07:26:13.408937Z","submitted_at":"2019-01-11T17:54:47Z","title":"On the Global Convergence of Imitation Learning: A Case for Linear Quadratic Regulator","version":1},"cited_work":{"arxiv_id":"1901.03674","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.03674","snapshot_observed_at":"2026-08-06T23:01:05.294850Z","title":"On the Global Convergence of Imitation Learning: A Case for Linear Quadratic Regulator","venue":"cs.LG","work_id":"16b199ac-d16c-42d5-a019-77bd39b970d0","year":2019},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.778839Z"},"links":{"cited_paper":"/paper/1901.03674","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:27eb07d66a20dbd9dd4a165668fd499ef25c10468ee83be6e5842665ad2531f9","observation_id":"8fc4b90e-23d8-42d3-8a74-998af7883bec","resolution":{"observed_at":"2026-08-06T23:01:05.300489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-02T13:41:53.507553Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-08-06T23:01:04.773534Z","title":"Large-scale study of curiosity-driven learning.arXiv preprint arXiv:1808.04355,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.773534Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:3b0aa6f858aa03e4a5c588fa36280f6ac3586f79a5fc013fe284220ab0b54bfb","observation_id":"d5d1a19d-f8db-45e8-8aa7-21be4d6cd5cb","resolution":{"observed_at":"2026-08-06T23:01:04.773534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08848","last_updated":"2024-06-05T00:17:20Z","snapshot_observed_at":"2026-08-10T22:23:02.282353Z","submitted_at":"2024-02-13T23:29:09Z","title":"Hybrid Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2402.08848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08848","snapshot_observed_at":"2026-08-06T23:01:05.220360Z","title":"Hybrid Inverse Reinforcement Learning","venue":"cs.LG","work_id":"72ebfe1f-cb6d-4169-a9f1-a3a1be7f1663","year":2024},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.882451Z"},"links":{"cited_paper":"/paper/2402.08848","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:edcda8632a4743a8eeb914287abae7a9571cfb4cdf25415796ffa16ffd669cce","observation_id":"e83f2d93-b30d-44a7-afce-4c234c4597cf","resolution":{"observed_at":"2026-08-06T23:01:05.226854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.113334Z","title":"On Computation and Generalization of Generative Adversarial Imitation Learning","venue":null,"work_id":"9b9d4fd8-cd49-4f63-a682-3a2fd771bbf1","year":2019},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.789475Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:4ba1fed668199710d6b106c89902b95fa8c3b410b09dbddaa4785caee77de657","observation_id":"82a4e234-d90e-4be9-9f52-028324fb64e7","resolution":{"observed_at":"2026-08-06T23:01:06.117953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.938998Z","title":"Imitation Learning from Imperfection: Theoretical Justifications and Algorithms","venue":null,"work_id":"3367452d-15f2-4a75-a315-1aa21a76dd4c","year":2023},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.845606Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:54b3857465f064d53606132ce2d3f0cd96aca6ff8414ef4f1b95974f70566555","observation_id":"f1698227-9077-41f4-b4ab-59ce9bea3dab","resolution":{"observed_at":"2026-08-06T23:01:05.943710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:06.019962Z","title":"IQ-Learn: Inverse soft-Q Learning for Imitation","venue":null,"work_id":"8e1a6eb4-20da-4b36-977f-d771e6762736","year":2021},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.818299Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:c1a5c2e23e9bcf00ee5c8f76271122e8fa529ccb6e2590252b4e52c5c48b6de9","observation_id":"47b4d814-94b0-4d36-972e-c16de17b9058","resolution":{"observed_at":"2026-08-06T23:01:06.025396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05805","last_updated":"2023-01-04T23:02:57Z","snapshot_observed_at":"2026-08-02T11:25:34.134615Z","submitted_at":"2022-10-11T22:10:23Z","title":"Exploration via Elliptical Episodic Bonuses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05805","snapshot_observed_at":"2026-08-06T23:01:04.822802Z","title":"Exploration via Elliptical Episodic Bonuses.arXiv preprint arXiv:2210.05805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.822802Z"},"links":{"cited_paper":"/paper/2210.05805","citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:7db331b60dcb593815f2e591ed0de1639d3796249c0da37174c534743d9ac987","observation_id":"8276749f-f8d1-469e-8c3e-e8d28e216c89","resolution":{"observed_at":"2026-08-06T23:01:04.822802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:01:05.483450Z","title":"For a fair comparison, we used an identical policy network for all methods","venue":null,"work_id":"6427c264-e646-48e0-92e0-68cdf932ebd1","year":2018},"citing_paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration","version":1},"reference_index":5184,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:05.007817Z"},"links":{"citing_paper":"/paper/2506.20307"},"observation_digest":"sha256:812e07b1381c4fcc77e1178142a432cf6b54523ff6a1d1b804dd60fa100558fd","observation_id":"009e47ab-f081-4445-8d6d-f6bf83f30407","resolution":{"observed_at":"2026-08-06T23:01:05.488424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20307","last_updated":"2025-06-25T10:39:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T22:23:16.460027Z","submitted_at":"2025-06-25T10:39:32Z","title":"Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":3,"verified_fuzzy":49},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2506.20307."}