{"as_of":"2026-08-11T18:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de8c1227cd44b9f64f20a0ce764bfd5d9d623dcc7c3d9181cb105915680449b3","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T04:01:18.219745Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:33:10.067648Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T23:26:21.964199Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"cited_work":{"arxiv_id":"2502.07645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.07645","snapshot_observed_at":"2026-07-01T23:26:21.964199Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","venue":"cs.RO","work_id":"a324c991-1e57-49ef-905c-e10441f0491f","year":2025},"citing_paper":{"arxiv_id":"2504.04991","last_updated":"2026-06-30T15:59:52Z","snapshot_observed_at":"2026-08-07T16:08:00.095027Z","submitted_at":"2025-04-07T12:16:45Z","title":"Wavelet Policy: Imitation Learning in the Scale Domain with World Prior Memory","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T20:49:27.459047Z"},"links":{"cited_paper":"/paper/2502.07645","citing_paper":"/paper/2504.04991"},"observation_digest":"sha256:29d2515eab5ad410c38f01775582e3c92cabe57c7dcf627456df90c677a4d5dd","observation_id":"b9f6d8ea-b5a9-4042-893e-8e764753b7b3","resolution":{"observed_at":"2026-05-22T20:52:06.320648Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07645","snapshot_observed_at":"2026-08-06T05:33:10.067648Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01600","last_updated":"2025-08-03T05:37:25Z","snapshot_observed_at":"2026-08-09T12:36:02.347826Z","submitted_at":"2025-08-03T05:37:25Z","title":"CLASS: Contrastive Learning via Action Sequence Supervision for Robot Manipulation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T05:33:10.067648Z"},"links":{"cited_paper":"/paper/2502.07645","citing_paper":"/paper/2508.01600"},"observation_digest":"sha256:d9ad276a6c2b09482b017b29af9e5c771e2d80e484fc845fca048b19da55ad57","observation_id":"8ab9caa0-8478-4c6a-891e-f52a3913ffd6","resolution":{"observed_at":"2026-08-06T05:33:10.067648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"cited_work":{"arxiv_id":"2502.07645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.07645","snapshot_observed_at":"2026-07-01T23:26:21.964199Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","venue":"cs.RO","work_id":"a324c991-1e57-49ef-905c-e10441f0491f","year":2025},"citing_paper":{"arxiv_id":"2606.01865","last_updated":"2026-06-01T08:14:38Z","snapshot_observed_at":"2026-08-02T00:20:06.187145Z","submitted_at":"2026-06-01T08:14:38Z","title":"Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T14:25:37.987916Z"},"links":{"cited_paper":"/paper/2502.07645","citing_paper":"/paper/2606.01865"},"observation_digest":"sha256:bc35a174662df139b619296fd1e601aff6c9e8befa4b3b49ffdc590ae1c06f69","observation_id":"0a4d691f-7451-45c8-9af4-c098c2b28288","resolution":{"observed_at":"2026-07-01T23:26:21.966351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07645/citation-record","integrity":"/paper/2502.07645/integrity","json":"/paper/2502.07645/citation-record.json","paper":"/paper/2502.07645"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implicit behavioral cloning","venue":null,"work_id":"cba823e8-1c04-4701-8262-b2d3aaf0008c","year":2022},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:420bf56cd9db4efeb1f2dfe36d40dab702825501b06e82ef5827dcf543a128fe","observation_id":"964cd3fd-39e8-40e1-9d66-6a0c487874bc","resolution":{"observed_at":"2026-05-23T04:02:31.108867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An algorithmic perspective on imitation learning","venue":null,"work_id":"a3112752-18f5-4b55-8412-8f123b13d5bd","year":2018},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:e3e3cb86377f2194a7430c7c01dd906974defdda3e14fe7e353647c2f69c6764","observation_id":"b5e9a2a9-18f6-4870-ae7e-ae3248b98a45","resolution":{"observed_at":"2026-05-23T04:02:31.090664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re- cent advances in robot learning from demonstration","venue":null,"work_id":"cff32658-06b5-408b-8bf1-d4d83f2c8172","year":2020},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:3b480145978eec6d297e6f4c4d28b2d8200f350463f683f71e6bef867eee1ca6","observation_id":"7a2b61ae-21ad-462f-b6eb-5bb707a46b7b","resolution":{"observed_at":"2026-05-23T04:02:31.112086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of imitation learning: Algorithms, recent developments, and challenges","venue":null,"work_id":"a13458e6-9239-40f1-9762-cd4f2234c20f","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:62c1c447650c2846bdde8174f0deb6782e82988883d107948419d07dd9a52a91","observation_id":"6e52e327-5476-42bf-a208-0babcff3e854","resolution":{"observed_at":"2026-05-23T04:02:31.122768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of communicating robot learning during human-robot in- teraction","venue":null,"work_id":"9c52c384-efa0-4e32-bcc0-13ff986c094f","year":null},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:cc0701b6d9f74621a53c3ecb0dd3dd159e4470d4aa905fc2c62de97164e032f7","observation_id":"4d8cd410-1bf0-4a88-b347-4ce66a16bb1c","resolution":{"observed_at":"2026-05-23T04:02:31.141544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"3ff7aeca-ef82-4745-bb75-95629ab230bb","year":2023},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:06e19feee652c4caa5c02afadd7935475fdaa0e447ba3352cafe3bcb3b25287a","observation_id":"f0102c90-28b6-4948-9b31-15004c8c25a9","resolution":{"observed_at":"2026-05-23T04:02:31.098074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05824","last_updated":"2022-07-12T20:35:38Z","snapshot_observed_at":"2026-08-10T06:26:22.037748Z","submitted_at":"2022-07-12T20:35:38Z","title":"Conditional Energy-Based Models for Implicit Policies: The Gap between Theory and Practice","version":1},"cited_work":{"arxiv_id":"2207.05824","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.05824","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional energy- based models for implicit policies: The gap between theory and prac- tice","venue":null,"work_id":"8a32c318-1421-4a41-ba99-36e34987b875","year":2022},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"cited_paper":"/paper/2207.05824","citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:4f8d6062481b6e65f4853ca988efeb0c3a35614d9d281bdbf3252c83c4a22bdc","observation_id":"eb8c8d1e-5f02-44e9-b020-6b4a09b48835","resolution":{"observed_at":"2026-05-23T04:02:30.298733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goal conditioned imitation learning using score-based diffusion policies","venue":null,"work_id":"02855c62-feab-41b7-a4e0-63ae9ae6d98a","year":2023},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:567e468dde2eed3fe2b14fee563db8cbd896cdc4c24143c0b48db43c315eccbb","observation_id":"243dd2ad-2b1a-4ea1-b287-2df0d0d59de0","resolution":{"observed_at":"2026-05-23T04:02:31.071851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10855","last_updated":"2025-08-07T17:04:23Z","snapshot_observed_at":"2026-08-11T15:30:49.061524Z","submitted_at":"2024-12-14T15:03:33Z","title":"Fast and Robust Visuomotor Riemannian Flow Matching Policy","version":3},"cited_work":{"arxiv_id":"2412.10855","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10855","snapshot_observed_at":"2026-07-08T11:44:51.119076Z","title":"Fast and robust visuomotor riemannian flow matching policy","venue":"cs.RO","work_id":"87cf0160-5ee7-4704-8ee6-3c4967300808","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"cited_paper":"/paper/2412.10855","citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:4fd89429680fab69fc06231196fd3efbbecb681ac8ef8c49cdbcf38b6bfa6262","observation_id":"fc40ee59-04d6-4b29-95e2-0fbb9556b9dd","resolution":{"observed_at":"2026-05-23T04:02:30.293197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04380","last_updated":"2024-08-21T15:54:54Z","snapshot_observed_at":"2026-08-07T06:42:07.417838Z","submitted_at":"2024-08-08T11:34:31Z","title":"Deep Generative Models in Robotics: A Survey on Learning from Multimodal Demonstrations","version":3},"cited_work":{"arxiv_id":"2408.04380","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.04380","snapshot_observed_at":"2026-07-08T11:44:51.153267Z","title":"Deep generative models in robotics: A survey on learning from multimodal demonstrations","venue":"cs.RO","work_id":"7bc874c2-04c8-43f4-aeb2-0476914af017","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"cited_paper":"/paper/2408.04380","citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:b6c378585bbd9915578e7a14fb128468d218f9b760c2f2cabe2e6d6902e92810","observation_id":"42588c92-d57d-4c93-ad6d-1b9097a961df","resolution":{"observed_at":"2026-05-23T04:02:30.288216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactive imitation learning in robotics: A survey","venue":null,"work_id":"05ce27a4-42ea-44dd-a903-bcd8b4eff8fc","year":2022},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:da0bbf95945257fc5ab574e2c8794e0b44512077d1d2e7975d0ae65a5037fee1","observation_id":"e668243f-4b19-4a67-96b7-3299202612fe","resolution":{"observed_at":"2026-05-23T04:02:31.066606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning of motor skills using policy search and human corrective advice","venue":null,"work_id":"4fdeb87e-14e5-4489-8338-832ab53c88c4","year":2019},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:8b6668d315ba7e1d14423fa17776cdf4a9badf45bfd7f99cb876936f148a139c","observation_id":"6466329d-8bb4-4ef0-8309-3849e1621ecd","resolution":{"observed_at":"2026-05-23T04:02:31.083820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contin- uous control for high-dimensional state spaces: An interactive learning approach","venue":null,"work_id":"e552d0eb-24ba-4694-8e11-0e1c43ab7f60","year":2019},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:5a20237d0881e07efafa8f62677f6682cda211432c3387e42e3bca82b7d441dd","observation_id":"ebb5835e-3f67-46bc-9850-5a563261e347","resolution":{"observed_at":"2026-05-23T04:02:31.053331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An interactive framework for learning continuous actions policies based on corrective feedback","venue":null,"work_id":"157df893-0260-4bea-851c-926689744f49","year":2019},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:360e2e968e58e2c40d88b66d4e370430667dca74469f7716bcbc15e6507af333","observation_id":"be6b9431-5d04-47dc-9664-42a41742c599","resolution":{"observed_at":"2026-05-23T04:02:31.058003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implicit generation and modeling with energy based models","venue":null,"work_id":"4d3bbfb6-06f2-408e-9422-6ffc24d8ffed","year":2019},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:15ed4bd860971f141b811494f7f45eb56eccd8c00ac1daf0854dccee1896080c","observation_id":"ecabbe74-4cd0-461a-8196-136718e51157","resolution":{"observed_at":"2026-05-23T04:02:31.039406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards tight convex relaxations for contact- rich manipulation","venue":null,"work_id":"693f8e69-bae1-444c-bee9-f146aa5c80ff","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:4ad198c02134e9e99f6f306d6a1fd2d1fb380f8e61e214692327e57aa9f9899b","observation_id":"debec787-66d9-467d-8f01-8681f52cba43","resolution":{"observed_at":"2026-05-23T04:02:31.030105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03288","last_updated":"2021-02-17T19:20:09Z","snapshot_observed_at":"2026-08-07T02:28:23.454003Z","submitted_at":"2021-01-09T04:51:31Z","title":"How to Train Your Energy-Based Models","version":2},"cited_work":{"arxiv_id":"2101.03288","doi":"10.48550/arxiv.2101.03288","metadata_source":"pith","pith_arxiv_id":"2101.03288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How to train your energy-based models","venue":"cs.LG","work_id":"fb332e17-0f9c-4df7-bd18-9608e2b09000","year":2021},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"cited_paper":"/paper/2101.03288","citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:ed05a5572775d6796bc2470560c3eb8a77ed2b3e999ac2952d7c9313e8e85656","observation_id":"c1112610-36d7-4848-9694-c19430886e79","resolution":{"observed_at":"2026-05-23T04:02:30.282133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-18T14:51:27.825193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T14:51:27.825193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"c69a4785-9195-4755-8d5a-eb7e323460ea","year":2015},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:a2ea22a7d3ebb5a74b56d504814ca7eda3418c35e2a41655e3bc4637b2b04651","observation_id":"ddb54be8-88f9-4e3d-8291-1ec9026aea20","resolution":{"observed_at":"2026-05-23T04:02:31.033861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"817150ee-c9d1-4eaf-9dbe-c7de815c136e","year":2020},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:f7c600c200ee60c2177280b17faf0ed4783dce40ab943be8e7858748daa51969","observation_id":"092d489a-dede-47e1-ae9d-c139c4ed2cb0","resolution":{"observed_at":"2026-05-23T04:02:31.129412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score-based generative modeling through stochastic differ- ential equations","venue":null,"work_id":"5775375c-56e7-4e36-8764-96ae5f8d2470","year":2021},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:ae6078794123eeffd45726a1617402399f7b385ad6709a9c89b3642ff043d328","observation_id":"79639212-d07a-478f-a7a7-752d95b8c62f","resolution":{"observed_at":"2026-05-23T04:02:31.075677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Energy-based contact planning under uncertainty for robot air hockey","venue":null,"work_id":"c36dcdb5-e8bb-4aa2-b83f-e3ea63cf7687","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:1a9d8b3e5caec5e508c80ceb6f544113cde4d1cd5ae8a834bc183a5c1f9b7f64","observation_id":"05895d16-1754-4783-8f62-238ec16da166","resolution":{"observed_at":"2026-05-23T04:02:31.087160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Using im- plicit behavior cloning and dynamic movement primitive to facilitate reinforcement learning for robot motion planning","venue":null,"work_id":"ad0e7542-5673-47e4-b872-ef0fb17fd9ea","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:6aca7d300f3f7f51c8a009d8a305661a27ccb25712abeec55e2d9112ee3262de","observation_id":"c1e222f6-0be0-4d4a-b2fe-e7c0d0ccdaa5","resolution":{"observed_at":"2026-05-23T04:02:31.094345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Iifl: Implicit interactive fleet learning from heterogeneous human supervisors","venue":null,"work_id":"775a38f9-e3ae-4051-8a65-3b861b017a78","year":2023},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:0743f8784da67950eb1c72fde529a02ef9652c61b7b35aa5a9325ec5f0619a8f","observation_id":"99896726-cd49-4fc8-806e-7a39687baf45","resolution":{"observed_at":"2026-05-23T04:02:31.015597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14868","last_updated":"2025-03-24T03:10:14Z","snapshot_observed_at":"2026-08-10T17:41:16.805496Z","submitted_at":"2024-10-18T21:28:50Z","title":"Diff-DAgger: Uncertainty Estimation with Diffusion Policy for Robotic Manipulation","version":4},"cited_work":{"arxiv_id":"2410.14868","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.14868","snapshot_observed_at":"2026-07-04T10:59:46.753412Z","title":"Diff-dagger: Uncertainty estimation with diffusion policy for robotic manipulation","venue":null,"work_id":"9ceba046-95fb-4d7f-b149-aa6710289fe3","year":2025},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"cited_paper":"/paper/2410.14868","citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:aff46871cce038b1eaca599498aedd2fb717fea433f3c62b3899dc74d56e6a12","observation_id":"7e26d9bd-6fed-4c3b-aa50-f3694479ca96","resolution":{"observed_at":"2026-05-23T04:02:30.276465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"7f63094d-3af3-4bf7-91f7-2e6bf06efaac","year":2017},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:573ccab4087723c4add99b6cbb6c0713a3d1b2fbb0fb2c4bb3c9188abaa1e7fd","observation_id":"4f779a3f-4ebb-4480-b4fc-6a46e56b45b5","resolution":{"observed_at":"2026-05-23T04:02:30.985882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning preferences for manipulation tasks from online coactive feedback","venue":null,"work_id":"e0ffea71-227d-4713-8013-b5d6fbd73bcf","year":2015},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:54fc77907ef39d620c786b27f54be846de722526862ad075d7e4a762b6abe7a7","observation_id":"5ad75fd2-b316-49c3-aff0-73893d665a30","resolution":{"observed_at":"2026-05-23T04:02:31.001162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pebble: Feedback-efficient interac- tive reinforcement learning via relabeling experience and unsupervised pre-training","venue":null,"work_id":"d2dd879e-08aa-4a4b-88a2-d47f73f65a5c","year":2021},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:2be48ff37509513bdf5f40ad4d97b93bce45f6f0ebc5e161db8de2d4c2c2262f","observation_id":"b3209018-ef3b-478d-a0cb-f2e5751e542c","resolution":{"observed_at":"2026-05-23T04:02:30.959128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"7d933d4e-7433-4f33-b6e8-963ec72be4b6","year":2020},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:4ed99c0d7f80bc70b3de9695729d0c7177ac5b149285ab2e70bd65197dcd7f1d","observation_id":"a0ec34fc-fedf-4edd-8ba7-b99e7ecdb6da","resolution":{"observed_at":"2026-05-23T04:02:30.978504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trajectory improvement and reward learning from comparative language feedback","venue":null,"work_id":"566123ba-7b1e-421b-bea8-fd553d17e732","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:a7d7b23a676a783e48af302c92ca953b6fdcaae212d33db13d2adfa6b11749b7","observation_id":"65cfb03f-9577-43b4-a7d9-3b67403c2e53","resolution":{"observed_at":"2026-05-23T04:02:30.993744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contrastive preference learning: Learning from human feedback without reinforcement learning","venue":null,"work_id":"c02b0967-8a3a-4065-8d55-a287ca57954d","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:453f98ea648cf563800540b0658c678c15907b02b034092dff5ddf229645bd91","observation_id":"e222255c-11a0-47dc-bb8e-15530259d435","resolution":{"observed_at":"2026-05-23T04:02:31.012334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calibrating sequence likelihood improves conditional language generation","venue":null,"work_id":"22b92f97-ee59-4a87-8203-8c387762f905","year":2022},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:133ead1e0fe55b1f62d9793fb1bf9149973bd00d76d7bf027da5637b8c5157cd","observation_id":"9c9c8b3d-1676-40c6-a291-6ed798be7e88","resolution":{"observed_at":"2026-05-23T04:02:31.018976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"68350387-6c31-4911-af2a-c72af44dcc6e","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:c1192346ff979d7533b9d4e2ee9aa7d2dd9fc922e17252b94669cc49925139c6","observation_id":"73525543-999e-45bc-bc28-8bbc904b8cdf","resolution":{"observed_at":"2026-05-23T04:02:31.126075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Extrapolating beyond suboptimal demonstrations via inverse reinforcement learning from observations","venue":null,"work_id":"0631cb61-52f9-4326-8591-955373470d9f","year":2019},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:cb6c5429025f4d6822242ad6c9f43db6ab2633815a608f74df71a7b992856fcd","observation_id":"f2335496-a74b-43c1-81f4-d65f5c6190e9","resolution":{"observed_at":"2026-05-23T04:02:30.997487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Batch active learning of reward functions from human preferences","venue":null,"work_id":"b83d5b21-d822-48ce-a61a-3abf5879e66a","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:6f63e8f011ce52e59a5fcb85801a2fcdd5afc64942c0d1b6eee9976d28861f2b","observation_id":"a9c171dd-bafe-4655-91d9-343dd65282a9","resolution":{"observed_at":"2026-05-23T04:02:31.005152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hindsight PRIORs for reward learning from human preferences","venue":null,"work_id":"61bbd78c-c685-45ab-8d4e-90808b96d04d","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:44940a33ba1e41de66bfdf6b1020d66578773cb0af4de16bed61047fa98b2c15","observation_id":"a06d8981-b0ff-42b5-b9b7-568aa68d52f4","resolution":{"observed_at":"2026-05-23T04:02:31.022529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning robot objectives from physical human interaction","venue":null,"work_id":"02e4d00a-535f-46c0-9582-d2bfc127996a","year":2017},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:3a885400ec6e2ecf33aea1e115b86fce5ba0950134377b62fc4eeeaa93dfc6ba","observation_id":"da478840-5636-4894-bcc8-cd74dda27ed3","resolution":{"observed_at":"2026-05-23T04:02:31.008831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Including uncertainty when learning from human corrections","venue":null,"work_id":"b4bc82d5-8afe-4512-bdc9-672d6fc2362b","year":2018},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:c4d773a39113b4bfb07293513e079a8be98c7547c20ca18cdd6484f4834f48c7","observation_id":"64de3116-b100-45b6-96a0-503bedadf55a","resolution":{"observed_at":"2026-05-23T04:02:30.982276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning from human directional corrections","venue":null,"work_id":"abda7044-6a78-4700-b8a8-c45301230910","year":2022},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:29b78d60c36778c75dc8728887f57b5eb3657cd4a87bf3611cc6420fe7e2ac32","observation_id":"74b451cf-77e4-4641-a2d3-98b5d88d4b35","resolution":{"observed_at":"2026-05-23T04:02:30.975038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactive learning with corrective feedback for policies based on deep neural networks","venue":null,"work_id":"e59e7d5d-2494-4277-b0e0-9f0757132856","year":2018},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:6491289e3f1b686163a7539daec5201700142572a1b0d9212f2da359ce5658ca","observation_id":"e17b6781-8eb2-4ab9-bb3a-92467feb6b4e","resolution":{"observed_at":"2026-05-23T04:02:31.119290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards corrective deep imitation learning in data intensive environments: Helping robots to learn faster by leveraging human knowledge","venue":null,"work_id":"ac95a430-21b6-4429-8c61-7f819553f79f","year":2021},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:2ef0f40dcb6c263530c9f2c72147f083c4341cf88174a200b093800787e0cac6","observation_id":"98b8ad1d-1520-4a8c-b0f7-8caa720d7426","resolution":{"observed_at":"2026-05-23T04:02:31.137589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactive imitation learning in 18 state-space","venue":null,"work_id":"f6f22037-c0c4-4825-8121-4579d9cf5714","year":2021},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:b4cd0b04de27ea23af8a396574412b4228e9829fc0164e69b6bc090c8329eca3","observation_id":"0d2477d9-1e3f-4768-a24a-2503d7cee6d5","resolution":{"observed_at":"2026-05-23T04:02:31.080071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning from active human involvement through proxy value propagation","venue":null,"work_id":"ad9cc4b6-2574-4b52-affc-627fb998b0be","year":2023},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:62e1b5716f407884c31782005dcd14eb7d2555e74e227dd4f301a5b60032b764","observation_id":"9f81d2b3-d00b-4db0-90e2-507acbb91217","resolution":{"observed_at":"2026-05-23T04:02:30.990001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"a73bdd84-8d1a-4abe-813b-1e082246b113","year":2017},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:13bac57a74fe5c6c31775dcf9440eaa72d3da23ad611d33f7ef238450794db69","observation_id":"aa954b4c-ffd8-40f6-a8d5-34e68021ccc2","resolution":{"observed_at":"2026-05-23T04:02:30.967232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"b8a6a85d-4853-402d-9703-a0717f4d555f","year":2018},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:0d0f9907238aa64f14804d91498e28c6fa32bc4d27de2dcd75bb45508332d648","observation_id":"25705914-2d45-4510-aa97-8b2063ef7060","resolution":{"observed_at":"2026-05-23T04:02:30.963113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aligning human intent from imperfect demonstrations with confidence-based inverse soft-q learning","venue":null,"work_id":"74b95016-7a1d-4799-82c4-5b8587e7fd22","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:c417a271f5f0f779478074101e73f11afa6b6918d7131f26236f094684815c7b","observation_id":"55c9025f-9c63-4bca-a578-251354d22685","resolution":{"observed_at":"2026-05-23T04:02:31.062479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bayesian reparameteri- zation of reward-conditioned reinforcement learning with energy-based models","venue":null,"work_id":"f99eb158-3fc3-4bcb-a629-f227c0e7c5cd","year":2023},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:6d3809fa88331e4c01ba6e23010ca02a3e8ca6613374c1575e434dc3d504d2a4","observation_id":"3d2a8f9a-4dff-4cf4-812c-6bf2d94286fc","resolution":{"observed_at":"2026-05-23T04:02:31.133042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inverse preference learning: Preference-based rl without a reward function","venue":null,"work_id":"4762eed9-58b2-417f-9ab7-f2d86cee5984","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:1e81354e693859eed6caa564589b09197cf93e2a531e3f47e40a2dc9f5fdeaf3","observation_id":"e5dbdc9a-fb2c-4090-9407-851c218d5b01","resolution":{"observed_at":"2026-05-23T04:02:31.115367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning from interventions: Human-robot interaction as both explicit and implicit feedback","venue":null,"work_id":"08758489-7e5b-4d96-8a39-878b2c6c9e8c","year":2020},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:655d34c2e15ca0d79bd4c24cf5650a69d0fe4db4fd632577695325305fb593a3","observation_id":"4a03b651-0daa-4acb-80aa-be86c190394a","resolution":{"observed_at":"2026-05-23T04:02:31.105462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow contrastive estimation of energy-based models","venue":null,"work_id":"6419d9e7-d1cd-4315-99a3-32d96f46df5a","year":2020},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:3562dad2b042dba292c62546f14b80af04427dcfd1540cbc25febac19a377a71","observation_id":"1f037782-f950-4156-a6d3-9ed14b01aa8d","resolution":{"observed_at":"2026-05-23T04:02:30.971063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hard negative mixing for contrastive learning","venue":null,"work_id":"37959edd-5a17-4dd0-b73f-bd450bd76526","year":2020},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:3d3c104327ce831fd227e98474e0ee034a2bd5bc6b458f0fb15d860a25f9bb66","observation_id":"770ffb4f-80b6-4a50-8f1c-a06bcd9a1c38","resolution":{"observed_at":"2026-05-23T04:02:31.026134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:6cbf3d92d7e5f34eb5d569a511ce52276efcc76e14d934dfa9d260db39af0810","observation_id":"a738eff6-1346-4475-adc3-bae0ff835626","resolution":{"observed_at":"2026-05-23T04:02:30.270965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting energy based models as policies: Ranking noise contrastive estimation and interpolating energy models","venue":null,"work_id":"1d45ac5d-f3ef-4185-8c6f-c0d5d07e0db5","year":2024},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:aafc36444ef197df497564786327447b10dfe5efc5c7dff2e2349831e3c86ffe","observation_id":"c0a7a3bf-31e8-46b7-aa1d-4129418c2e1a","resolution":{"observed_at":"2026-05-23T04:02:30.940238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A reduction of imitation learn- ing and structured prediction to no-regret online learning","venue":null,"work_id":"becc4584-7132-488c-94bc-3ad81df6bfa4","year":2011},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:49f6fc2f5851da24fcbd9a0a97ffa06de6f60fb11a01ef36c3ca819db8c157d6","observation_id":"9190a2c3-5710-4598-92e9-5f3212d7a73d","resolution":{"observed_at":"2026-05-23T04:02:30.955193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hg- dagger: Interactive imitation learning with human experts","venue":null,"work_id":"72d6029c-0683-4649-b284-eb3a670a8103","year":2019},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:087b6c2ebafefd145c0179daa8a11eda78060ff95abe1b2238bd904b15dca43d","observation_id":"7f986c3d-15de-40c1-b223-7a2a946e923f","resolution":{"observed_at":"2026-05-23T04:02:30.950848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ambient diffusion: Learning clean distributions from corrupted data","venue":null,"work_id":"e3a59d18-f19b-4f8a-80e0-af8442149651","year":2023},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:9ae2bba066ffee64c454f40d222ed55678d5b4ac1beccea9afecb19cf3910b02","observation_id":"5c93ad7d-28c3-4f4e-b295-26d68cdb257a","resolution":{"observed_at":"2026-05-23T04:02:30.944165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.12293","last_updated":"2025-01-18T02:57:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-25T15:32:31Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","version":3},"cited_work":{"arxiv_id":"2009.12293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.12293","snapshot_observed_at":"2026-07-10T23:07:48.196994Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","venue":"cs.RO","work_id":"d616d4ba-7713-4e3e-8c9e-dfebbb8f1abf","year":2020},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"cited_paper":"/paper/2009.12293","citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:41f9233d1cf0623437c8f6cc79eaf866694244800bab5bf494d28dd68cbf9109","observation_id":"94a20fcf-5862-414a-9899-71cf91debbf9","resolution":{"observed_at":"2026-05-23T04:02:30.265739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactive learning of temporal features for control: Shap- ing policies and state representations from human feedback","venue":null,"work_id":"52b1a25d-deee-449c-8737-2de86de9eb52","year":2020},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:afe30e42404b1af920aa11c207844b3ca822078000a97f56e03dcb8acf5b5f81","observation_id":"3f9023d4-a2b2-4504-89e5-5742e15f9c2a","resolution":{"observed_at":"2026-05-23T04:02:31.101640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bayesian learning via stochastic gradient langevin dynamics","venue":null,"work_id":"9245ad8d-ab69-4ae3-a05f-433dc823f6de","year":2011},"citing_paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-23T04:01:18.219745Z"},"links":{"citing_paper":"/paper/2502.07645"},"observation_digest":"sha256:b13ffa12a5bd40ef57f11598b6b25736c0f1f61ddf24e910fc69bb39ce41a309","observation_id":"3b05a8d8-7cfc-482d-9554-525e7165c0c5","resolution":{"observed_at":"2026-05-23T04:02:31.144762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.07645","last_updated":"2026-04-30T15:37:11Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:34:24Z","title":"From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":7,"verified_fuzzy":51},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 3 inbound Pith citation observations for arXiv:2502.07645."}