{"as_of":"2026-08-09T09:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f55250789553d4bb3001ade17b28bd74e7691cfe7ad4f081b5da55938d677232","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T18:39:09.023785Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.14379/citation-record","integrity":"/paper/2508.14379/integrity","json":"/paper/2508.14379/citation-record.json","paper":"/paper/2508.14379"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:17.529120Z","title":"Resource constrained deep reinforcement learning","venue":null,"work_id":"6af04599-afb3-4304-8dee-afc3c2304c2a","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:03.673880Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:d5ea63c7ffabe847786629471748b36fc4aef81dc97ed01a80907427d7a6fb92","observation_id":"0317c36a-d7c9-43b2-b94d-94b8714e4e3e","resolution":{"observed_at":"2026-08-05T18:39:17.665496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:17.306640Z","title":"S., and Mikelsons, L","venue":null,"work_id":"0ca6d344-d674-493e-9b8a-a492f30ccc2f","year":2023},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:03.803846Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:b7e74bfc85877497b2e2744fff3b5b23d3695318ac476893bb884ea1ab4c82c4","observation_id":"021687b6-9174-44ae-b075-d172bd4415e9","resolution":{"observed_at":"2026-08-05T18:39:17.434744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:17.072654Z","title":"FlowPG: Action-constrained Policy Gradient with Normalizing Flows","venue":null,"work_id":"52559a67-9c03-4d4b-8f81-0c9f25c31e03","year":2023},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:03.927918Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:6194cdff35d2956e4d3f221dbed51a24e894cbc219ca7b20f548adc781c0b288","observation_id":"f7b91e95-adea-4d93-8851-438935799594","resolution":{"observed_at":"2026-08-05T18:39:17.186283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-05T18:39:04.090109Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.090109Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:49de0f9ef5faba4fe148b995ed9fe6e36bc1ffd40d10d4bd2c343566fa51044f","observation_id":"bae50a55-305f-4056-8327-fcd105402ec3","resolution":{"observed_at":"2026-08-05T18:39:04.090109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:16.800390Z","title":"Generative modelling of stochastic actions with arbitrary constraints in reinforcement learning","venue":null,"work_id":"2318efbf-c4e2-45ea-9270-ccddfa59aafa","year":2024},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.218997Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:86457f167c3478c124637b7fb67d1d4ef9370eaa84d50e8c9c8b5ddedad44229","observation_id":"81e6faea-4777-447c-82d7-a90c4344734b","resolution":{"observed_at":"2026-08-05T18:39:16.951951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:16.651017Z","title":"A Lyapunov-based approach to safe reinforcement learning","venue":null,"work_id":"599a4868-0c92-417f-9c5a-c909371d35d2","year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.349240Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:ca66d5b11a297926815afb3e822cf5925b28c173fb46462eb53aa45e83757679","observation_id":"486d06bb-80a6-4d10-abc4-2936d2427bdb","resolution":{"observed_at":"2026-08-05T18:39:16.711057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:16.397419Z","title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","venue":null,"work_id":"891d854f-fa77-415d-a1f0-eb066f984d6e","year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.517907Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:9f478ddd04d85c3e0e3968deb25a8809f39dabe072722e2cb8a4308aa4c85595","observation_id":"1dafe341-64a2-4ff1-8a3f-d9516223d438","resolution":{"observed_at":"2026-08-05T18:39:16.522444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-07-06T06:20:24.181731Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-05T18:39:04.666273Z","title":"Safe exploration in continuous action spaces","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.666273Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:dd0457b4d4ba27e0efdc6ac1e04ba358160b817a4caf4f8fd80d0c90d099d75e","observation_id":"d0821ab8-e913-49c9-b04c-25e773aa93f8","resolution":{"observed_at":"2026-08-05T18:39:04.666273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:16.112685Z","title":"J., Sarafian, E., and Kraus, S","venue":null,"work_id":"aa55237f-4158-4f97-9d59-55268c1308fd","year":2023},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.841831Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:6765ad49e0de6049729c589a82712a1981083808d2ebc390e3f309d002a5b25e","observation_id":"174c807c-5b92-4e60-aee7-7f5fb2a8ef19","resolution":{"observed_at":"2026-08-05T18:39:16.230758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T18:39:04.995300Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:04.995300Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:7efb1cb1d7be9060197945964662fccd264b9b1c11c23fe48e9fac0fbb025fa6","observation_id":"2d4a01d8-5431-4ff3-b9cc-a90db187aa92","resolution":{"observed_at":"2026-08-05T18:39:04.995300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11879","last_updated":"2020-02-27T02:27:46Z","snapshot_observed_at":"2026-07-06T09:00:29.329364Z","submitted_at":"2020-02-27T02:27:46Z","title":"State-only Imitation with Transition Dynamics Mismatch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11879","snapshot_observed_at":"2026-08-05T18:39:05.127078Z","title":"and Peng, J","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.127078Z"},"links":{"cited_paper":"/paper/2002.11879","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:325c0a209c7cc34d1a44515c92639790108cc15346a21f1906870092ad2056f4","observation_id":"4e85acfa-2693-4366-a83e-3f4f38f8d996","resolution":{"observed_at":"2026-08-05T18:39:05.127078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:15.823212Z","title":"Y., and Jin, H","venue":null,"work_id":"ed5fb9e9-cb62-4f29-9327-c236a2903d5b","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.266003Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:b2f94f9f7de72e6e31dfa94ab7e5ca288be4d1a190d7960dda46cf7b6f706768","observation_id":"5337134a-ebdf-49f1-9504-f98eb0889c21","resolution":{"observed_at":"2026-08-05T18:39:15.965270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:15.541171Z","title":"Deep reinforcement learning for robotic manipulation with asynchronous off-policy updates","venue":null,"work_id":"dc710730-7b8e-492a-833a-904fa3876edf","year":2017},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.386486Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:256539a9bd62c84f957041939103a8a6f6d017fe00b1ba1e8364d8b9abe31d2b","observation_id":"63707c4e-d09f-41b8-8985-cdaea451907d","resolution":{"observed_at":"2026-08-05T18:39:15.698183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:15.311676Z","title":"A., Su, H., and Wang, X","venue":null,"work_id":"62a272ae-dcbf-46bd-9e2d-b3cc13567cec","year":2022},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.479619Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:e6cde9cb50a690fc5947e925f473e5bc880104920ba4525226666c66bdc56fc5","observation_id":"f4f33605-7dd1-4314-a952-78e97370ba6a","resolution":{"observed_at":"2026-08-05T18:39:15.418317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:15.020867Z","title":"and Chiba, S","venue":null,"work_id":"bf75cd26-782e-44fa-b28d-4fee1fdd5abe","year":1978},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.591019Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:c2baea71bc0fb95e6ed408da311a1497806b40ca0f1c8c0df62d33a737a144d1","observation_id":"32b46bf8-052b-42b5-b357-a4ed7c331c1b","resolution":{"observed_at":"2026-08-05T18:39:15.166272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:05.700032Z","title":"and Ermon, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.700032Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:5014af29001561cf12a9404b19a3539f85008e9b4e5de52d430401013d144035","observation_id":"f3f841a4-b0a1-4d76-97ef-982c8d6671d6","resolution":{"observed_at":"2026-08-05T18:39:05.700032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:14.703037Z","title":"Diffusion imitation from observation","venue":null,"work_id":"d300d1bd-9904-4617-bc9d-2e025ac4ac66","year":2024},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.824177Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:0bbc648674e8f3abb342ec5acd276e2dc18e1f49037d1b101887656b573af242","observation_id":"17b3d8b4-9813-4f5c-8b50-471ce78db6f8","resolution":{"observed_at":"2026-08-05T18:39:14.832696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:14.487954Z","title":"Efficient action-constrained reinforcement learning via acceptance-rejection method and augmented mdps","venue":null,"work_id":"56da61a8-6c88-481e-adfa-8b3e60a20e1c","year":2025},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:05.915748Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:7b554f732afa8c7165a20831af513a2bd4e76da181f2a46fbded0b604b1e8efe","observation_id":"152860e1-b7a2-46f4-96a2-eda3a3b040c0","resolution":{"observed_at":"2026-08-05T18:39:14.587491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:14.260792Z","title":"and Porta, J","venue":null,"work_id":"80bbe74e-78e1-41c2-b0fe-ca79430697c4","year":2012},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.111806Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:d17552a308268a67f3fb85aa65a56323d16149e8169a01b26cea0ff533ce61e7","observation_id":"52e8a8ce-d846-4950-9c24-019ab6e57438","resolution":{"observed_at":"2026-08-05T18:39:14.377500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:14.043888Z","title":"Benchmarking actor-critic deep reinforcement learning algorithms for robotics control with action constraints","venue":null,"work_id":"b4875e59-b2f8-4d0c-86a0-73f1d3bac630","year":2023},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.209388Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:f8c9d980cf58690fa72d55cc6a90666b7b325c2e67ef1d39a36f7b0a42689733","observation_id":"07cf5c1d-9ee7-4abd-b2a9-07cfff8595a7","resolution":{"observed_at":"2026-08-05T18:39:14.141422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:13.784071Z","title":"K., Dwibedi, D., Levine, S., and Tompson, J","venue":null,"work_id":"07a6025a-5419-4565-8667-7deb15d10543","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.341673Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:d8746da0bee8cfbad46f40af61414b11a17ee25f1d031fb647b70864bf890d3b","observation_id":"7ea0d664-13ab-4066-affc-4b780baf4a92","resolution":{"observed_at":"2026-08-05T18:39:13.883022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:13.564941Z","title":"Imitation learning via off-policy distribution matching","venue":null,"work_id":"abd78d09-e185-4078-bba6-71e0549689d4","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.475122Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:f06a3f7f59cd9ea36d5b68f1f9286380ed70c3f3ae4edee253ad1f4b78bf33bb","observation_id":"dc136b3b-279e-4e96-b59a-0e2096ca5e9b","resolution":{"observed_at":"2026-08-05T18:39:13.662802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:13.353307Z","title":"F., Chen, M.-H., and Sun, S.-H","venue":null,"work_id":"8b5319c2-7d07-4cea-831c-19efe945bbbb","year":2024},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.659062Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:c467b0bd72dfb216921fc1e6d65cb1b3032d66ad31c0773f8ffbc3b5715b8f48","observation_id":"fb0393b1-99a4-4e5f-bfbd-f67748ddf88e","resolution":{"observed_at":"2026-08-05T18:39:13.457443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:13.160676Z","title":null,"venue":null,"work_id":"7ee26b5f-a15a-4d35-8c60-351762a23384","year":2021},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.796172Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:0eba84b9c373649105214529b08ac6d3303044d1cc9b6773fd9e00044a1c958e","observation_id":"5649621b-54f5-4aaf-8ee9-8bd41f7cce44","resolution":{"observed_at":"2026-08-05T18:39:13.257485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:12.865673Z","title":"Escaping from zero gradient: Revisiting action-constrained reinforcement learning via Frank-Wolfe policy optimization","venue":null,"work_id":"089bcbb7-f4d4-44b1-8d12-6b519ba3127f","year":2021},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:06.879650Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:2b504ad264e62f11f409092d5a2593cbafcc0592fd8d4d47c1191590a92d480c","observation_id":"2d0a72cc-0cf0-40ab-9b27-bc18696b3352","resolution":{"observed_at":"2026-08-05T18:39:13.006924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:12.588268Z","title":"Robust regression for safe exploration in control","venue":null,"work_id":"427678f9-f546-474b-a712-1c95c5b6cdbf","year":2020},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.018574Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:ea950b724dab8d7d72f04ecdad493d837a405ac525818590bdf89373c13dd6cd","observation_id":"608300ba-b6d8-464e-82f0-edca54dcc8e2","resolution":{"observed_at":"2026-08-05T18:39:12.724584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.10947","last_updated":"2019-11-21T22:18:16Z","snapshot_observed_at":"2026-08-05T18:20:08.979986Z","submitted_at":"2019-11-21T22:18:16Z","title":"State Alignment-based Imitation Learning","version":1},"cited_work":{"arxiv_id":"1911.10947","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.10947","snapshot_observed_at":"2026-08-05T18:39:09.187690Z","title":"State Alignment-based Imitation Learning","venue":"cs.LG","work_id":"bae957e4-8f52-4fbd-b3a9-0d5342269747","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.147640Z"},"links":{"cited_paper":"/paper/1911.10947","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:f50f57962f02cb3c8bbc9fbdccce2c9f6771f0bc677678cbdc0126be70179b0e","observation_id":"2bdd11d8-bcb1-4522-847a-0c1dbaff3641","resolution":{"observed_at":"2026-08-05T18:39:09.274870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:12.364629Z","title":"Optlayer - Practical constrained optimization for deep reinforcement learning in the real world","venue":null,"work_id":"774e0556-fec3-4459-98ee-d7eb7f8f5f47","year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.290347Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:07eefed05ed055f8227520d6cb4b5749b9d25b756e39bca4dfca0817b6c4f418","observation_id":"459cc8cf-405f-4a60-848e-b02a9f2f3942","resolution":{"observed_at":"2026-08-05T18:39:12.467249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:12.110777Z","title":"Efficient training of artificial neural networks for autonomous navigation","venue":null,"work_id":"b1fa759c-ef68-4a72-8721-3e1bd4ac6022","year":1991},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.428533Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:db347ff4b3478c6b387c658830f76334fb50ab879643984b04d5a391ff1aeea5","observation_id":"31ae075f-f2e3-4d08-a617-e303208b3ba4","resolution":{"observed_at":"2026-08-05T18:39:12.217407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:11.857248Z","title":"State-only imitation learning for dexterous manipulation","venue":null,"work_id":"d6a31ff5-4972-4b15-bb3b-c803fdf172f5","year":2021},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.572399Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:951a63cf7208a856fcfbce4a5b642778ede95b3ea144dae024b14ea3beb107d0","observation_id":"fc15dbf5-a817-4c6e-b5c2-81bfd8eba370","resolution":{"observed_at":"2026-08-05T18:39:12.003077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:11.591759Z","title":"Learning off-policy with online planning","venue":null,"work_id":"acd9a60d-e23b-44a7-8945-39eb01d89192","year":2021},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.684694Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:458ccafc0f090ac6be025231c22ef335443799b9da053209e04a34e06065b93e","observation_id":"caf0ac84-5caa-416d-88b9-55e36d161b99","resolution":{"observed_at":"2026-08-05T18:39:11.698822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:11.352554Z","title":"Behavioral cloning from observation","venue":null,"work_id":"5724113c-ca04-49ee-b755-9d4dabf82f7e","year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.823604Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:569e86f8a7b3334e454e461b66c2676028be301c938960a47bf7fc05722c63ae","observation_id":"aa4b30b5-c50f-42d5-9d09-bd66a105907c","resolution":{"observed_at":"2026-08-05T18:39:11.448680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06158","last_updated":"2019-06-18T04:56:56Z","snapshot_observed_at":"2026-07-06T06:50:35.226504Z","submitted_at":"2018-07-17T00:25:15Z","title":"Generative Adversarial Imitation from Observation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06158","snapshot_observed_at":"2026-08-05T18:39:07.938855Z","title":"Generative adversarial imitation from observation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:07.938855Z"},"links":{"cited_paper":"/paper/1807.06158","citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:1fa5f569127909f91603d492a6b374cb521f2ec826492311b34b1629b4f4a267","observation_id":"a47976e1-bbd8-404a-86cd-36052b4f2d0f","resolution":{"observed_at":"2026-08-05T18:39:07.938855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:11.089085Z","title":"Deepgait: Planning and control of quadrupedal gaits using deep reinforcement learning","venue":null,"work_id":"d13cb6dd-3920-4632-b0f3-064de742dc98","year":2020},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.091851Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:5edafd2ca5d7b15f337fb6e5b3f988f7039c4d6203f2f69832a06e7e096ec838","observation_id":"2fcdad65-57cd-4439-93e2-209067f3c8d2","resolution":{"observed_at":"2026-08-05T18:39:11.191544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:10.848928Z","title":"H., and Yang, D","venue":null,"work_id":"cd7b8866-67bc-4660-8ed9-d13cd79ecae4","year":2018},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.221990Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:c621eb423f9c276b9f1f60988065b04da53033f3f26c059e071d496d005aa223","observation_id":"ee8d79f5-4472-401f-8bcd-5a3368c52e00","resolution":{"observed_at":"2026-08-05T18:39:10.988317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:10.595623Z","title":"Imitation learning from observations by minimizing inverse dynamics disagreement","venue":null,"work_id":"9c6246dd-420f-4ec5-af5e-213053bf5d47","year":2019},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.366342Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:657d44ed39977b25f49ace0353cf511b0eec3a45337771fa49e2f0203872d25a","observation_id":"3c9b06ba-911e-4eaa-89d9-12713e47e0de","resolution":{"observed_at":"2026-08-05T18:39:10.728135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:10.306895Z","title":"M., Khosravi, A., and Nahavandi, S","venue":null,"work_id":"9a893843-cd7e-4210-a355-d9919b376e9f","year":2024},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.477323Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:fd0a19258328c0c46484e91b1d9c2a9bf6a25e43d742f29ad93a7a3f3f299926","observation_id":"d35f65fc-f012-4a2b-a356-d82ca43a119f","resolution":{"observed_at":"2026-08-05T18:39:10.455236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:10.046401Z","title":null,"venue":null,"work_id":"e4c65f85-7afb-4b11-8181-175461d2bce3","year":2020},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.595407Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:e21baeb5f2af6faf5532ba55b706a62b262cd6b761447b19091782e1bcb95124","observation_id":"f84aecf6-cde2-4ad9-b675-18f1430f5ce9","resolution":{"observed_at":"2026-08-05T18:39:10.133887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:09.771893Z","title":"robosuite: A modular simulation framework and benchmark for robot learning, 2025","venue":null,"work_id":"8e8bd257-bf2b-48a7-b93b-94270d4f49ff","year":2025},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.725734Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:358ae7722ff47b5e5d56a0e8288392a145cc7d225f311536d2014b2b519325cd","observation_id":"b85df8ac-0885-4e0e-84f2-98d23a6ce467","resolution":{"observed_at":"2026-08-05T18:39:09.886605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:09.526453Z","title":"Off-policy imitation learning from observations","venue":null,"work_id":"33d5e567-2c22-4a63-abe3-89c1bf8f9857","year":2020},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:08.866328Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:65ee6dd4f4b9cf9844b36e5768b4db3c14eb0440bb727372bf8cb9334a060e1c","observation_id":"da5ef1f5-d016-4e65-9554-42a9668a5f57","resolution":{"observed_at":"2026-08-05T18:39:09.614024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:39:09.023785Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T18:39:09.023785Z"},"links":{"citing_paper":"/paper/2508.14379"},"observation_digest":"sha256:78d287352807de1aa8e8f7f9861a603e1a578911ad7f845527c01aa02fe46d34","observation_id":"5d651e2c-22b0-4c47-bf81-50fef9e5ed2f","resolution":{"observed_at":"2026-08-05T18:39:09.023785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.14379","last_updated":"2025-08-20T03:19:07Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T22:50:08.072572Z","submitted_at":"2025-08-20T03:19:07Z","title":"Action-Constrained Imitation Learning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2508.14379."}