{"as_of":"2026-07-22T05:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5be277501c79e4ad064813739bf5001584ba22398c44a39bece65e26936353a5","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T00:50:35.026779Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.08131/citation-record","integrity":"/paper/2605.08131/integrity","json":"/paper/2605.08131/citation-record.json","paper":"/paper/2605.08131"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Apprenticeship learning via inverse reinforcement learning","venue":null,"work_id":"c9043569-8338-47cf-9782-65d617a406f2","year":2004},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:cd00fc51fd7f4d9a8a384438d1a33488ad08e46a40308b1b292f39e659500775","observation_id":"55da70d9-ecec-488f-b11a-82335f9744b0","resolution":{"observed_at":"2026-05-14T09:53:27.882413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic inverse reinforcement learning for characterizing animal behavior.Advances in neural information processing systems, 35: 29663–29676","venue":null,"work_id":"70959320-f6dd-44b3-84e7-15fb99581aa2","year":2022},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:2a91f35fa0145b2f9513c7c6d0ace194b672c7c8917d836475474d884152837c","observation_id":"88a5da64-daf6-40e7-b647-35d1527a2035","resolution":{"observed_at":"2026-05-14T09:53:27.884739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactive inverse re- inforcement learning for cooperative games","venue":null,"work_id":"088f5ee5-6524-43fe-8070-92e40a40634c","year":2022},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:cae13139fb8c7df8f29b0ef059d7700e452e7b2e204f32c0b9d6e78eb617afb3","observation_id":"6690cbd1-ac1f-42f8-95ee-d571313d5391","resolution":{"observed_at":"2026-05-14T09:53:27.888665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nonparametric bayesian inverse reinforcement learning for multiple reward functions.Advances in neural information processing systems, 25","venue":null,"work_id":"15b8b848-26b5-43bb-a8c5-90c52fa38ff6","year":2012},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:017f38e0ce9fa74e0e7d734ad1165d8adc8604be583e3cf52c6a394f95f3524d","observation_id":"d77eeebb-dfee-43b1-8c59-e542060b4070","resolution":{"observed_at":"2026-05-14T09:53:27.877036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An overview of bilevel optimization","venue":null,"work_id":"d86ad406-bf2f-4780-9e18-327743c0c66b","year":2007},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:ba15e06bbe13f033a9924fdeeeee5d6b1a14d23102401bd860b9887c2421db02","observation_id":"f39d7373-87fd-4a98-bf0e-91d342257a5b","resolution":{"observed_at":"2026-05-14T09:53:27.878773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards safe human-robot collaboration using deep reinforcement learning","venue":null,"work_id":"5f26de23-554b-4511-9e27-b794d64e8286","year":2020},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:b85961d6452a335e5fb9c9e1e5dbc09f24b3721c87b3da013857b0cd77f58019","observation_id":"8adf89e6-015f-437f-8030-6e277c1776ac","resolution":{"observed_at":"2026-05-14T09:53:27.880630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An irl approach for cyber-physical attack intention prediction and recovery","venue":null,"work_id":"4c954849-8c90-4d7d-a287-eb2e9a42cf0a","year":2018},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:5180c94e0b67fbc0fdec7006b93883269065bc1890273037f4289724b068f45c","observation_id":"e5e071a7-d7ff-4626-9de8-8e0137e946d0","resolution":{"observed_at":"2026-05-14T09:53:27.890435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distributed multi-robot collision avoidance via deep reinforcement learning for navigation in complex scenarios.The International Journal of Robotics Research, 39(7):856–892","venue":null,"work_id":"1c86b046-65dc-41eb-811b-c32f1a24718d","year":2020},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:e692f962a2e4d5590855d6e7758653cd6f9e73a9be3b2ee57da161125562aec5","observation_id":"ae085a7a-7019-4a0f-bc19-b7c67de09374","resolution":{"observed_at":"2026-05-14T09:53:27.961146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.02246","last_updated":"2018-02-06T22:10:14Z","snapshot_observed_at":"2026-07-06T06:22:08.261855Z","submitted_at":"2018-02-06T22:10:14Z","title":"Approximation Methods for Bilevel Programming","version":1},"cited_work":{"arxiv_id":"1802.02246","doi":"10.48550/arxiv.1802.02246","metadata_source":"pith","pith_arxiv_id":"1802.02246","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Approximation Methods for Bilevel Programming","venue":"math.OC","work_id":"6dc5827d-9f27-4b17-85f5-737868bf1692","year":2018},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"cited_paper":"/paper/1802.02246","citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:b1f649b62237d8c1e2ffa8eda8457c66a04983e6edd6e620c07b95a4b1e09411","observation_id":"1ea15c78-08d3-49cc-9ac2-3aacd614d503","resolution":{"observed_at":"2026-05-12T00:51:14.839412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"fc61a764-34cf-411c-8d26-34d180e7c0cb","year":2017},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:362740c11d179af540c5bcdc44a1f4976ff24d76841fe9583c0dd7aee6c062a0","observation_id":"c29770a1-d49e-4097-92a0-8e2a804ae394","resolution":{"observed_at":"2026-05-14T09:53:27.962966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cooperative inverse reinforcement learning.Advances in neural information processing systems, 29","venue":null,"work_id":"3653ae3b-ca12-40c3-a702-d28325b49e82","year":2016},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:c49eade93e863a43a33f7531cca57fc9978779ff68919f10f643397183066e64","observation_id":"9eee11cd-2f1f-450f-a594-5ba71d95ea12","resolution":{"observed_at":"2026-05-14T09:53:27.954857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can ai predict animal movements? filling gaps in animal trajectories using inverse reinforcement learning.Ecosphere, 9(10)","venue":null,"work_id":"e0ca0015-b96a-4ead-b95b-d64ad6ba28c4","year":2018},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:5550fffcab3dd4db401f94a2e96fbdbd1621b54830843c684355b7d8d19c8f0e","observation_id":"5c967791-3eb5-4c5c-9ce8-0be723933026","resolution":{"observed_at":"2026-05-14T09:53:27.952546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What is local optimality in nonconvex- nonconcave minimax optimization? InInternational conference on machine learning, pages 4880–4889","venue":null,"work_id":"17fdc497-08f4-4595-adde-91cba6db8b97","year":2020},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:a82ff92ee1ef266387d3c720fdcd1bdff57509b9c2a503612fc8141dfa9ee954","observation_id":"f771e4ad-86a0-4be1-a69b-dc70d13d11c4","resolution":{"observed_at":"2026-05-14T09:53:27.957087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11867","last_updated":"2019-06-05T21:51:13Z","snapshot_observed_at":"2026-07-06T07:56:08.690807Z","submitted_at":"2019-05-28T15:03:14Z","title":"Interactive Teaching Algorithms for Inverse Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1905.11867","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.11867","snapshot_observed_at":"2026-07-10T04:06:44.791180Z","title":"Interactive teaching algorithms for inverse reinforcement learning","venue":"cs.LG","work_id":"67d5d17e-f48d-4eef-bf9e-f98ff4a53916","year":2019},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"cited_paper":"/paper/1905.11867","citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:3cdc355b82c1496bf6c132a1babc1c55c8035796e6ed1562221df35fc02dd2c2","observation_id":"7a6c98c2-c3a3-44b1-ad27-7b7baa474e5b","resolution":{"observed_at":"2026-07-04T23:41:33.273517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Derivative evaluation and computational experience with large bilevel mathematical programs.Journal of optimization theory and applications, 65: 485–499","venue":null,"work_id":"555d3d9d-3131-42d6-b5db-2d5d89af8075","year":1990},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:53a4ca9d1a555ca9b42c8f44730eb41e19b1b301abc2a100730419670cf0ba24","observation_id":"1fae045b-f771-4cdc-8223-73ed800f21fd","resolution":{"observed_at":"2026-05-14T09:53:27.948447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta-learning with differentiable convex optimization","venue":null,"work_id":"e72e6df5-e43d-4c22-ab01-24db2c1d877e","year":2019},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:68e4fcd557a9620ec87a58c447288846fea1b7745ab20c7d31162006120ccccc","observation_id":"c725f9da-7d7c-476d-a374-e3e94b8f3a49","resolution":{"observed_at":"2026-05-14T09:53:27.946345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-agent inverse reinforcement learning for certain general-sum stochastic games.Journal of Artificial Intelligence Research, 66:473–502","venue":null,"work_id":"6f3d5067-2e29-44f9-a8f0-dbd455a313d4","year":2019},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:773c66b2e02738274cdcdcf56367d93e4ae665a3a17e12556dc06d67027c568a","observation_id":"164dcd3d-eb7e-4dd9-adbb-f345946f42e9","resolution":{"observed_at":"2026-05-14T09:53:27.950424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distributed inverse constrained reinforcement learning for multi-agent systems.Advances in Neural Information Processing Systems, 35:33444–33456","venue":null,"work_id":"eda467de-a1ee-40fe-9f41-37e7c9dc49ec","year":2022},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:9bfec74778c7bb27c4d55933e7949544c9e1c2850628aaef7cf1a7ae6c8f66ea","observation_id":"ab7cba61-b5f2-4ced-a645-aebdeac108f0","resolution":{"observed_at":"2026-05-14T09:53:27.959147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning multi-agent behaviors from distributed and streaming demonstrations","venue":null,"work_id":"a2c09f2d-c4d0-4972-8855-bda1b854d34a","year":2023},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:89ef3cf4220b8e85329b601d01dafa3e74a9176d2752fc78aa1441fd31a5daf1","observation_id":"1b9e4b3d-50ab-425c-959f-8cb08a1197d2","resolution":{"observed_at":"2026-05-14T09:53:27.965047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta inverse constrained reinforcement learning: Convergence guarantee and generalization analysis","venue":null,"work_id":"bb7b231d-0f39-4e37-85bc-9c8d81622dc9","year":2023},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:907069cfb0341b19e69ba0e5154a900a54b8ea067ea3dbb98b8074b58fae5e9d","observation_id":"406753f7-b999-433c-a906-5bff3055c553","resolution":{"observed_at":"2026-05-14T09:53:27.935346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"75859025-1bb5-45f4-884b-a5bc49b21c82","year":2024},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:f8b9947e3ee117d493de5e32d1e33f289e056d01d0f508d40741ae2ee6d90a46","observation_id":"47e2e104-ac6f-40ab-b820-09fef90cc10b","resolution":{"observed_at":"2026-05-14T09:53:27.937719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments.Advances in neural information processing systems, 30","venue":null,"work_id":"70b0ddaa-7fc4-4904-bcd3-7d8e9ca3ff58","year":2017},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:d42e27843d0dbdc38a39d36413109510f5becd64569d121d0e94936862d50195","observation_id":"26d67092-66fb-4e4c-8586-170887df4a52","resolution":{"observed_at":"2026-05-14T09:53:27.931176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Algorithms for inverse reinforcement learning","venue":null,"work_id":"2742d60c-b85a-44c4-8ba1-095b9d1cffa1","year":2000},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:27df85eff502f95882673dcb92cb104cdb1c293f4174598bcb21bd896d3a7712","observation_id":"0db4c7ea-a85b-4a3a-9ed5-5b90fc0196dd","resolution":{"observed_at":"2026-05-14T09:53:27.928965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning socially normative robot navigation behaviors with bayesian inverse reinforcement learning","venue":null,"work_id":"d816136c-0c23-4161-97c4-3bb2e0e55807","year":2016},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:603fde47b8d0497b818d9df58e89f4b895507a55dc4996e695678dabdb949653","observation_id":"17be043c-2ffe-4bac-94ed-b850377e232b","resolution":{"observed_at":"2026-05-14T09:53:27.886599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient cooperative inverse reinforcement learning","venue":null,"work_id":"419bed97-4db7-4cc3-bb1c-3b5cb0b1f875","year":2017},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:5784f3f81e42e946e42900099cea827aed16cbe6dc446c216b7f5598c353793f","observation_id":"7307315c-6d85-4a98-956b-475469e1de2b","resolution":{"observed_at":"2026-05-14T09:53:27.933306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyperparameter optimization with approximate gradient","venue":null,"work_id":"afb50a7e-55f6-4512-b85c-d14cf1250cd5","year":2016},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:bc4f5348150a6204dedaed5b7fd4b2e0248ea0ab8844567ae06ac21069041aff","observation_id":"8bd9ffbf-942d-4e39-abfb-70903106648d","resolution":{"observed_at":"2026-05-14T09:53:27.939810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bayesian inverse reinforcement learning","venue":null,"work_id":"4f4e6ca2-a92e-438f-8b61-1ea1b65a84a0","year":2007},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:bd33c2362c08505c107f07bf4e134966bb4185c8f330aa814c228884872afd53","observation_id":"aa166b67-4bad-49e8-bdac-11ae06f6c9ea","resolution":{"observed_at":"2026-05-14T09:53:27.922266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Monotonic value function factorisation for deep multi-agent reinforcement learning.Journal of Machine Learning Research, 21(178):1–51","venue":null,"work_id":"b0783b6f-7254-40fd-aaad-ca38ab145d41","year":2020},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:6a85bf99a82de2c8ca37f79f4bb235b1cfa393d59f3b56de19ebe232eb64703f","observation_id":"b1d455db-19be-465c-8f58-4b0369e8a508","resolution":{"observed_at":"2026-05-14T09:53:27.920210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16829","last_updated":"2025-03-03T18:01:44Z","snapshot_observed_at":"2026-07-06T17:50:13.914184Z","submitted_at":"2024-03-25T14:54:42Z","title":"Convergence of a model-free entropy-regularized inverse reinforcement learning algorithm","version":3},"cited_work":{"arxiv_id":"2403.16829","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16829","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convergence of a model-free entropy-regularized inverse reinforcement learning algorithm","venue":null,"work_id":"a0a54cb7-2626-490a-9718-04b297f6242b","year":2024},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"cited_paper":"/paper/2403.16829","citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:065f6464bb7c4e39fb4b65e21bfb6d214a7c4a81307d6cf63a78a5d46703f169","observation_id":"05d40c1b-2e7e-47a7-a08c-88790924f0f1","resolution":{"observed_at":"2026-05-12T00:51:14.848615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"First-person activity forecasting with online inverse reinforcement learning","venue":null,"work_id":"dcc788e2-9a29-4c3b-b3b1-2880802e7da6","year":2017},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:4a910b7b36e909f880d72210462f836885a91d8ab5d6758d119028903c0c078e","observation_id":"f69b524a-1507-42dc-ac20-4a60ba30ab33","resolution":{"observed_at":"2026-05-14T09:53:27.924426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04043","last_updated":"2019-12-09T07:26:52Z","snapshot_observed_at":"2026-07-06T07:32:24.974529Z","submitted_at":"2019-02-11T18:43:53Z","title":"The StarCraft Multi-Agent Challenge","version":5},"cited_work":{"arxiv_id":"1902.04043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1902.04043","snapshot_observed_at":"2026-07-04T19:30:07.613613Z","title":"S., Farquhar, G., Nardelli, N., Rudner, T","venue":null,"work_id":"2f26b259-cf76-40f3-b027-6946ef7763c8","year":1902},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"cited_paper":"/paper/1902.04043","citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:06d028ebaabde43999b7ea5045b0518bebd6ab2b9fc810b85de6e8a3807b34c0","observation_id":"3141423a-4945-4eac-bc25-b40284f0b65b","resolution":{"observed_at":"2026-05-12T00:51:14.843828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multivariate stochastic approximation using a simultaneous perturbation gradient approximation.IEEE transactions on automatic control, 37(3):332–341","venue":null,"work_id":"8ea578d4-51a3-49bd-a025-648cc148babb","year":1992},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:863fe6cc5e216b753a7e6fd3e7e74fa434c7fa3936e251622145ebddc37eb690","observation_id":"beb65f8f-efc7-4cf0-b463-549ebd767eec","resolution":{"observed_at":"2026-05-14T09:53:27.916228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive stochastic approximation by the simultaneous perturbation method","venue":null,"work_id":"8899d663-1196-4b6a-8582-576b490ca0cc","year":2000},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:023a71221e66ceb45027cbbc308200d41703ce37ea408291d7a11b109f84d37a","observation_id":"fbccae58-29b9-4f87-86f1-e0ef0b20c60b","resolution":{"observed_at":"2026-05-14T09:53:27.913922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SIAM","venue":null,"work_id":"d528166e-eec9-41bc-ac6a-8743c3fb7291","year":2004},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:76c502cc48c32d63d181507b2f742225efce64c124e07258e6ab5a5be70df861","observation_id":"718cefe5-62e2-40f1-829a-3f4eaa4834bd","resolution":{"observed_at":"2026-05-14T09:53:27.918091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pettingzoo: Gym for multi-agent reinforcement learning.Advances in Neural Information Processing Systems, 34:15032–15043","venue":null,"work_id":"9a97a0bb-220a-4798-94c6-10cf801390bf","year":2021},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:3052152931e0a831563850f0e1c9edbf1016c2002815096f581e372d94b3fd6a","observation_id":"3726de87-5efd-40f9-a186-81b4b3ba3cf0","resolution":{"observed_at":"2026-05-14T09:53:27.926707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-07-06T08:18:40.564633Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":"1909.01150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:1909.01150 , year=","venue":null,"work_id":"e760ec4d-0f59-4923-9dc0-24a7cd4905d8","year":1909},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:483d2381e896669e455a5479f73221e8f5ea8337de820ed2247e778d87736dc3","observation_id":"436449cc-b1fa-404f-a98c-6ce866dc2e4b","resolution":{"observed_at":"2026-05-12T00:51:14.853753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Competitive multi-agent inverse reinforcement learning with sub-optimal demonstrations","venue":null,"work_id":"ad107c73-8896-4f6e-b6b9-5dbae21cd5b4","year":2018},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:c0045c257bed54071acb1aa731d29c40aa968c0487f071e6bf24df8cdaa976dd","observation_id":"3f3d01e6-d672-4c8f-9285-74ce0f4b5af1","resolution":{"observed_at":"2026-05-14T09:53:27.942302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta value learning for fast policy-centric optimal motion planning","venue":null,"work_id":"5baec5c1-0121-4aa1-a61e-3f63a608926e","year":2022},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:4eff129906c6301911bafda55586972fbaab1f85370da43363107fe658bc1153","observation_id":"e9878d38-5fa1-4622-bbff-eadcf3a3889f","resolution":{"observed_at":"2026-05-14T09:53:27.967018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient gradient approximation method for constrained bilevel optimization.Proceedings of the AAAI Conference on Artificial Intelligence, 37(10):12509– 12517, Jun","venue":null,"work_id":"fb69bc17-52e0-4c3a-80e9-9417b9fbf067","year":2023},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:919a9b534f125ce3734dbd89973fa1ffd4b6e16462df2350ab14c9aaa3126e38","observation_id":"e67004df-19fe-490f-9747-45d1f1587f3a","resolution":{"observed_at":"2026-05-14T09:53:27.909357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:39.725960Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games.Advances in Neural Information Processing Systems, 35:24611–24624","venue":null,"work_id":"cc3118aa-275a-48ae-b5fe-6d10cba4ff2f","year":2022},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:f86c492024abe7624283d28547ea55c408374f0a4dfd7115a034f0fe5e011429","observation_id":"c56b892a-4bdd-4c8d-9302-bd7e1f4fc456","resolution":{"observed_at":"2026-05-14T09:53:27.902906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-agent adversarial inverse reinforcement learning","venue":null,"work_id":"db53064c-63f6-4b8a-94db-012cd1092db1","year":2019},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:9e259336db1205d59860d43881b74f124e3a598291781a44dcc08076bd2ebca1","observation_id":"03d796fc-c01b-4243-974d-34ed8763078f","resolution":{"observed_at":"2026-05-14T09:53:27.906971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maximum-likelihood inverse reinforcement learning with finite-time guarantees.Advances in Neural Information Processing Systems, 35:10122–10135","venue":null,"work_id":"8076f6ae-2bad-4fef-86c9-9e3b13baa723","year":2022},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:ee49beeb315dc110571c8c03cb1179b764a72667af57b279e01580e5b20e14ff","observation_id":"29651bb9-c09e-49c3-ba52-0b4de5002a3b","resolution":{"observed_at":"2026-05-14T09:53:27.905089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c8052be6-fdd7-4987-95ac-3501b8aa92ee","year":2023},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:5b9b1542079439927f252001ca9eb78148aa9b80c679b1012bc1487ba5be50bb","observation_id":"6e36eb48-8e6d-4c82-83d6-97c852d095d3","resolution":{"observed_at":"2026-05-14T09:53:27.911464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Physical safety and cyber security analysis of multi-agent systems: A survey of recent advances.IEEE/CAA Journal of Automatica Sinica, 8(2):319–333","venue":null,"work_id":"47e0c77c-7852-4b69-8e17-fb14c2dc280e","year":2021},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:1e9b95bac1fe1b11a811eb763d60981c8c1de5bad9670d9704f5e2ba39783378","observation_id":"b2ea1e6c-ff64-45fd-b709-e554161d53d9","resolution":{"observed_at":"2026-05-14T09:53:27.944305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Global convergence of policy gradient methods to (almost) locally optimal policies.SIAM Journal on Control and Optimization, 58 (6):3586–3612","venue":null,"work_id":"3f469a2f-a3d8-4be3-9e33-e3e7da790605","year":2020},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:c1b851cbec2f2b68664257bbcc2c48ff68d4d9d9d03efad2c42319e987eeb487","observation_id":"f68e0c44-6128-4718-bdca-9c065a4bed3c","resolution":{"observed_at":"2026-05-14T09:53:27.898651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Non-cooperative inverse reinforcement learning.Advances in neural information processing systems, 32","venue":null,"work_id":"210e44c7-52fd-4445-b3b6-410dcf1d6295","year":2019},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:85356837e3dec3961f35d0c9ebe2a780e8d9ad564527ef69eb17dc9645f95ad7","observation_id":"d30f0b21-1bf2-4786-b910-c0cc23314593","resolution":{"observed_at":"2026-05-14T09:53:27.900721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning based mobile robot navigation: A review","venue":null,"work_id":"5b5a717c-cb12-4c0f-9326-8188a6f88b5b","year":2021},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:d0cdd8e13fd25408556193bf00a1298b5e14657dd9a8c17edea88100e4eb0059","observation_id":"4fa09895-0881-4281-a81a-19f7ece93488","resolution":{"observed_at":"2026-05-14T09:53:27.894689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maximum entropy inverse reinforcement learning.Association for the Advancement of Artificial Intelligence, 8: 1433–1438","venue":null,"work_id":"0f227390-98f3-4104-8240-e699850eea89","year":2008},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:d2291b0bc901578c40027023b0316048b437bdade1d2a2c4838d6bbcc3242283","observation_id":"87a0303c-26d8-449e-b078-238b3767d486","resolution":{"observed_at":"2026-05-14T09:53:27.896699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modeling interaction via the principle of maximum causal entropy.International Conference on Machine Learning","venue":null,"work_id":"cb87f098-e772-4bb5-abce-2a3060812566","year":2010},"citing_paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:35.026779Z"},"links":{"citing_paper":"/paper/2605.08131"},"observation_digest":"sha256:dd93b26f63f8c98f928d96070f527808d50d59bd4acf912938ce5a9c6fe4f8dc","observation_id":"968e1597-c080-4ee4-8f5f-d5b89ba6d517","resolution":{"observed_at":"2026-05-14T09:53:27.892953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.08131","last_updated":"2026-05-01T05:01:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:20:24.341928Z","submitted_at":"2026-05-01T05:01:10Z","title":"Interactive Inverse Reinforcement Learning of Interaction Scenarios via Bi-level Optimization"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":4,"verified_fuzzy":44},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2605.08131."}