{"as_of":"2026-08-06T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70533b52acf7350832986dcf12dd6a596d0b55f4e074590108798e4cc258443f","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:42:58.448782Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.03013/citation-record","integrity":"/paper/2510.03013/integrity","json":"/paper/2510.03013/citation-record.json","paper":"/paper/2510.03013"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.390965Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.390965Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:b2515291a22496beb66e0c0feb814f4513d960d99e6a0dd0a5e5149e1806f962","observation_id":"5b5898a2-9e6e-4207-8cff-c45924fdaa44","resolution":{"observed_at":"2026-08-04T12:42:55.390965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.494235Z","title":"Apprenticeship learning via inverse reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.494235Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:c1c0cc486e2e5ab5377d73dbccd2101c450e434026c8a5c1209c907bcffaba53","observation_id":"4b8df049-d540-41cd-a937-bab4baf90072","resolution":{"observed_at":"2026-08-04T12:42:55.494235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.585972Z","title":"A survey of inverse reinforcement learning: Challenges, methods and progress","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.585972Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:8b4d25844cd9d9535234d017c5a8089e18abddc3eb7d91266c4b2d1942d3e99f","observation_id":"951c8b6d-31ed-4378-b53e-f4530b549d7c","resolution":{"observed_at":"2026-08-04T12:42:55.585972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.641301Z","title":"Dynamic inverse reinforcement learning for characterizing animal behavior","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.641301Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:eab00cb8cbc4141c43cbfff17b2a7cf7c100b878ccc2032af17d6410ed373457","observation_id":"dc68dd71-a32f-46d9-9dfa-14bdeae8aa38","resolution":{"observed_at":"2026-08-04T12:42:55.641301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.700567Z","title":"The multivariate skew-normal distribution","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.700567Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:49e45ec7e57e571561b08495db53062be3abf3c1dab24b02659ffff8c3b0a8c4","observation_id":"987d6621-cb01-4a7e-8463-08ee09d332c3","resolution":{"observed_at":"2026-08-04T12:42:55.700567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10971","last_updated":"2024-07-15T17:59:52Z","snapshot_observed_at":"2026-07-06T18:46:39.497352Z","submitted_at":"2024-07-15T17:59:52Z","title":"Walking the Values in Bayesian Inverse Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10971","snapshot_observed_at":"2026-08-04T12:42:55.813564Z","title":"Walking the values in bayesian inverse reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.813564Z"},"links":{"cited_paper":"/paper/2407.10971","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6f5132991e9df84af435214ed84e7ad3887c5cbc8ff6bea79c2f5de3b2b1086a","observation_id":"e240067a-e277-4e0d-aea1-92a7cebae757","resolution":{"observed_at":"2026-08-04T12:42:55.813564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:55.940976Z","title":"A distributional perspective on reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:55.940976Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:b24ca3bfe40c79eecd8d0273f8a387adc378497f5f1981a13221c431f472f72c","observation_id":"6d5069a7-bdef-4b9c-95eb-8e9c8b03b40a","resolution":{"observed_at":"2026-08-04T12:42:55.940976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.088085Z","title":"Variational inference: A review for statisticians","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.088085Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:8e907f75bef722808081755766886e7a8d662858eecfc097bb752df99c63dd36","observation_id":"a9ca4cd1-a0c0-4c5a-b060-f28417ab564d","resolution":{"observed_at":"2026-08-04T12:42:56.088085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06483","last_updated":"2021-03-11T22:51:45Z","snapshot_observed_at":"2026-08-06T18:59:56.250921Z","submitted_at":"2021-02-12T12:32:02Z","title":"Scalable Bayesian Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.06483","snapshot_observed_at":"2026-08-04T12:42:56.164696Z","title":"Scalable bayesian inverse reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.164696Z"},"links":{"cited_paper":"/paper/2102.06483","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6d014068e437a8fd54f9875d87e87a0c93e960637c1c1bdc254073518725d48f","observation_id":"3280a2e8-d2b7-4a9e-b2b6-f5f3d768c23a","resolution":{"observed_at":"2026-08-04T12:42:56.164696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.276796Z","title":"Eliciting risk aversion with inverse reinforcement learning via interactive questioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.276796Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:1c8b6fe64a7a91dd1ba799e58960829c463a8620fd9c5506d1a8cf278c273199","observation_id":"87d522fa-a973-41ac-8739-c59118afa6d0","resolution":{"observed_at":"2026-08-04T12:42:56.276796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.402619Z","title":"Map inference for bayesian inverse reinforcement learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.402619Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:904e086d0c8ef14d3f3eb706070d0a05c8b71902e8c137267a563634261a0a13","observation_id":"1251fc23-f23c-41da-b5ee-f62ade9979f4","resolution":{"observed_at":"2026-08-04T12:42:56.402619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.493316Z","title":"Implicit quantile networks for distributional reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.493316Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:410d8016d6d87bc31523c88a4840d917066a0b33fc31ab405ad1f4c55ab922c8","observation_id":"8c67766b-f540-42ec-9332-be25c24175b9","resolution":{"observed_at":"2026-08-04T12:42:56.493316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.694782Z","title":"Distributional reinforcement learning with quantile regression","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.694782Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:c0c7c7234ccbb9155f922f0336383547b33a0578955fdd19f6612c36c6ecf83f","observation_id":"82372248-f577-43f2-94c3-bff25775f54a","resolution":{"observed_at":"2026-08-04T12:42:56.694782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:56.902589Z","title":"Cortical substrates for exploratory decisions in humans","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:56.902589Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6e03109882e0cb004b37e167a45308ece4f2e88a688a4cfe3a0521cb3f0ede9f","observation_id":"c0b8e8b4-6128-4a8e-b5c9-9fef05542847","resolution":{"observed_at":"2026-08-04T12:42:56.902589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.072176Z","title":"Nonuniform random variate generation","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.072176Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:3c9f7bbbcbe7703d8d366ab6e0a6a3d17176abc2078a310da680a30f8d16cd95","observation_id":"05695a72-5de5-4f56-8617-f3a7ef553418","resolution":{"observed_at":"2026-08-04T12:42:57.072176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.227314Z","title":"Remarks on quantiles and distortion risk measures","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.227314Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:5470fff0780b8e59180922c607c5b9911d43a3286510404bde41baf09b2a61cc","observation_id":"6ca678e3-d3bd-4010-815b-0c40b3e63a09","resolution":{"observed_at":"2026-08-04T12:42:57.227314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.331776Z","title":"Distributional soft actor-critic: Off-policy reinforcement learning for addressing value estimation errors","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.331776Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:b5bc2e5e06e8ac6be777856d4f81d21228d691d2853678a0f5967dc13448ca45","observation_id":"71049599-d292-4904-8b18-aca7577d1680","resolution":{"observed_at":"2026-08-04T12:42:57.331776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-04T12:42:57.503906Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.503906Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:2f3c6d3626a4c05144af1a824d8c61a8371a289cb3aa686b983ad760f7876be1","observation_id":"6ff1f605-4b91-41a4-928e-48d7f8e0ade7","resolution":{"observed_at":"2026-08-04T12:42:57.503906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.530407Z","title":"Iq-learn: Inverse soft-q learning for imitation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.530407Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:624323141cde60aa4f067890ec2f945f05cce9a5f03f97478b297b1dbce45b48","observation_id":"191ba8eb-0a53-45de-96b4-86c9b0c801af","resolution":{"observed_at":"2026-08-04T12:42:57.530407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.626102Z","title":"Probability: a graduate course, volume 200","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.626102Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:d99cfc2cc674df9a890a9b26d8c68a684972a0eca46255856be07be70cd0d06c","observation_id":"d84e4251-f711-41d5-a78a-566f5746e555","resolution":{"observed_at":"2026-08-04T12:42:57.626102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.746691Z","title":"Rules for ordering uncertain prospects","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.746691Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:28251ce41cc7cc649ac410faceac2699a3789dfc5a79c5f3077e672a67029344","observation_id":"a9f5bb93-514b-4621-9b9d-60801c06df64","resolution":{"observed_at":"2026-08-04T12:42:57.746691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-04T12:42:57.841983Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.841983Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:09b58b98bb213c6e28cd7fb63c7c0dfe4a2e48f3bbcb3fd2a54463e3fa905afe","observation_id":"c2569331-cc4c-4bc4-9fd4-e6d1bfa48911","resolution":{"observed_at":"2026-08-04T12:42:57.841983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:57.961326Z","title":"Introduction to real analysis, volume 280","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:57.961326Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:ad3a4466e51fde7c9b4f55f61fd1820c67a55c7e640aced53fa72f4335f7e336","observation_id":"bcadbcff-cf03-4c10-884a-67ebf6fe7aca","resolution":{"observed_at":"2026-08-04T12:42:57.961326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.070477Z","title":"Generative adversarial imitation learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.070477Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:a8771d3afd3b7c5095e20eddba18923af2dce7f58480b258e6301048fb1d987d","observation_id":"5adf489c-1b76-45a4-b6d5-39d8e54cfbca","resolution":{"observed_at":"2026-08-04T12:42:58.070477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.230803Z","title":"A bayesian approach to generative adversarial imitation learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.230803Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:5044376135586759b1448d2cdf48df6a1a2c0486919ff198a059bb193161a5a7","observation_id":"5a7e6729-f9ef-450e-8d2c-57da76d2abf3","resolution":{"observed_at":"2026-08-04T12:42:58.230803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.278539Z","title":"Rize: Regularized imitation learning via distributional reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.278539Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6f49bbc9164f777bac0417fea0bbe28a8531ebca9fc987a4e19622c01e072347","observation_id":"bb73d1d7-8978-4d1d-b438-4bb3022ba912","resolution":{"observed_at":"2026-08-04T12:42:58.278539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12633","last_updated":"2025-07-15T15:08:23Z","snapshot_observed_at":"2026-07-06T20:24:12.803909Z","submitted_at":"2025-01-22T04:38:33Z","title":"Inverse Reinforcement Learning with Switching Rewards and History Dependency for Characterizing Animal Behaviors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12633","snapshot_observed_at":"2026-08-04T12:42:58.307441Z","title":"Inverse reinforcement learning with switching rewards and history dependency for characterizing animal behaviors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.307441Z"},"links":{"cited_paper":"/paper/2501.12633","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6c34992221e62b1e103a3a45f43a04cbeedd94d47cbfeca660e4be673ada7055","observation_id":"c51944cb-860f-43b7-bdd3-aa00e00e696b","resolution":{"observed_at":"2026-08-04T12:42:58.307441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.05032","last_updated":"2019-12-10T22:31:09Z","snapshot_observed_at":"2026-08-06T07:29:16.838145Z","submitted_at":"2019-12-10T22:31:09Z","title":"Imitation Learning via Off-Policy Distribution Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.05032","snapshot_observed_at":"2026-08-04T12:42:58.311175Z","title":"Imitation learning via off-policy distribution matching","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.311175Z"},"links":{"cited_paper":"/paper/1912.05032","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6261b97e0816412227cafbad22b91072220c2e5f468485bc79812ed4ffcaff20","observation_id":"0eb30226-101e-49d8-b78c-4e8d28c65da1","resolution":{"observed_at":"2026-08-04T12:42:58.311175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-04T12:42:58.314862Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.314862Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:92e26a9ab096fd028d86250fae31ab18dd4427bc49034e1e9c89a95a717d8a3d","observation_id":"4a2b943b-36dd-43c2-8c59-3d1ea16fc9af","resolution":{"observed_at":"2026-08-04T12:42:58.314862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.318874Z","title":"Risk-sensitive generative adversarial imitation learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.318874Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:132f7faf9ae5aabc91f8c00397b98702ff5d19f08ef0c93c67a61e8e2a7b7246","observation_id":"96537912-f523-42aa-9d93-d40580eef4d7","resolution":{"observed_at":"2026-08-04T12:42:58.318874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.322564Z","title":"A tutorial on energy-based learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.322564Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:9eec16ee5608bf70df058a3b13499d2e18f1b06f757df64c8a2540be69d51c1d","observation_id":"522bfb5c-f96f-4eea-875c-cdeae8180990","resolution":{"observed_at":"2026-08-04T12:42:58.322564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.325721Z","title":"Risk-sensitive mpcs with deep distributional inverse rl for autonomous driving","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.325721Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6f91589bc24f51c76e03a3c859206baf7675452bbdc3800743a36b0d4f4d87b7","observation_id":"6274dfce-ac41-4ba8-970c-be7613c3b777","resolution":{"observed_at":"2026-08-04T12:42:58.325721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.330053Z","title":"Nonlinear inverse reinforcement learning with gaussian processes","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.330053Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6d58b678d350ad9b41a04a0051b2d6f72c60d1cfaa0d0165cc51b860c800f770","observation_id":"38eaa1e7-0b35-4894-b588-06dcbbc25883","resolution":{"observed_at":"2026-08-04T12:42:58.330053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.333477Z","title":"Internally rewarded reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.333477Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:2246115e6a811658bdc58941418d5aa71b0d54b0e48371ad908d5a267a7b1332","observation_id":"a6701269-4e89-4611-9d51-e494dc725a07","resolution":{"observed_at":"2026-08-04T12:42:58.333477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01796","last_updated":"2024-10-02T17:53:23Z","snapshot_observed_at":"2026-07-06T19:26:22.646942Z","submitted_at":"2024-10-02T17:53:23Z","title":"Bellman Diffusion: Generative Modeling as Learning a Linear Operator in the Distribution Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01796","snapshot_observed_at":"2026-08-04T12:42:58.337145Z","title":"Bellman diffusion: Generative modeling as learning a linear operator in the distribution space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.337145Z"},"links":{"cited_paper":"/paper/2410.01796","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:4f9a657e0b94c2b62605aa201ade110ad2cc5f3f9ddb451cb1a745aef2d62aa4","observation_id":"789e4226-b552-4357-ae0f-9ff5342a97de","resolution":{"observed_at":"2026-08-04T12:42:58.337145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.341059Z","title":"Distributional reinforcement learning for risk-sensitive policies","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.341059Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:bd845e7395222b44dbab853d5fb554ac2d31a6f447dfe7c794f2ebde500b4d46","observation_id":"83032962-50b1-42ca-af09-87ba7654cf0c","resolution":{"observed_at":"2026-08-04T12:42:58.341059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06827","last_updated":"2025-07-03T04:27:15Z","snapshot_observed_at":"2026-08-05T07:12:48.478594Z","submitted_at":"2023-03-13T03:00:03Z","title":"Kernel Density Bayesian Inverse Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06827","snapshot_observed_at":"2026-08-04T12:42:58.344896Z","title":"Kernel density bayesian inverse reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.344896Z"},"links":{"cited_paper":"/paper/2303.06827","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:6d89847e85d6c14b142e83c469e8d1b10b80842cc2ee225e98ef1185d9f40a43","observation_id":"b1e489fe-d107-4c75-b4da-8e70b1bf39c2","resolution":{"observed_at":"2026-08-04T12:42:58.344896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.348525Z","title":"Spontaneous behaviour is structured by reinforcement without explicit reward","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.348525Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:d0ca7dfdd30e6bbb39cf924666f02197b0683ad11f80847bdbe4e98df9bb6e6d","observation_id":"9cd77b32-3602-4bbc-8a2a-6df66c756a64","resolution":{"observed_at":"2026-08-04T12:42:58.348525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.351966Z","title":"Spontaneous behaviour is structured by reinforcement without explicit reward","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.351966Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:f95eb8d6f95690eb0714db78b855be290194cb2382feae4b8a17dcce25e3393f","observation_id":"fc515a0d-1ff0-4141-97ee-87b63a27c736","resolution":{"observed_at":"2026-08-04T12:42:58.351966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.355441Z","title":"The kolmogorov-smirnov test for goodness of fit","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.355441Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:24cc1a4bfd72923c7c9e57fc7b54556bfeb8e7bc9426436b077acf4c57e3131e","observation_id":"b780f1f3-fe50-484b-9146-888e506328f0","resolution":{"observed_at":"2026-08-04T12:42:58.355441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.358680Z","title":"Foraging for foundations in decision neuroscience: insights from ethology","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.358680Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:e9c47a04f3a87b4ccb7e2ddfea83115738cf4a40552543b0672253d7d8fc8089","observation_id":"89935910-fef2-4b54-9ee2-bb176b05306b","resolution":{"observed_at":"2026-08-04T12:42:58.358680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.361919Z","title":"f-irl: Inverse reinforcement learning via state marginal matching","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.361919Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:a814493cf4fc4c33df36e0393d8f83b847e516fefc10b95dbeaf35304c9d5764","observation_id":"fd7e5dd7-16e3-44a6-8a66-6f40131ed568","resolution":{"observed_at":"2026-08-04T12:42:58.361919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.365160Z","title":"Bayesian inverse reinforcement learning","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.365160Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:e56786999b49605e727923e19fc977909b33453582b831e393f65727006b28cd","observation_id":"49e421da-f209-41ef-a317-006242c67d6c","resolution":{"observed_at":"2026-08-04T12:42:58.365160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.368395Z","title":"Optimization of conditional value-at-risk","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.368395Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:e1b024fe30690d40ab2a7a324831ee122f78606fdf1f9b3e1b4f14b95035a61d","observation_id":"d10c9de8-520a-44ea-81d5-ef6ce727d9f7","resolution":{"observed_at":"2026-08-04T12:42:58.368395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.372070Z","title":"Driving with style: Inverse reinforcement learning in general-purpose planning for automated driving","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.372070Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:537e2ab3e2492d04ca29c8066a96b3e5e89b17a23547d4161e55309aeb04801d","observation_id":"962fc82b-049f-43bb-a3db-974dcc98e7af","resolution":{"observed_at":"2026-08-04T12:42:58.372070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.375329Z","title":"Learning risk-aware quadrupedal locomotion using distributional reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.375329Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:a48f273a9da9f4ac495f04455cd5189ad4b528407201d07f7fd5a3bc3fede033","observation_id":"bd848cbc-33f6-462e-bffb-0fe808aa7fd6","resolution":{"observed_at":"2026-08-04T12:42:58.375329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.378371Z","title":"A neural substrate of prediction and reward","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.378371Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:dcc086ad5a45ace5ad9157f5bca1d71cfe8bd07eb0fd283ac1687424a47cf1e0","observation_id":"d70fa356-7c2a-4479-9e7b-87088047875d","resolution":{"observed_at":"2026-08-04T12:42:58.378371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.381868Z","title":"Distortion risk measures in portfolio optimization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.381868Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:9b54382682aa2e2ac0eb82f1a5fd59c0f665bc8c9bfd979f36615379af9c946a","observation_id":"e934e22a-4172-48e9-ad35-ff0ea398474a","resolution":{"observed_at":"2026-08-04T12:42:58.381868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.385441Z","title":"Risk-sensitive inverse reinforcement learning via semi-and non-parametric methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.385441Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:0ebb9367f39663c36abbcb1cf60b2cb53369eab90905fd4ae6ab7e7505c85de9","observation_id":"f8643bf4-bbad-422a-8b03-dda969f203f9","resolution":{"observed_at":"2026-08-04T12:42:58.385441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.389074Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.389074Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:781532424f5edc478985f623dcbeb4c7bdd4c0228b57b953419da00069ee8f0f","observation_id":"694dc24c-9400-4ba9-baa9-422b04a29993","resolution":{"observed_at":"2026-08-04T12:42:58.389074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05371","last_updated":"2021-02-10T10:27:49Z","snapshot_observed_at":"2026-08-06T21:10:42.763482Z","submitted_at":"2021-02-10T10:27:49Z","title":"Risk-Averse Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05371","snapshot_observed_at":"2026-08-04T12:42:58.392711Z","title":"Risk-averse offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.392711Z"},"links":{"cited_paper":"/paper/2102.05371","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:a21a1eea7fa276cbda098217d31e9f1140619466a9657764b974ba0ee0307c71","observation_id":"ae7feb3d-cf74-45cc-9a8f-b91b17477862","resolution":{"observed_at":"2026-08-04T12:42:58.392711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.396647Z","title":"Inverse reinforcement learning algorithms and features for robot navigation in crowds: an experimental comparison","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.396647Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:0c241927e6e901bff74767d2a7d4fc0b93752c7ea8e4d14e3a6306df91173e09","observation_id":"f284b05b-1aed-4ac9-a934-981632a98f3f","resolution":{"observed_at":"2026-08-04T12:42:58.396647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.399778Z","title":"A bayesian approach to robust inverse reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.399778Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:94aa18efd6d4be282563f966f4474a2e8d1bd0cb5b748215222ef5943557e819","observation_id":"619a0652-a124-43d8-ac85-72d12e9b5eed","resolution":{"observed_at":"2026-08-04T12:42:58.399778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.402913Z","title":"Foundations of multivariate distributional reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.402913Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:b7eae5f2e96ab26928daf909a8be8e0f9419a04dd20a180f71e6e19d8a3fa22e","observation_id":"b54de15a-532a-4048-895d-f47826a0041c","resolution":{"observed_at":"2026-08-04T12:42:58.402913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.406388Z","title":"Inverse reinforcement learning with the average reward criterion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.406388Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:c79c00a9dfdd8a2d16f8f9506f38be328557b72e65429445804275b55868f28e","observation_id":"ac59373e-e0cd-40cf-a6f2-1b0b3e05b5d1","resolution":{"observed_at":"2026-08-04T12:42:58.406388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.410677Z","title":"Infer and adapt: Bipedal locomotion reward learning from demonstrations via inverse reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.410677Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:4857e070a04635abec20dc02b56279b907ece7b6554b488cf6ea7c20c8ea4dad","observation_id":"928c7e42-6f67-4705-b4b8-226eb39208a6","resolution":{"observed_at":"2026-08-04T12:42:58.410677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.414728Z","title":"Efficient sampling-based maximum entropy inverse reinforcement learning with application to autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.414728Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:ada17b6ce376cccb603f5c94e43da9b6e1acc48e41aa9a703e5bae32d957d1bf","observation_id":"21d38730-2082-4924-9641-d4821001d9b2","resolution":{"observed_at":"2026-08-04T12:42:58.414728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.04888","last_updated":"2016-03-11T11:02:00Z","snapshot_observed_at":"2026-07-06T04:24:07.477067Z","submitted_at":"2015-07-17T09:30:03Z","title":"Maximum Entropy Deep Inverse Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.04888","snapshot_observed_at":"2026-08-04T12:42:58.418262Z","title":"Maximum entropy deep inverse reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.418262Z"},"links":{"cited_paper":"/paper/1507.04888","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:4cf6b4150b6ce0fd86b885c21ef494dee4050e4791cfa7030bd51322a8c7443c","observation_id":"be72741b-a6bd-4959-b66a-c2d68dd9bf25","resolution":{"observed_at":"2026-08-04T12:42:58.418262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.421838Z","title":"Modeling, learning, perception, and control methods for deformable object manipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.421838Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:e83691a6c0d947d4ea9dabbb365f30734087154a70a1b233a85a4113cff6d6a2","observation_id":"4b45876f-d777-4d36-a0ab-a76728734313","resolution":{"observed_at":"2026-08-04T12:42:58.421838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.425216Z","title":"Maximum-likelihood inverse reinforcement learning with finite-time guarantees","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.425216Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:efc8bd4777eeb99b926b671729de543f92f6d981dd870954ec760b011e29e2b2","observation_id":"c6610b64-fb91-4bf9-b361-f978d26a6849","resolution":{"observed_at":"2026-08-04T12:42:58.425216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.428599Z","title":"When demonstrations meet generative world models: A maximum likelihood framework for offline inverse reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.428599Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:e95d01fd5a41976f84d8978bb7ff9f848339e01231cf56425027804f9f1c5f57","observation_id":"370e9883-f575-4580-9d4d-3c98b22aa114","resolution":{"observed_at":"2026-08-04T12:42:58.428599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13538","last_updated":"2025-03-15T20:53:46Z","snapshot_observed_at":"2026-08-01T16:49:58.565270Z","submitted_at":"2025-03-15T20:53:46Z","title":"From Demonstrations to Rewards: Alignment Without Explicit Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13538","snapshot_observed_at":"2026-08-04T12:42:58.431814Z","title":"From demonstrations to rewards: Alignment without explicit human preferences","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.431814Z"},"links":{"cited_paper":"/paper/2503.13538","citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:1cecaa24abb1473633081fd3b87bc8add23af17d2e493a67786496e17344155c","observation_id":"d71cef4b-e355-4f82-8641-1f296cff776e","resolution":{"observed_at":"2026-08-04T12:42:58.431814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.435351Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.435351Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:5c046427a2fe14d91fe6b37cdb2d73ec5f3c6ae4a6a56f6b4e69e2c3199c6f23","observation_id":"41948553-1110-4682-9151-3bb609fa59b0","resolution":{"observed_at":"2026-08-04T12:42:58.435351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.438443Z","title":"Modeling interaction via the principle of maximum causal entropy","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.438443Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:86d720e30742122d3ffffb325a4c101e46ea3dbf698241eecba0c00b963eb408","observation_id":"b22c4cda-33a9-4827-a484-d24b276a9057","resolution":{"observed_at":"2026-08-04T12:42:58.438443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.441299Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.441299Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:5413f1c02895f40dfd25c054ea9a61b3dee739d953308feaf34038e569bd6d4a","observation_id":"ee23053d-dee5-4620-84c1-22874c44a4ba","resolution":{"observed_at":"2026-08-04T12:42:58.441299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.445479Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.445479Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:c0efa07fd0ea8d173e238713bb48119867e28f76fcaae6d017e967154213f868","observation_id":"d7ffbf34-29ce-49cd-8d9f-9c684f698892","resolution":{"observed_at":"2026-08-04T12:42:58.445479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:42:58.448782Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T12:42:58.448782Z"},"links":{"citing_paper":"/paper/2510.03013"},"observation_digest":"sha256:7426581a7720b4cb07f39b6e1c7c10ce87f0a1e19948acbbb3cacdc4dafa602c","observation_id":"ac7d397b-a0ae-4487-a0cf-968152f5c08f","resolution":{"observed_at":"2026-08-04T12:42:58.448782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.03013","last_updated":"2026-05-27T19:46:08Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T12:42:52.852307Z","submitted_at":"2025-10-03T13:58:09Z","title":"Distributional Inverse Reinforcement Learning"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2510.03013."}