{"as_of":"2026-08-08T11:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc7a1251f6c6733e7784563a42fc6705d79350ad881c443e630424d0f948db2f","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:18:42.180146Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22008/citation-record","integrity":"/paper/2506.22008/integrity","json":"/paper/2506.22008/citation-record.json","paper":"/paper/2506.22008"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:18:43.795432Z","title":"It is an open-world city simulation originally proposed by Sestini et al","venue":null,"work_id":"bcd93324-d62e-43f2-b7d7-03b03108dbcd","year":2023},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:41.702652Z"},"links":{"citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:992773d9f58c06452aaef6b77ef720f163bd726ca8b56dbeb3d74b0c6564864f","observation_id":"3d7dec4f-6150-4ed1-994b-60799a054b25","resolution":{"observed_at":"2026-08-06T22:18:43.932432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06899","last_updated":"2020-12-12T20:06:15Z","snapshot_observed_at":"2026-07-06T10:23:49.697086Z","submitted_at":"2020-12-12T20:06:15Z","title":"Semi-supervised reward learning for offline reinforcement learning","version":1},"cited_work":{"arxiv_id":"2012.06899","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.06899","snapshot_observed_at":"2026-08-06T22:18:42.560058Z","title":"Semi-supervised reward learning for offline reinforcement learning","venue":"cs.LG","work_id":"7834141a-02b1-4d93-bf6a-f8c6cd742a14","year":2020},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:40.147376Z"},"links":{"cited_paper":"/paper/2012.06899","citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:91ba89fd1f0e04f9351256eb5009d0c9c3b3b7c16390082e9a779fec416c8250","observation_id":"8fd18dfc-2dfc-47e6-bd2e-4db9c7b22d91","resolution":{"observed_at":"2026-08-06T22:18:42.627088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10677","last_updated":"2023-03-03T14:18:34Z","snapshot_observed_at":"2026-07-06T14:44:34.387448Z","submitted_at":"2023-01-25T16:31:05Z","title":"Imitating Human Behaviour with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10677","snapshot_observed_at":"2026-08-06T22:18:40.482865Z","title":"Tim Pearce, Tabish Rashid, Anssi Kanervisto, Dave Bignell, Mingfei Sun, Raluca Georgescu, Ser- gio Valcarcel Macua, Shan Zheng Tan, Ida Momennejad, Katja Hofmann, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:40.482865Z"},"links":{"cited_paper":"/paper/2301.10677","citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:4546218cb6d8bd3ba363d4a225d3746d3fcfa59adb31831dde7bc799c9192b4f","observation_id":"712750b4-bcd7-4a39-903d-6e8105fc559e","resolution":{"observed_at":"2026-08-06T22:18:40.482865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-06T22:18:40.659299Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:40.659299Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:16f96dfbc9004d5f49fa5fd853f51f2b140fe20954a6c59e419a648d0fcda99b","observation_id":"db243e78-9b73-4234-934d-fe74ed65f3cc","resolution":{"observed_at":"2026-08-06T22:18:40.659299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16978","last_updated":"2025-03-21T09:45:59Z","snapshot_observed_at":"2026-08-07T16:47:05.372410Z","submitted_at":"2025-03-21T09:45:59Z","title":"Real-Time Diffusion Policies for Games: Enhancing Consistency Policies with Q-Ensembles","version":1},"cited_work":{"arxiv_id":"2503.16978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16978","snapshot_observed_at":"2026-08-06T22:18:42.327598Z","title":"Real-Time Diffusion Policies for Games: Enhancing Consistency Policies with Q-Ensembles","venue":"cs.AI","work_id":"74e847b2-bf75-4d5e-be3f-1a12bba1a08e","year":2025},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:41.072225Z"},"links":{"cited_paper":"/paper/2503.16978","citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:c89c7ee6eea62897a874f96898197830874261d39f4ad1003d9136917edcca26","observation_id":"1b91c065-8c05-4f75-97eb-340212b64dd2","resolution":{"observed_at":"2026-08-06T22:18:42.411597Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13885","last_updated":"2020-11-27T18:20:04Z","snapshot_observed_at":"2026-07-06T10:18:28.593525Z","submitted_at":"2020-11-27T18:20:04Z","title":"Offline Learning from Demonstrations and Unlabeled Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13885","snapshot_observed_at":"2026-08-06T22:18:41.211864Z","title":"Offline learning from demonstrations and unlabeled experience","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:41.211864Z"},"links":{"cited_paper":"/paper/2011.13885","citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:3be0faeb940a5a61cb0924b639881f5e2cc5eb51fcd64c4aceb5093c6a69eeb7","observation_id":"bfbfab27-e9ab-46be-8d03-b18b17121187","resolution":{"observed_at":"2026-08-06T22:18:41.211864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:18:44.656933Z","title":"Offline Reinforcement Learning","venue":null,"work_id":"33a45a27-e6b4-4e9f-a1b8-e8f2a7a297e2","year":2025},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:41.318621Z"},"links":{"citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:42c33011d46ae6106bb004fca227a3e22051af5f37fd181e1d8c1d42ccb87b0e","observation_id":"d0fc60be-e3a7-473b-a2d5-a12719025707","resolution":{"observed_at":"2026-08-06T22:18:44.829576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:18:44.362383Z","title":"As we describe in Section 3, it is especially suitable for offline settings","venue":null,"work_id":"19c49345-a1b3-46ce-80fc-0516599d5a99","year":2023},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:41.444412Z"},"links":{"citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:d838a702dfe08cfe4f7ed88e0c52eefab12fff76414fae0d9b699765567946bc","observation_id":"bf7933e9-9537-4676-b198-4e8b16331d02","resolution":{"observed_at":"2026-08-06T22:18:44.521428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:18:44.073139Z","title":"All of these approaches require optimal expert demonstrations – that is, demonstrations generated by an optimal policy","venue":null,"work_id":"b54a76ac-3bb7-4987-a82a-67e5f39f69d8","year":2020},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:41.581591Z"},"links":{"citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:5c5218cf7b2c851d2c0e5e8ea8d1db60ba422d120c0167a7716df11a769b3fd3","observation_id":"42e8ad3a-8bb7-4dbd-a2bf-00e9e752eedc","resolution":{"observed_at":"2026-08-06T22:18:44.250384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:18:43.517975Z","title":"An episode is marked a success if the agent reaches the goal before the timeout","venue":null,"work_id":"16c13384-ff26-4de5-b7ec-d92873cd1ed0","year":2022},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:41.855809Z"},"links":{"citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:04f287a4346b53a893d5538bad11692e00de2397bbdc2628413578c7cab05b89","observation_id":"23f83ca3-7541-496e-b363-2e8a34dc3744","resolution":{"observed_at":"2026-08-06T22:18:43.646139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:18:43.248834Z","title":"We provide more details about the baselines in Section 4.2 of the main paper","venue":null,"work_id":"95a6ce27-a55e-472b-ad64-247ff5d291f7","year":2020},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:42.053775Z"},"links":{"citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:9b54745c5f8722129fb5e0208223aa7850f0b5af4cb4713b7fabed92c106cfc6","observation_id":"59acd6bf-03da-4eaa-96a4-29a66e2f455c","resolution":{"observed_at":"2026-08-06T22:18:43.400993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:18:43.010029Z","title":null,"venue":null,"work_id":"db9ef4ba-5d95-4f43-add7-188c9d7e5870","year":2025},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:42.180146Z"},"links":{"citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:e5f2da93a1a2f067595dc466b33cc0eee1d95efed99fa961ad81d9068d1962fb","observation_id":"f204ddd1-e672-44b6-95c5-8bafe6d88323","resolution":{"observed_at":"2026-08-06T22:18:43.133188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01894","last_updated":"2025-04-14T10:25:47Z","snapshot_observed_at":"2026-07-06T19:44:43.248608Z","submitted_at":"2024-11-04T08:50:52Z","title":"Efficient Active Imitation Learning with Random Network Distillation","version":2},"cited_work":{"arxiv_id":"2411.01894","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.01894","snapshot_observed_at":"2026-08-06T22:18:42.759058Z","title":"Efficient Active Imitation Learning with Random Network Distillation","venue":"cs.LG","work_id":"eef921d3-0e1d-4b96-8f9b-87d4e68f394b","year":2024},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":1995,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:39.654517Z"},"links":{"cited_paper":"/paper/2411.01894","citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:ec4db841ab07746ac25a239344e7c3273849f55fba2502a2cb716dba17d4c51e","observation_id":"d4c60b3a-dd2e-4220-9dd3-04619ddab4d2","resolution":{"observed_at":"2026-08-06T22:18:42.862234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13493","last_updated":"2023-02-27T03:35:02Z","snapshot_observed_at":"2026-08-04T04:56:45.469229Z","submitted_at":"2023-02-27T03:35:02Z","title":"The Provable Benefits of Unsupervised Data Sharing for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13493","snapshot_observed_at":"2026-08-06T22:18:39.898864Z","title":"The provable benefits of unsuper- vised data sharing for offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:39.898864Z"},"links":{"cited_paper":"/paper/2302.13493","citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:362259570f4cd88a3b4a56b603112117c7321ce4ba239f44ea91b2a290fb78fa","observation_id":"0468167d-bdc4-4e3a-8b6a-eb989e5aefb8","resolution":{"observed_at":"2026-08-06T22:18:39.898864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:18:45.598651Z","title":"Technical challenges of deploying reinforcement learning agents for game testing in aaa games","venue":null,"work_id":"89ab2bee-e6fe-450e-87de-c13b4fcf5a05","year":2023},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:39.752822Z"},"links":{"citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:906e47aab5e4ffe9687388d90cdcd82079c2598f635a8303d96e0bdbf5269e36","observation_id":"31bad089-20d2-4f3c-b523-8c9ce563d6b3","resolution":{"observed_at":"2026-08-06T22:18:45.697343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:18:45.267481Z","title":"Demonstration-efficient inverse reinforcement learning in procedurally generated environments","venue":null,"work_id":"5ddde9d5-0426-4ce6-bbd4-ffced18daf80","year":2021},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:40.791397Z"},"links":{"citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:59bf7e5006677283f58c0efba7ba2df5bbbd6bbcd9a72327d7a89e532abfcb06","observation_id":"d0f97daf-17e3-4e84-9b5d-5f5a97969c03","resolution":{"observed_at":"2026-08-06T22:18:45.468020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-06T22:18:40.309764Z","title":"Offline reinforcement learning with fisher divergence critic regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:40.309764Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:09a1dd1567f6d7f193a72fb34285fe50fb06d9dd50e78ee00506b63b8c00c00f","observation_id":"213c6f6d-44c1-4820-bc60-a440fd8fe231","resolution":{"observed_at":"2026-08-06T22:18:40.309764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:18:44.976107Z","title":"Towards informed design and validation assistance in computer games using imitation learn- ing","venue":null,"work_id":"b6b949d0-831e-4462-993c-ac9b6f466e4b","year":2023},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:40.929974Z"},"links":{"citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:098b0d2462c99e63393ad7d9693848bfa2c62c3c37026ae62be6112c5251f315","observation_id":"2209042a-0467-4f47-87c4-06c0de714503","resolution":{"observed_at":"2026-08-06T22:18:45.099069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16217","last_updated":"2023-06-09T07:48:49Z","snapshot_observed_at":"2026-08-03T21:59:17.886008Z","submitted_at":"2023-05-25T16:24:11Z","title":"Beyond Reward: Offline Preference-guided Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16217","snapshot_observed_at":"2026-08-06T22:18:40.007912Z","title":"it’ s unwieldy and it takes a lot of time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:40.007912Z"},"links":{"cited_paper":"/paper/2305.16217","citing_paper":"/paper/2506.22008"},"observation_digest":"sha256:37102cafa04a233606b846e4ef7fae0ef5bb1ef18866d9ba82edb28d088f1d78","observation_id":"3ebf8c51-d315-40b4-bddf-d33506d93911","resolution":{"observed_at":"2026-08-06T22:18:40.007912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22008","last_updated":"2025-06-27T08:22:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T22:10:50.860649Z","submitted_at":"2025-06-27T08:22:41Z","title":"TROFI: Trajectory-Ranked Offline Inverse Reinforcement Learning"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":9},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2506.22008."}