{"as_of":"2026-08-09T08:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78706a3e8b718eab4fe45ed4aded1f846877e1a6790d595c31b3283b66d180e0","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:20:25.838910Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08707/citation-record","integrity":"/paper/2507.08707/integrity","json":"/paper/2507.08707/citation-record.json","paper":"/paper/2507.08707"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.710016Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.710016Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:cc8017548621de9b13b96971a197961a4f58091eec23255736b3204100079fde","observation_id":"3c3e263e-9bb5-4523-80cf-5f2812f2552e","resolution":{"observed_at":"2026-08-06T18:20:25.710016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.714530Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.714530Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:ff72cae2a488bcb3a7c9437ff919033018ada440a1fe7320cbd4f437d0eac65f","observation_id":"d76da8ca-b402-47e8-a52d-4225da23a541","resolution":{"observed_at":"2026-08-06T18:20:25.714530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-06T18:20:25.717886Z","title":"Prioritized experi- ence replay,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.717886Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:6123f2800939691f35c4f7f46398ce75832d1d49eebc2fff5b7446940ebcac40","observation_id":"d9659668-a760-456c-b3fd-a2c4c05e2c84","resolution":{"observed_at":"2026-08-06T18:20:25.717886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.721431Z","title":"Deep reinforcement learning with double q-learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.721431Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:53e659d7d79c77d1046a32552eba088ba0b326e23459c5fa9c8d6c55f12003ea","observation_id":"232e92b0-299c-48a1-b84e-f9bd9d3527ec","resolution":{"observed_at":"2026-08-06T18:20:25.721431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.724923Z","title":"Dueling network architectures for deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.724923Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:f5535114489371f4888b7523ab8d22f205adc9d950fe2f0db051b877773dd5f2","observation_id":"a8029730-e6e3-4ef3-9f85-0dc3f74ce68a","resolution":{"observed_at":"2026-08-06T18:20:25.724923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.168023Z","title":"Rainbow: Combining improvements in deep reinforcement learning,","venue":null,"work_id":"978c846a-6203-47e9-96a4-43460352ef5c","year":2018},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.728465Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:9a5e9df3664223d2108c90969b1038e5be764ebd58e945755495599d9c0e13f8","observation_id":"d4627158-c1ed-486a-a136-c297b7d3b994","resolution":{"observed_at":"2026-08-06T18:20:26.171698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.157591Z","title":"Agent57: Outperforming the atari human benchmark,","venue":null,"work_id":"d5825d5b-ce49-4202-bec3-51b996442545","year":2020},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.731984Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:f86ae613f5c62e2d10a989a00c321c494e1853d78d37a4ce9fb31477797e69cd","observation_id":"f7fffa32-e1b7-4a6c-b266-2e628bf3c1fc","resolution":{"observed_at":"2026-08-06T18:20:26.161510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07550","last_updated":"2022-09-15T18:08:48Z","snapshot_observed_at":"2026-08-06T16:09:06.206722Z","submitted_at":"2022-09-15T18:08:48Z","title":"Human-level Atari 200x faster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07550","snapshot_observed_at":"2026-08-06T18:20:25.735117Z","title":"Human-level atari 200x faster,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.735117Z"},"links":{"cited_paper":"/paper/2209.07550","citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:8658c97ce060b3c05cb09b8ccd3975ac8984289bc24f26c5b5655ff7ca994e76","observation_id":"cd0789fd-9b5a-461b-aaad-6271c7a2b24b","resolution":{"observed_at":"2026-08-06T18:20:25.735117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.738520Z","title":"Hind- sight experience replay,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.738520Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:ce9a77cdcf3eea4f831756362ffdc55b2a1f940e069cdabaa588ba57b377a2f4","observation_id":"d660e7e5-ed9c-48b2-9f6a-de95d503967d","resolution":{"observed_at":"2026-08-06T18:20:25.738520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.741654Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.741654Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:fd3f97504f255be2eacc5a808c09c61ff83936ed97dad0db69ae08042a79d3fb","observation_id":"ca24fd49-4464-4192-9cba-c1e09a061b69","resolution":{"observed_at":"2026-08-06T18:20:25.741654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T18:20:25.744740Z","title":"Concrete problems in ai safety,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.744740Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:8ef303970536c969162065b302dbcde7b254b3ea1e600bdfa54f1d0edc3d68a6","observation_id":"f12da40c-1198-45e0-b5d2-6b873d5fc62c","resolution":{"observed_at":"2026-08-06T18:20:25.744740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.136323Z","title":"Algorithms for inverse reinforcement learning","venue":null,"work_id":"1b4bbf49-626e-4c1e-b0f9-a8eeb5912b0e","year":2000},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.748757Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:99d5cf1e251874161c73f223add3893915bbe82f07cab75b2e45109b4bb0b3de","observation_id":"fb9405a3-f9f2-4628-b6b6-fc5fd8a4bb8f","resolution":{"observed_at":"2026-08-06T18:20:26.139975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.751966Z","title":"A survey of inverse reinforcement learning: Challenges, methods and progress,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.751966Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:ddc8028fcf4c946dca51aa88ac7dd0581899ecdf5d89d21746e817d90834759e","observation_id":"99d5a334-74b2-43f4-9d6f-0c0398f2c446","resolution":{"observed_at":"2026-08-06T18:20:25.751966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.120243Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":"356177b8-3518-4dad-bc97-b184038b5332","year":2008},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.754940Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:fa2f26474c384cfd81e60700ef4fd6468d4efb2cf72ef3715097b2e81df5be13","observation_id":"bf9d4eba-acb4-40ea-91d0-954e62a9e65d","resolution":{"observed_at":"2026-08-06T18:20:26.124150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.110975Z","title":"Relative entropy inverse reinforcement learning,","venue":null,"work_id":"cc55d6b1-abb8-4b18-bbc5-aeacbfcc31ef","year":2011},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.757931Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:0a4442fa0316a59c38e435dd710235384be7ea1be8ac9ca9a3d3fb486245660b","observation_id":"1ec7ecbd-e008-40f9-bb35-1315b5ff8b45","resolution":{"observed_at":"2026-08-06T18:20:26.114120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.099132Z","title":"Guided cost learning: Deep inverse optimal control via policy optimization,","venue":null,"work_id":"17b928e0-453b-4980-9c0b-92f4a2f9911e","year":2016},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.760986Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:939a6ef8350fd78a0d7ea079d9d4a40d4030921776bb3267d37a758f9074475a","observation_id":"f91dc819-13e8-4b2b-b8e7-8bda180ffd72","resolution":{"observed_at":"2026-08-06T18:20:26.104633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.088888Z","title":"Preference-learning based inverse reinforcement learning for dialog control,","venue":null,"work_id":"0b9286d9-1245-4568-a960-baa358a25f09","year":2012},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.764010Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:57282b1be1c6e039d6b0a7a029fee055218aa17de34d1879162a222ba8ec6894","observation_id":"7c849bc3-582a-45e8-87a3-a85ab7d30ad1","resolution":{"observed_at":"2026-08-06T18:20:26.092792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.078578Z","title":"Model-free preference- based reinforcement learning,","venue":null,"work_id":"2bdf5ea9-904e-41f9-8b16-184d67930905","year":2016},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.766940Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:cb43e5f21ef389897ebe169533421da5b0cda11ebbcb56b5a86b4e47569e20f9","observation_id":"d7964256-0650-499d-bdeb-f811b26c75f1","resolution":{"observed_at":"2026-08-06T18:20:26.081885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.770793Z","title":"Reward learning from human preferences and demonstrations in atari,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.770793Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:cb47afdaa2515e2e3ab984b26e7050e00316d98a060e5112fde07bafa964029d","observation_id":"cd855081-3c73-4431-8099-6ef536c9c79d","resolution":{"observed_at":"2026-08-06T18:20:25.770793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.063538Z","title":"Extrapolating beyond suboptimal demonstrations via inverse reinforcement learning from observations,","venue":null,"work_id":"c67c3cac-eab8-4506-8e9a-1e7ea4dcc19f","year":2019},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.774286Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:21ad6d285f99eb1696eb9bcb84d2fb863ccd35032dd9b9f5db14a5ef0720fc33","observation_id":"bee54f88-2d1a-4a0e-8b97-7260168fc507","resolution":{"observed_at":"2026-08-06T18:20:26.066841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08928","last_updated":"2019-06-21T03:00:36Z","snapshot_observed_at":"2026-08-02T22:07:19.765753Z","submitted_at":"2019-06-21T03:00:36Z","title":"Learning Reward Functions by Integrating Human Demonstrations and Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08928","snapshot_observed_at":"2026-08-06T18:20:25.778489Z","title":"Learning reward functions by integrating human demonstrations and preferences,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.778489Z"},"links":{"cited_paper":"/paper/1906.08928","citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:15bf815a3ffa8dc20f46ba9ca51c07b97d7b69317c6421abad166454736ee08c","observation_id":"8ee9bfe2-6d15-484f-bfd3-47cde9b0ec2c","resolution":{"observed_at":"2026-08-06T18:20:25.778489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.052456Z","title":"Better-than-demonstrator imitation learning via automatically-ranked demonstrations,","venue":null,"work_id":"52d2fafc-a5a1-4ea1-bcfe-dccdbb9dea69","year":2020},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.782420Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:1d6db119c67c4fccb632ab11cfb1e027a906e39672f7f41a4cd9cdbab8be1dc5","observation_id":"f4e3a1e0-6a47-45dd-93b3-b46eed409d7d","resolution":{"observed_at":"2026-08-06T18:20:26.056843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.041403Z","title":"Learning from suboptimal demonstration via self-supervised reward regression,","venue":null,"work_id":"f4365e28-97de-413d-ab9a-489c1ae4c171","year":2021},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.786139Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:56f71233d059db88ba3c19cdfe8b381ecb254cd44c51ea4e1d773b32e58868ea","observation_id":"326b094d-4a6c-4a6c-8014-ead0214a095c","resolution":{"observed_at":"2026-08-06T18:20:26.046640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.789375Z","title":"Between mdps and semi-mdps: A framework for temporal abstraction in reinforcement learning,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.789375Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:5e1e0fa851abddca692d3ebb42b39eb73b44c3e11fea6e6cb7b06597776db48e","observation_id":"d43b979c-628b-4b0f-9e37-ea1c51da1bf6","resolution":{"observed_at":"2026-08-06T18:20:25.789375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.026175Z","title":"Pyquaticus capture the flag gymnasium,","venue":null,"work_id":"f9b31641-9a47-49ea-87da-21e87e276c2b","year":2024},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.792772Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:5b16af972b593ac2782813e81397b4984ec33c25d580fae3b55daadce06c2ccf","observation_id":"ed52cbac-4d3b-4e44-81ce-a7deef39d4f6","resolution":{"observed_at":"2026-08-06T18:20:26.029779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.015611Z","title":"Nested autonomy for unmanned marine vehicles with moos-ivp,","venue":null,"work_id":"9fda2427-59d1-45b7-b022-acd4c19c6792","year":2010},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.796031Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:08b442803c064618a386cd68cd7c60f4e76f09e0569d159073d154efabcc6615","observation_id":"e0446422-77f7-45bf-a6be-caaccd8f4c4e","resolution":{"observed_at":"2026-08-06T18:20:26.019423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:26.005173Z","title":"Efficient training of artificial neural networks for autonomous navigation,","venue":null,"work_id":"494c6983-7901-45a0-9456-152a9b494e2e","year":1991},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.799195Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:227857789628f3579520b7740ff8197d9eb8cfa742e65100aa400d6c98c742cb","observation_id":"7429e3e1-cd43-4450-bc6e-024f70d379bc","resolution":{"observed_at":"2026-08-06T18:20:26.008756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.993638Z","title":"Behavioral cloning from observation,","venue":null,"work_id":"841f0406-f6fa-4150-bfdb-4cb78d8f28e9","year":2018},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.802431Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:d010e447a98752a8f99d6e95acd01e480cee59984fe1ea649a078c9a68511244","observation_id":"a11709ba-bd7c-4f6a-b7a1-b50978201d51","resolution":{"observed_at":"2026-08-06T18:20:25.997906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.809841Z","title":"Generative adversarial nets,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.809841Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:041317bb750763c398f7d6208db47ec0d5859b55d7c65d861f31866155b79b91","observation_id":"a55694fd-142c-4519-80b2-6d469ca7ed00","resolution":{"observed_at":"2026-08-06T18:20:25.809841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.976814Z","title":"Generative adversarial imitation learning,","venue":null,"work_id":"232ee07f-da1a-48d7-887c-fb0a9a562b44","year":2016},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.813120Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:f9217cdc155780985b312380101c1cccaf1a7b17f5f7868ad277892cabbff1a7","observation_id":"cd703e8b-e143-4e15-97ea-ab212b85b628","resolution":{"observed_at":"2026-08-06T18:20:25.980808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.11248","last_updated":"2018-08-13T18:33:24Z","snapshot_observed_at":"2026-07-06T06:06:54.331476Z","submitted_at":"2017-10-30T21:22:28Z","title":"Learning Robust Rewards with Adversarial Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.11248","snapshot_observed_at":"2026-08-06T18:20:25.816962Z","title":"Learning robust rewards with adversarial inverse reinforcement learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.816962Z"},"links":{"cited_paper":"/paper/1710.11248","citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:8080cffa959b652f0c98947179dda68cda6a517cafb866b6d0c12eb09a1fe6f7","observation_id":"ea2561d4-701f-4003-ac5a-b8d56cddd217","resolution":{"observed_at":"2026-08-06T18:20:25.816962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.10593","last_updated":"2018-10-24T20:00:50Z","snapshot_observed_at":"2026-07-06T07:10:25.716310Z","submitted_at":"2018-10-24T20:00:50Z","title":"Inverse reinforcement learning for video games","version":1},"cited_work":{"arxiv_id":"1810.10593","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.10593","snapshot_observed_at":"2026-08-06T18:20:25.874020Z","title":"Inverse reinforcement learning for video games","venue":"cs.LG","work_id":"826dba44-2691-4527-82eb-54be5b7aa67a","year":2018},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.820875Z"},"links":{"cited_paper":"/paper/1810.10593","citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:f4b85f95d10d42f0fdecde5f66b8558d27c04ed607a72567138f5605ed65d6a2","observation_id":"fcdadd5c-ed15-4e7a-8265-1406a9c589bf","resolution":{"observed_at":"2026-08-06T18:20:25.879792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.966410Z","title":"A survey of preference-based reinforcement learning methods,","venue":null,"work_id":"66251d6c-14e0-4c9d-b3b0-37304576c05f","year":2017},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.824428Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:b30cf0456950b88e4a25013210ed1df8cf6cec4141206ab9097d49683208bd2a","observation_id":"7ffeea1a-ab22-4eb1-879e-b2a9728b90f5","resolution":{"observed_at":"2026-08-06T18:20:25.970626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.956518Z","title":"Optiongan: Learning joint reward-policy options using generative adversarial inverse reinforcement learning,","venue":null,"work_id":"4d2ec5a3-ce48-4c14-9abc-8989ad78d521","year":2018},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.827400Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:ba9d2a876c33a5c7d7312771493ea910a27ae537dc1c371def9bc4904d3b1afb","observation_id":"a14d0fad-69fa-42c5-89df-5d23f111d458","resolution":{"observed_at":"2026-08-06T18:20:25.959978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.946138Z","title":"Hierarchical relative entropy policy search,","venue":null,"work_id":"e070043c-318c-48c7-a82b-30cd2c83bdc3","year":2012},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.831645Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:8a4c20a4ce5f50cd87f99a723ca1ea2a0d9f0036c18be051642c3a7f703eea0e","observation_id":"441a28b5-767e-48b6-ab07-f752e206dd26","resolution":{"observed_at":"2026-08-06T18:20:25.949493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.835801Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.835801Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:d05a2e238222561745f80f272daa4cfb98fbb2d32ca1a55187b27cbdfa5025d4","observation_id":"325fe346-047f-40c1-b2bd-063739624956","resolution":{"observed_at":"2026-08-06T18:20:25.835801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.930398Z","title":"Inverse reinforcement learning from failure,","venue":null,"work_id":"1bd6ae4a-fb52-4b95-a601-e52ccd529ded","year":2016},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.838910Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:4b8cfd8a9a55d697f3cf6370ff5d95ad058a0e2b4d24a78a4b34fed331d67de6","observation_id":"5e122e81-04f9-4e42-9508-a37889ed5663","resolution":{"observed_at":"2026-08-06T18:20:25.934336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:25.805843Z","title":"Available: https://doi.org/10.24963/ijcai.2018/687","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations","version":1},"reference_index":4957,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:25.805843Z"},"links":{"citing_paper":"/paper/2507.08707"},"observation_digest":"sha256:08b92e3378e754238918e763283cd2d90f2cb0dd4dc42624b2c437a32f3be7ee","observation_id":"395cd817-782a-463d-85a0-500b086c9701","resolution":{"observed_at":"2026-08-06T18:20:25.805843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08707","last_updated":"2025-07-11T16:05:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:44:46.421146Z","submitted_at":"2025-07-11T16:05:18Z","title":"SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2507.08707."}