{"as_of":"2026-08-21T15:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab65fd4800497e2f08888c3d89df95fe0dfb846590a886c460892535420673a7","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:06:59.405214Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.24121/citation-record","integrity":"/paper/2602.24121/integrity","json":"/paper/2602.24121/citation-record.json","paper":"/paper/2602.24121"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:52.846497Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:52.846497Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:fe623c363eb6e9f62c22bf7a0c66633aac9728881a7782b8a94783867b5f5f90","observation_id":"0162077f-6801-4314-a753-54c3a13d2daf","resolution":{"observed_at":"2026-08-02T20:06:52.846497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:52.885202Z","title":"Wasserstein Generative Adversarial Networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:52.885202Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:4d4170e2a73152dc6039aab2d0be2b3c43c8d1a5215386e520fb07fd8ab50a03","observation_id":"8de74ff8-f47c-4c6a-a20d-0b630b7e58ab","resolution":{"observed_at":"2026-08-02T20:06:52.885202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02948","last_updated":"2023-05-31T10:52:56Z","snapshot_observed_at":"2026-08-18T22:21:39.446821Z","submitted_at":"2023-02-06T17:30:22Z","title":"Efficient Online Reinforcement Learning with Offline Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02948","snapshot_observed_at":"2026-08-02T20:06:52.898450Z","title":"Ball, Laura Smith, Ilya Kostrikov, and Sergey Levine","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:52.898450Z"},"links":{"cited_paper":"/paper/2302.02948","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:930d9a5c7c4ae366b0164228b60db5cab5f5fff2682750aca7f462f182b30482","observation_id":"93d52c32-20b8-454a-bc34-a47bfcea627a","resolution":{"observed_at":"2026-08-02T20:06:52.898450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:52.934382Z","title":"Blending MPC & Value Function Approximation for Efficient Reinforcement Learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:52.934382Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:7872e5104741424fc3156b39722638e3868860c0519663c9ed7478b9167c64bd","observation_id":"3960de7f-2cd6-4dc6-9219-eba6807c0a2d","resolution":{"observed_at":"2026-08-02T20:06:52.934382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:53.086146Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:53.086146Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:58727c112e71d889277a2feeb1de68ebc6ea7ee87031185a74c300030bbca79a","observation_id":"4940d082-6ded-4684-9955-e0ab1a143ae4","resolution":{"observed_at":"2026-08-02T20:06:53.086146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:53.398125Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:53.398125Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:aa81eb2351812020c6b670941f6c8e7333447e98ab59f2448310a18fab44cac0","observation_id":"d3468589-f11e-4079-a8c0-e656110e6452","resolution":{"observed_at":"2026-08-02T20:06:53.398125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:53.567955Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, 44(10-11):1684–1704, September 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:53.567955Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:49157e20508c570b6935e99a7a12a08dccc16c57f7c1f67ee4a003b980e7c03e","observation_id":"a2fd329c-ffee-4589-9375-64c1c148529f","resolution":{"observed_at":"2026-08-02T20:06:53.567955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10047","last_updated":"2022-12-15T23:47:39Z","snapshot_observed_at":"2026-08-17T17:53:21.415438Z","submitted_at":"2022-10-18T17:59:55Z","title":"From Play to Policy: Conditional Behavior Generation from Uncurated Robot Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10047","snapshot_observed_at":"2026-08-02T20:06:53.745972Z","title":"From Play to Policy: Condi- tional Behavior Generation from Uncurated Robot Data, December 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:53.745972Z"},"links":{"cited_paper":"/paper/2210.10047","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:c33c3e33e3547ad21d11a7d9abd4690a86d3703324b115b74ca57159557a876a","observation_id":"3c7c5ee6-2654-4fd7-8bb8-5e424e44ef06","resolution":{"observed_at":"2026-08-02T20:06:53.745972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:53.830485Z","title":"Model-Based Inverse Reinforcement Learning from Visual Demonstra- tions","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:53.830485Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:691e07692341c4734c2b2d35181a9bf9a946f0cc6d684b7f234d81a1cbfc8584","observation_id":"7fa67de3-971e-4e24-84aa-4bf031236c97","resolution":{"observed_at":"2026-08-02T20:06:53.830485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:53.971625Z","title":"Guided Cost Learning: Deep Inverse Optimal Control via Policy Optimization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:53.971625Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:17b9f64c2877c82b0e6d865d3852d77218aba2362e7c2d66eb2f735e79b56d79","observation_id":"0ae2d674-5ff0-44d5-aa05-6755ead6e6b4","resolution":{"observed_at":"2026-08-02T20:06:53.971625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:54.138288Z","title":"Learning Robust Rewards with Adverserial Inverse Reinforcement Learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.138288Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:e032e21c9b98c6ff7e1669bee9ae69495fff6e921bedf56b1dc6d0b7dccc9247","observation_id":"c081d406-bea8-4b5a-8e5f-bb9fc0d1f7d2","resolution":{"observed_at":"2026-08-02T20:06:54.138288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:54.270744Z","title":"IQ-Learn: Inverse soft-Q Learning for Imitation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.270744Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:abf63fe3c0d988794391196c8c4199f4811211c9aadb0571836ef6d121c551b1","observation_id":"0c7b0bc4-d663-4b6d-bee5-f7b93772adf4","resolution":{"observed_at":"2026-08-02T20:06:54.270744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:54.306656Z","title":"Improved Training of Wasserstein GANs","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.306656Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:ca15071d8f3953d34447a26b409422db9cb68eb705fab073a528853b58306a4a","observation_id":"bb29978c-77a8-4b1e-b98a-2072af9073ef","resolution":{"observed_at":"2026-08-02T20:06:54.306656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-02T20:06:54.339827Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochas- tic Actor, August 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.339827Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:f5b72b59e2f13af72994d2b144045ea0e0264a26f2d369c2c16477a13e07917d","observation_id":"36621b73-1d62-4d32-91c8-9d53729f16fd","resolution":{"observed_at":"2026-08-02T20:06:54.339827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:54.373261Z","title":"Mastering diverse control tasks through world models.Nature, 640(8059):647–653, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.373261Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:2b599c8e65b1d9f7e0bd256e3ff3c5720d26d058a07e1c2819eda5de15691de1","observation_id":"2e34703c-df39-47c6-9032-2945870bf021","resolution":{"observed_at":"2026-08-02T20:06:54.373261Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:54.414001Z","title":"Model Predictive Adversarial Imitation Learn- ing for Planning from Observation, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.414001Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:b6f7c7427ab63a3f1ca8223daebbe749dad3317c58020a6c6d47208f24d968c4","observation_id":"fb4d2a4c-de28-445d-a2c1-5ebcf04b1025","resolution":{"observed_at":"2026-08-02T20:06:54.414001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:54.476807Z","title":"TD- MPC2: Scalable, Robust World Models for Continuous 10 Control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.476807Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:534249ff866a5887fca093cf9bf67dd15d202e64f11089a8d64fdf5be45a8f7c","observation_id":"8dd067e2-9148-4878-98aa-bb5424a24a31","resolution":{"observed_at":"2026-08-02T20:06:54.476807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:54.568438Z","title":"Learn- ing Massively Multitask World Models for Continuous Control, December 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.568438Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:83cc008bdcf0e9ca45343821eb5f64926801903a1632f39050590dd1e11cd618","observation_id":"305c8ea8-c6ac-456d-92a0-b02177318245","resolution":{"observed_at":"2026-08-02T20:06:54.568438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14754","last_updated":"2025-06-17T17:49:16Z","snapshot_observed_at":"2026-08-17T23:58:41.308247Z","submitted_at":"2025-06-17T17:49:16Z","title":"Tactile Beyond Pixels: Multisensory Touch Representations for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14754","snapshot_observed_at":"2026-08-02T20:06:54.635321Z","title":"Tactile Beyond Pixels: Multisensory Touch Representations for Robot Manipulation, June 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.635321Z"},"links":{"cited_paper":"/paper/2506.14754","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:a92061cb56ff517b6be8693190df55d00aea7d137e7102a6e0077e6d76300091","observation_id":"2246c632-61c0-4f87-9350-ac10be56ad79","resolution":{"observed_at":"2026-08-02T20:06:54.635321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:54.727636Z","title":"Generative Adversarial Imitation Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.727636Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:f0a515d2ed939aaf6015dcfce94a8f164bd6ff7705c66b9c38fcdf749b30d24a","observation_id":"4ca99c89-7358-4056-b9f4-c2677abb86e6","resolution":{"observed_at":"2026-08-02T20:06:54.727636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:54.807488Z","title":"A Smooth Sea Never Made a Skilled SAILOR: Robust Imitation via Learning to Search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.807488Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:7548d77d400b6d4f1595c5c68ee20d8e5ee3140a138be4c1c25f0a9e78423a7b","observation_id":"514bfbbb-1ad8-452d-a369-daef8f5c97f2","resolution":{"observed_at":"2026-08-02T20:06:54.807488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:54.897848Z","title":"Never Stop Learning: The Effectiveness of Fine-Tuning in Robotic Reinforcement Learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:54.897848Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:897e136520e3f3af408a208fd29bfd255c0bebed69dc3052c3241181e1e5cf88","observation_id":"0d8f8618-fa44-400f-81cc-4c46a009e5c0","resolution":{"observed_at":"2026-08-02T20:06:54.897848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:55.323862Z","title":"Discriminator-Actor-Critic: Addressing Sample Ineffi- ciency and Reward Bias in Adversarial Imitation Learn- ing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:55.323862Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:97fb7e21da13c912bbe7355c7cd3e48002765e693d56643374fa9c068e751f38","observation_id":"0dcca087-e98e-4d38-805c-bede518fa3b4","resolution":{"observed_at":"2026-08-02T20:06:55.323862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14236","last_updated":"2024-05-12T13:11:29Z","snapshot_observed_at":"2026-08-19T02:01:43.344968Z","submitted_at":"2023-09-25T15:51:29Z","title":"MoDem-V2: Visuo-Motor World Models for Real-World Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14236","snapshot_observed_at":"2026-08-02T20:06:55.456224Z","title":"MoDem-V2: Visuo-Motor World Models for Real-World Robot Manipulation, May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:55.456224Z"},"links":{"cited_paper":"/paper/2309.14236","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:276b299fbad22882ebd2ad624b5446734baf5adafcaa670e1c8fcda66be7622d","observation_id":"89658309-377a-4af8-8d8b-4e64765d41a3","resolution":{"observed_at":"2026-08-02T20:06:55.456224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20476","last_updated":"2025-03-04T13:11:38Z","snapshot_observed_at":"2026-08-18T20:14:25.796187Z","submitted_at":"2025-02-27T19:26:36Z","title":"Unifying Model Predictive Path Integral Control, Reinforcement Learning, and Diffusion Models for Optimal Control and Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20476","snapshot_observed_at":"2026-08-02T20:06:55.615562Z","title":"Unifying Model Predic- tive Path Integral Control, Reinforcement Learning, and Diffusion Models for Optimal Control and Planning, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:55.615562Z"},"links":{"cited_paper":"/paper/2502.20476","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:425a66084d05a8d8ebee804631e7cbd0ffb1cb249a5811694cf9f0ea09079540","observation_id":"4a81f4db-d3ab-4fef-9561-94ca01a104ec","resolution":{"observed_at":"2026-08-02T20:06:55.615562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:55.800698Z","title":"Imitation from Observation: Learning to Imitate Behaviors from Raw Video via Context Translation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:55.800698Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:e3bd9209f32f2cb559801b57b78cd9c93788819c9b58b086fe155dac6db008a5","observation_id":"6fbf6cea-b01c-4551-88aa-50cd958de038","resolution":{"observed_at":"2026-08-02T20:06:55.800698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16013","last_updated":"2025-03-20T09:13:10Z","snapshot_observed_at":"2026-08-19T00:04:55.411762Z","submitted_at":"2024-01-29T10:01:10Z","title":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16013","snapshot_observed_at":"2026-08-02T20:06:55.965466Z","title":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learn- ing, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:55.965466Z"},"links":{"cited_paper":"/paper/2401.16013","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:17584182bde1c54d6edc2e2d954d32785d3c87f1da78ebe02914be9bc06862b0","observation_id":"257f1160-2502-46af-9abf-89bc6d9b1436","resolution":{"observed_at":"2026-08-02T20:06:55.965466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09560","last_updated":"2022-05-04T14:50:26Z","snapshot_observed_at":"2026-08-16T17:05:46.278633Z","submitted_at":"2022-04-20T15:55:15Z","title":"Understanding and Preventing Capacity Loss in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09560","snapshot_observed_at":"2026-08-02T20:06:56.079450Z","title":"Under- standing and Preventing Capacity Loss in Reinforcement Learning, May 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:56.079450Z"},"links":{"cited_paper":"/paper/2204.09560","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:8967eb6ee803aa42b04b2c3a5404e7f8312eab2c70203dbf976496fd7c04486f","observation_id":"9ea34ce9-f781-4f74-8c4a-411656c70a3a","resolution":{"observed_at":"2026-08-02T20:06:56.079450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11347","last_updated":"2019-02-27T19:23:41Z","snapshot_observed_at":"2026-08-20T10:25:10.756377Z","submitted_at":"2018-03-30T05:47:11Z","title":"Learning to Adapt in Dynamic, Real-World Environments Through Meta-Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11347","snapshot_observed_at":"2026-08-02T20:06:56.220469Z","title":"Fearing, Pieter Abbeel, Sergey Levine, and Chelsea Finn","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:56.220469Z"},"links":{"cited_paper":"/paper/1803.11347","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:438f344503e2fb747cebacc1aef3c98d03cf89a77c0fa20b0325204301ba8c98","observation_id":"2ab1a52f-f544-4075-b26f-3080004fd967","resolution":{"observed_at":"2026-08-02T20:06:56.220469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07671","last_updated":"2019-01-28T19:11:23Z","snapshot_observed_at":"2026-08-14T17:41:35.064747Z","submitted_at":"2018-12-18T22:27:31Z","title":"Deep Online Learning via Meta-Learning: Continual Adaptation for Model-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.07671","snapshot_observed_at":"2026-08-02T20:06:56.313374Z","title":"Deep Online Learning via Meta-Learning: Continual Adaptation for Model-Based RL, January 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:56.313374Z"},"links":{"cited_paper":"/paper/1812.07671","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:810cef6db232ef8c6555d400f8b4746e3584d3714ac8f56027271e7cad16ab68","observation_id":"9d09a5bd-64d9-427b-b408-2127c1570bd6","resolution":{"observed_at":"2026-08-02T20:06:56.313374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-02T20:06:56.472771Z","title":"Cosmos World Foundation Model Platform for Physical AI, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:56.472771Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:c1a2adb6f1e154250028342b68a3c57c8e5ac9d63d98260394849810cdc07409","observation_id":"0c177d14-f711-4fc1-b9d0-379d73c2ede4","resolution":{"observed_at":"2026-08-02T20:06:56.472771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04831","last_updated":"2025-11-06T21:43:02Z","snapshot_observed_at":"2026-08-19T12:26:40.549434Z","submitted_at":"2025-11-06T21:43:02Z","title":"Isaac Lab: A GPU-Accelerated Simulation Framework for Multi-Modal Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04831","snapshot_observed_at":"2026-08-02T20:06:56.585500Z","title":"Carlson, Ji Yuan Feng, Animesh Garg, Renato Gasoto, Lionel Gulich, Yijie Guo, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:56.585500Z"},"links":{"cited_paper":"/paper/2511.04831","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:0eadb3d2e40404f558effcd66403e20b4f0a5665203c69dcfddf19b8ef9b353d","observation_id":"e7c50724-e721-4d61-aae2-5482c7cd3426","resolution":{"observed_at":"2026-08-02T20:06:56.585500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:56.617741Z","title":"What Matters for Adversarial Imitation Learning? InAdvances in Neural Information Processing Systems, volume 34, pages 14656– 14668","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:56.617741Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:194e8b421d8b67ba9dca85c7286ffd789b0f5fcfb6e708ff124552392224d602","observation_id":"ed6639e8-e96e-46db-9d41-3c33efedf7bc","resolution":{"observed_at":"2026-08-02T20:06:56.617741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:56.633664Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:56.633664Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:ca09a20a5481a5ae05b8a443a8e51d3a0516b816819eb093553226754cbfbfcb","observation_id":"aeccf64c-7543-4e21-9d67-b74116537e0c","resolution":{"observed_at":"2026-08-02T20:06:56.633664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:56.867066Z","title":"Much Ado About Noising: Dispelling the Myths of Generative Robotic Control, December 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:56.867066Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:7e1eb8a65fd7af438b757b7ba9b429e15cc43628a6046383c41513b82cfe6967","observation_id":"307bf722-fdbe-4ea6-a59d-35abf95a5b50","resolution":{"observed_at":"2026-08-02T20:06:56.867066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-02T20:06:56.988043Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library, December 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:56.988043Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:607115f18f69f2d13909e4ad7d93c460f7ccf1e4dbf67a31419c7d349f9763f9","observation_id":"12bc37d2-a504-4849-92ac-6418f2f741b6","resolution":{"observed_at":"2026-08-02T20:06:56.988043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:57.069911Z","title":"AMP: adversarial motion priors for stylized physics-based character control.ACM Trans- actions on Graphics, 40(4):1–20, August 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:57.069911Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:890b99dd6fb3f19a49407b68f00ed43f59405d7d292b51ae29ea96459b9dfdfd","observation_id":"70d6f273-0223-448d-9e12-1261d802b95f","resolution":{"observed_at":"2026-08-02T20:06:57.069911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:57.184731Z","title":"Visual Adversarial Imitation Learning using Variational Models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:57.184731Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:9752de39ff12e8686f991068ba9f2930cffef3b265ac903a32633521e00f2f4a","observation_id":"5da24834-aff3-4a6a-a30a-bca0b3876453","resolution":{"observed_at":"2026-08-02T20:06:57.184731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:57.315211Z","title":"Random Features for Large-Scale Kernel Machines","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:57.315211Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:71700177df1d7d071318e29d6f3df5b2a2609049c25ba73aaef46d64ced95f5a","observation_id":"d0fa88e1-fe48-499e-a915-6c90f8d1d759","resolution":{"observed_at":"2026-08-02T20:06:57.315211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:53.236467Z","title":"URL https://proceedings.mlr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:53.236467Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:627154f63c57f3a332ce93291e990f915bad85ca9b4b2db5006cfbe35478bb1f","observation_id":"b13c1054-b929-4437-afe6-395d765c14dd","resolution":{"observed_at":"2026-08-02T20:06:53.236467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11164","last_updated":"2025-05-16T12:07:37Z","snapshot_observed_at":"2026-08-18T20:49:47.599499Z","submitted_at":"2025-05-16T12:07:37Z","title":"Parkour in the Wild: Learning a General and Extensible Agile Locomotion Policy Using Multi-expert Distillation and RL Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11164","snapshot_observed_at":"2026-08-02T20:06:57.642863Z","title":"Parkour in the Wild: Learning a General and Extensible Agile Locomotion Policy Using Multi-expert Distillation and RL Fine-tuning, May 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:57.642863Z"},"links":{"cited_paper":"/paper/2505.11164","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:f39d77e5cc156b8598e73eb8ad7192697324d7cb44b96308f3adc0faf5f23090","observation_id":"c0bc330c-107c-4f26-92dd-c8264272a6a5","resolution":{"observed_at":"2026-08-02T20:06:57.642863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T20:06:57.684464Z","title":"Proximal Policy Optimization Algorithms, August 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:57.684464Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:f68195fcb77e858aaec8d679701013f3371e9ed19996de256fecd01dcc024de6","observation_id":"99d4e588-9d5f-45d7-829b-ccc5c5a56ab5","resolution":{"observed_at":"2026-08-02T20:06:57.684464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:57.446297Z","title":"Latent Plans for Task-Agnostic Offline Reinforcement Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:57.446297Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:ec29234ff891956487240c0f1090a07d21411783f589d395a7d2ef004a994657","observation_id":"ceb56b2c-8368-4c3c-b710-33b2d49da1b1","resolution":{"observed_at":"2026-08-02T20:06:57.446297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:57.869226Z","title":"Reinforcement Learning: An Introduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:57.869226Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:2ab72e74b83eec9f9f1f793a7d9afd7612df2054b9ca2651fc68d93f064469ba","observation_id":"8253ae59-e7d7-4f32-974d-270dfb2cd68a","resolution":{"observed_at":"2026-08-02T20:06:57.869226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07374","last_updated":"2019-06-18T04:39:45Z","snapshot_observed_at":"2026-08-14T16:14:11.121193Z","submitted_at":"2019-06-18T04:39:45Z","title":"Sample-efficient Adversarial Imitation Learning from Observation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07374","snapshot_observed_at":"2026-08-02T20:06:57.988474Z","title":"Sample-efficient Adversarial Imitation Learning from Observation, June 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:57.988474Z"},"links":{"cited_paper":"/paper/1906.07374","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:b5a43047f4272ba59946c27bcec6a4eebed9f3affd1461c2a868fafb1cf3af4c","observation_id":"d593cca8-de01-4914-931f-ac6462f174a6","resolution":{"observed_at":"2026-08-02T20:06:57.988474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:57.793841Z","title":"Adversarial Inverse Reinforcement Learning With Self-Attention Dynamics Model.IEEE Robotics and Automation Letters, 6(2):1880–1886, April 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:57.793841Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:439c2fc93de0c8a5e7ae46aa8652eca65cce938eea128a671557b6f473804235","observation_id":"47d2c089-8cb0-4278-9dd2-0e06dba47fd6","resolution":{"observed_at":"2026-08-02T20:06:57.793841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-02T20:06:58.253783Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:58.253783Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:93b78ffa07042a100df82ae3335380fa64f06c82b2c419a8e2269539595dfdd4","observation_id":"e04756ea-2138-4fbc-9f8b-6d4201bd6a28","resolution":{"observed_at":"2026-08-02T20:06:58.253783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:58.425614Z","title":"DiffAIL: Diffusion Adversarial Imitation Learning.Proceedings of the AAAI Conference on Artificial Intelligence, 38(14):15447–15455, March 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:58.425614Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:f143b3cecb001caf4ab9a590d41aa773962a77f5d701923452362cbb3498e050","observation_id":"d69743ba-d4c1-4352-aafe-121845d5e773","resolution":{"observed_at":"2026-08-02T20:06:58.425614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06158","last_updated":"2019-06-18T04:56:56Z","snapshot_observed_at":"2026-08-18T08:58:09.128606Z","submitted_at":"2018-07-17T00:25:15Z","title":"Generative Adversarial Imitation from Observation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06158","snapshot_observed_at":"2026-08-02T20:06:58.056320Z","title":"Genera- tive Adversarial Imitation from Observation, June 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:58.056320Z"},"links":{"cited_paper":"/paper/1807.06158","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:f57442eddbe18044140b867674fe0a7efd549255e6b7438e8b2be8f9318450f3","observation_id":"6917eb61-fb60-42d7-94e1-8df92abbb572","resolution":{"observed_at":"2026-08-02T20:06:58.056320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:58.792683Z","title":"Rehg, and Evangelos A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:58.792683Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:a097ffc4b0b339df5533ab2e478f5cf08c8814ce7a25648f6e7ca3516bdacf4a","observation_id":"b1eec14d-09d3-4cc5-9b29-629f93d0c2f0","resolution":{"observed_at":"2026-08-02T20:06:58.792683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:59.019933Z","title":"XIRL: Cross-embodiment Inverse Reinforcement Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:59.019933Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:193cb44682c5ef10a9364e1925e66bf3216b2ead5f9f815846a5812b89e7aabc","observation_id":"8c2b217d-9eb0-4bfa-9a0c-c49311ab5b31","resolution":{"observed_at":"2026-08-02T20:06:59.019933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12422","last_updated":"2023-10-13T05:44:37Z","snapshot_observed_at":"2026-08-16T15:53:03.955730Z","submitted_at":"2023-02-24T02:54:15Z","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12422","snapshot_observed_at":"2026-08-02T20:06:58.601408Z","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play, October 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:58.601408Z"},"links":{"cited_paper":"/paper/2302.12422","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:588119b1b908b23036929f9f4410920a92297e39bcea0a89a577f8292774c048","observation_id":"94d45f15-26ee-40c8-969d-075ba15105fe","resolution":{"observed_at":"2026-08-02T20:06:58.601408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:59.160095Z","title":"somersaulting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:59.160095Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:d8b113bd2bfff71645e74ba8ecd2d36911579d79d63914dd40ad2f3745af93df","observation_id":"1b1192af-15bb-49ea-8da0-1fc0bba76e1b","resolution":{"observed_at":"2026-08-02T20:06:59.160095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:59.272059Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:59.272059Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:1f2df470c6b95da9df326ed65bc83bd0c02e7c303ef893e3a14dc952d0d34e79","observation_id":"084f76fa-c48c-470c-acd7-5995f3e3bbc2","resolution":{"observed_at":"2026-08-02T20:06:59.272059Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:59.405214Z","title":"Influence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:59.405214Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:fa570eef9405ee8528861cea1aba367dd51c8f5107f719fbde442a3eec4c13b8","observation_id":"48dc71ac-95e5-412b-87f7-c33ac5d3f2b1","resolution":{"observed_at":"2026-08-02T20:06:59.405214Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:56.722048Z","title":"URL https://ieeexplore.ieee.org/document/10611477/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:56.722048Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:e636bbcbed10abdd3f0b05bb088c4fba68b4f3327f82ecce9e327b49b0cf12d6","observation_id":"ea40b832-d4c6-41ac-aff7-dcc33fd25ef9","resolution":{"observed_at":"2026-08-02T20:06:56.722048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:06:55.151332Z","title":"URL https://proceedings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":2136,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:55.151332Z"},"links":{"citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:1c289c37d9ccc00dd25b967c9f937e8c6beb597e9edc2513936afa23882925b6","observation_id":"98dcd3da-8ca8-4969-af5e-702077519d5c","resolution":{"observed_at":"2026-08-02T20:06:55.151332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T11:40:15.154564Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2602.24121."}