{"as_of":"2026-08-08T17:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32b8e1a89c2a1dafe86cbd06bc9db21d7cb701eda05fe67b740abc5daa85f560","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:34:08.140575Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14180/citation-record","integrity":"/paper/2607.14180/integrity","json":"/paper/2607.14180/citation-record.json","paper":"/paper/2607.14180"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:08.069750Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:08.069750Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:87468966c76121bcbb7b3ae94ec52bf93aacd69640fa1d2f62124ab4a6727f49","observation_id":"81902e09-5352-4574-85ba-cd3d46dc33d1","resolution":{"observed_at":"2026-08-02T03:34:08.069750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13885","last_updated":"2020-11-27T18:20:04Z","snapshot_observed_at":"2026-07-06T10:18:28.593525Z","submitted_at":"2020-11-27T18:20:04Z","title":"Offline Learning from Demonstrations and Unlabeled Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13885","snapshot_observed_at":"2026-08-02T03:34:07.409979Z","title":"Offline learning from demonstrations and unlabeled experience.arXiv preprint arXiv:2011.13885,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.409979Z"},"links":{"cited_paper":"/paper/2011.13885","citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:ba5cc2443ba8bd4d24d295cd4cde38d606d84e0b5c5d7a3e320676d8afe261e3","observation_id":"c23ed939-7c91-4a28-bad8-be69926009aa","resolution":{"observed_at":"2026-08-02T03:34:07.409979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.564105Z","title":"B Related Work Learning dynamics from preferences.Several recent papers have detailed methods for improv- ing world model realism with human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.564105Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:9da83d4f4fd5b99c90289e0e3e7fdb7652da86c233f1b988e599290b3ab4cad3","observation_id":"c7a23a83-34a6-433a-8cc7-5c5bd8df2a24","resolution":{"observed_at":"2026-08-02T03:34:07.564105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.621247Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.621247Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:ea9334840cbd21991d7e77332bd00ea7d0cb03226a4167d1bc55a395990565fe","observation_id":"13d2aa79-ed5d-4d6d-9e15-7819d2346b4d","resolution":{"observed_at":"2026-08-02T03:34:07.621247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.691390Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.691390Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:086300ffc9e5b00b8fd23ea7bc9d940896bf6a6e1c4a860e3ebfda1d64aeeb21","observation_id":"1d43dec6-693c-489f-ac45-2fa0bf2a0691","resolution":{"observed_at":"2026-08-02T03:34:07.691390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.760846Z","title":null,"venue":null,"work_id":null,"year":2080},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.760846Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:ac3f74704831ec6b8f262e01c8fc9a5a4a93577edc9d626fb7115bf61cac2303","observation_id":"3bbd50fe-6b46-47e1-b7b5-740e21459c6f","resolution":{"observed_at":"2026-08-02T03:34:07.760846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.830742Z","title":"Each block applies a depthwise3×3convolution, LayerNorm, a two-layer MLP with4×channel expansion and GELU activation, and a residual connection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.830742Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:da9a526bdcc94d13a3070db4e388eaa00ae44b0f5c63716395a6402d460284f5","observation_id":"033f6775-e28b-462c-b54a-301043b8db97","resolution":{"observed_at":"2026-08-02T03:34:07.830742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.906979Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.906979Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:07e6e7465ad5b4a5d09e156bef2c9de87db8674377bf60921a3d3f6c7ba10520","observation_id":"a7372a0a-d3d4-4db0-bd9b-d7b2e658303f","resolution":{"observed_at":"2026-08-02T03:34:07.906979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:08.140575Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:08.140575Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:42e41a2a53e454c7c53e640dc1b15e104a6aab6a3650b357945943f8b246c217","observation_id":"a5f4839e-bdbf-4cad-b1b3-0f301a7f1d3e","resolution":{"observed_at":"2026-08-02T03:34:08.140575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15960","last_updated":"2026-05-18T10:20:13Z","snapshot_observed_at":"2026-07-31T17:35:31.437364Z","submitted_at":"2026-05-15T13:54:08Z","title":"Imperfect World Models are Exploitable","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15960","snapshot_observed_at":"2026-08-02T03:34:07.153034Z","title":"Whitammer, David Abel, Mykel J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.153034Z"},"links":{"cited_paper":"/paper/2605.15960","citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:e618de45e79392708723361e4c719cebcc7223c441c4132dfb3389c3f058df7a","observation_id":"11ded2c5-6edd-4bb3-bca8-1fe989368908","resolution":{"observed_at":"2026-08-02T03:34:07.153034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.225485Z","title":"Anatomy of a robotaxi crash: Lessons from the Cruise pedestrian dragging mishap","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.225485Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:98a078f4edf48d332cdfd59efe800762e1e370eb4bd31f67ffab924419cf2a03","observation_id":"be5ffce1-f1c9-4881-a715-217acad4f859","resolution":{"observed_at":"2026-08-02T03:34:07.225485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.047631Z","title":"UCB/EECS-2019-98","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.047631Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:8d7b4fc356e015a4b6f201fda16682bf79a7a8bd4a11dae0a057c992bc4b1196","observation_id":"eed79e46-0b8f-46a1-b0b9-c0c0f5239bae","resolution":{"observed_at":"2026-08-02T03:34:07.047631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.497880Z","title":"A Preliminaries We briefly review the necessary background to understand DLHF and RENEW","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.497880Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:947fc204bb1c2fcd990391cfb4b7c4c1ea6e30c48188075c8c73bdaac3c888db","observation_id":"e890f298-edd6-4fe6-b626-b361672a8d97","resolution":{"observed_at":"2026-08-02T03:34:07.497880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-02T03:34:07.294572Z","title":"Sergey Levine, Aviral Kumar, George Tucker, and Justin Fu","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.294572Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:68773fc88689016a9001d110903f8de3bed49c2a2e1aa65fa973d035f4e7130a","observation_id":"b48c5f8a-842e-4a3e-baa4-33838d3e9472","resolution":{"observed_at":"2026-08-02T03:34:07.294572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.979332Z","title":"•Maze10×10.A grid world where an agent navigates corridors to reach a goal position","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.979332Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:f6a57b9612e28810ac4ec42b44f919668de615de8b105dc52007e74ccf258499","observation_id":"0b9a4e69-7a96-433e-b3be-b680ac711614","resolution":{"observed_at":"2026-08-02T03:34:07.979332Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:34:07.342134Z","title":"IntPhys 2019: A benchmark for visual intuitive physics under- standing.IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(9):5016–5025,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T03:34:07.342134Z"},"links":{"citing_paper":"/paper/2607.14180"},"observation_digest":"sha256:700e32212c5603b153078b52f172bf1d13c20b5104289c6215b88770d9b09952","observation_id":"128e33b3-63fa-4113-8434-8cfe7ac66e63","resolution":{"observed_at":"2026-08-02T03:34:07.342134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14180","last_updated":"2026-07-15T14:03:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T05:28:13.267188Z","submitted_at":"2026-07-15T14:03:45Z","title":"RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2607.14180."}