{"as_of":"2026-08-09T15:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f114d5208795dde52aadd47aa44f2b9a6f2fd1a7419efc78d5e7ac1fc77cd82","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:55:57.933399Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:56:07.377797Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T11:26:53.806020Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"cited_work":{"arxiv_id":"2502.04296","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04296","snapshot_observed_at":"2026-07-02T11:26:53.806020Z","title":"Learning real-world action-video dynamics with het- erogeneous masked autoregression","venue":null,"work_id":"f1c53034-c72b-4308-946a-3541f4cfdf8a","year":2025},"citing_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-07-06T21:25:23.371749Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:29.361187Z"},"links":{"cited_paper":"/paper/2502.04296","citing_paper":"/paper/2505.11709"},"observation_digest":"sha256:d0f048c711b48a66289d318168fd38ac1c14238164c138e8f900e758a363c877","observation_id":"95a08074-afd5-45ee-94f5-58b864e2dfc4","resolution":{"observed_at":"2026-05-15T15:40:29.433302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04296","snapshot_observed_at":"2026-08-06T21:56:07.377797Z","title":"Learning re al-world action-video dynamics with heterogeneous masked autoregression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23135","last_updated":"2025-06-29T08:19:45Z","snapshot_observed_at":"2026-08-07T02:31:43.164112Z","submitted_at":"2025-06-29T08:19:45Z","title":"RoboScape: Physics-informed Embodied World Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:07.377797Z"},"links":{"cited_paper":"/paper/2502.04296","citing_paper":"/paper/2506.23135"},"observation_digest":"sha256:3061760b3db37809bd903d93193b65ff7ea53dbd4229fadf8413e7126bf10173","observation_id":"ec0af1ce-0849-43d9-b8bc-48751245927f","resolution":{"observed_at":"2026-08-06T21:56:07.377797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"cited_work":{"arxiv_id":"2502.04296","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04296","snapshot_observed_at":"2026-07-02T11:26:53.806020Z","title":"Learning real-world action-video dynamics with het- erogeneous masked autoregression","venue":null,"work_id":"f1c53034-c72b-4308-946a-3541f4cfdf8a","year":2025},"citing_paper":{"arxiv_id":"2512.21898","last_updated":"2026-02-01T23:43:52Z","snapshot_observed_at":"2026-07-06T22:40:07.339525Z","submitted_at":"2025-12-26T07:11:47Z","title":"Flexible Multitask Learning with Factorized Diffusion Policy","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T19:21:52.191786Z"},"links":{"cited_paper":"/paper/2502.04296","citing_paper":"/paper/2512.21898"},"observation_digest":"sha256:9373e435fc42b964a81c5b0be091a673fffa9f7aef46207486949fe310800a1a","observation_id":"bcd6fa57-94f4-4ab6-84d8-1a1a1c054e42","resolution":{"observed_at":"2026-05-16T19:23:19.624107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"cited_work":{"arxiv_id":"2502.04296","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04296","snapshot_observed_at":"2026-07-02T11:26:53.806020Z","title":"Learning real-world action-video dynamics with het- erogeneous masked autoregression","venue":null,"work_id":"f1c53034-c72b-4308-946a-3541f4cfdf8a","year":2025},"citing_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-16T17:02:33.997887Z"},"links":{"cited_paper":"/paper/2502.04296","citing_paper":"/paper/2602.06949"},"observation_digest":"sha256:662ea31598e9d3f955f81ef57282b8a2b75fda764486527b7c8b0afc0b0dafe6","observation_id":"827b669a-8a7e-4d39-a54a-ac1c5f2a536b","resolution":{"observed_at":"2026-05-16T17:02:34.182816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"cited_work":{"arxiv_id":"2502.04296","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04296","snapshot_observed_at":"2026-07-02T11:26:53.806020Z","title":"Learning real-world action-video dynamics with het- erogeneous masked autoregression","venue":null,"work_id":"f1c53034-c72b-4308-946a-3541f4cfdf8a","year":2025},"citing_paper":{"arxiv_id":"2603.09030","last_updated":"2026-04-06T01:32:12Z","snapshot_observed_at":"2026-07-30T02:16:48.709523Z","submitted_at":"2026-03-09T23:58:07Z","title":"PlayWorld: Learning Robot World Models from Autonomous Play","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-15T14:05:32.112432Z"},"links":{"cited_paper":"/paper/2502.04296","citing_paper":"/paper/2603.09030"},"observation_digest":"sha256:3fda71ce7cf2d33c98ec2d4b07932bbcb44f54c6dcee037f535ccd281173bb50","observation_id":"6daef070-6f03-423a-8350-6d3474f97e52","resolution":{"observed_at":"2026-05-15T14:05:54.626711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"cited_work":{"arxiv_id":"2502.04296","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04296","snapshot_observed_at":"2026-07-02T11:26:53.806020Z","title":"Learning real-world action-video dynamics with het- erogeneous masked autoregression","venue":null,"work_id":"f1c53034-c72b-4308-946a-3541f4cfdf8a","year":2025},"citing_paper":{"arxiv_id":"2606.00113","last_updated":"2026-05-27T05:32:17Z","snapshot_observed_at":"2026-08-01T09:58:43.654749Z","submitted_at":"2026-05-27T05:32:17Z","title":"World Models for Robotic Manipulation: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T12:24:18.025364Z"},"links":{"cited_paper":"/paper/2502.04296","citing_paper":"/paper/2606.00113"},"observation_digest":"sha256:b62d3fe8efb071d52b986d51ccdac0ac9ec52276a0310ea898b5efff06faeeca","observation_id":"21edb4aa-ad4f-490d-959c-fd31bf376b55","resolution":{"observed_at":"2026-06-29T12:33:25.171734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"cited_work":{"arxiv_id":"2502.04296","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04296","snapshot_observed_at":"2026-07-02T11:26:53.806020Z","title":"Learning real-world action-video dynamics with het- erogeneous masked autoregression","venue":null,"work_id":"f1c53034-c72b-4308-946a-3541f4cfdf8a","year":2025},"citing_paper":{"arxiv_id":"2607.01060","last_updated":"2026-07-15T03:57:18Z","snapshot_observed_at":"2026-08-02T09:05:08.786256Z","submitted_at":"2026-07-01T15:22:41Z","title":"RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-02T11:21:32.725966Z"},"links":{"cited_paper":"/paper/2502.04296","citing_paper":"/paper/2607.01060"},"observation_digest":"sha256:ff61d1c5ceef54173899effd60822e9b4ccbb6a760c844d03c447927fe604533","observation_id":"72c4f508-b0e5-4b21-a704-c4567ff9e853","resolution":{"observed_at":"2026-07-02T11:26:53.807491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04296","snapshot_observed_at":"2026-07-14T16:48:30.512494Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01060","last_updated":"2026-07-15T03:57:18Z","snapshot_observed_at":"2026-08-02T09:05:08.786256Z","submitted_at":"2026-07-01T15:22:41Z","title":"RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T16:48:30.512494Z"},"links":{"cited_paper":"/paper/2502.04296","citing_paper":"/paper/2607.01060"},"observation_digest":"sha256:f64cd2bf17e975bfa26469f38c069de87038e7cffc98f76f3c5dfaa0a246e285","observation_id":"8d8da0bf-c71c-431c-96e7-ffe784398fe4","resolution":{"observed_at":"2026-07-14T16:48:30.512494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04296","snapshot_observed_at":"2026-08-03T09:43:32.119022Z","title":"Learning real-world action-video dynamics with heterogeneous masked autoregression.arXiv preprint arXiv:2502.04296, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29302","last_updated":"2026-07-31T11:18:17Z","snapshot_observed_at":"2026-08-07T06:19:59.521152Z","submitted_at":"2026-07-31T11:18:17Z","title":"BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T09:43:32.119022Z"},"links":{"cited_paper":"/paper/2502.04296","citing_paper":"/paper/2607.29302"},"observation_digest":"sha256:0d629b8b98a2adcb41ff3d4829dffbcf7c1358487c92be731a09fd4633ff71e0","observation_id":"7f0c880b-cc8d-425f-9b93-b4a206dab80b","resolution":{"observed_at":"2026-08-03T09:43:32.119022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04296/citation-record","integrity":"/paper/2502.04296/integrity","json":"/paper/2502.04296/citation-record.json","paper":"/paper/2502.04296"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.894954Z","title":"1X World Model Challenge, June 2024","venue":null,"work_id":"fc09fadb-8f53-4a45-aa86-6f67d07b4725","year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.629697Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:26d4c54cc395d5bb82bb694757249d6c90384fd384281edc61465bd8309e40f4","observation_id":"662a74a1-a8f6-4abe-8af9-c33e91d3277e","resolution":{"observed_at":"2026-08-08T22:55:58.899644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12399","last_updated":"2024-10-30T14:34:49Z","snapshot_observed_at":"2026-07-06T18:16:59.602510Z","submitted_at":"2024-05-20T22:51:05Z","title":"Diffusion for World Modeling: Visual Details Matter in Atari","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12399","snapshot_observed_at":"2026-08-08T22:55:57.635676Z","title":"Diffusion for world modeling: Visual details matter in atari","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.635676Z"},"links":{"cited_paper":"/paper/2405.12399","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:6e5fa5fbd60e1fb807ca4aa333df37e86a14dfa76f0a3c6fa364fb08f67ef58f","observation_id":"148a21b9-8cff-490d-b761-96787aba93f1","resolution":{"observed_at":"2026-08-08T22:55:57.635676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.880139Z","title":"Neuro-dynamic programming: an overview","venue":null,"work_id":"9a4a5a5f-37af-4997-9e62-9f92a13e58ea","year":1995},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.641446Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:c16e7fcb005da452e7d222ff0a945579a819f96944b8f0c9bbce6d2466469d89","observation_id":"0d86599c-813a-4130-b3c5-16a61b019aa0","resolution":{"observed_at":"2026-08-08T22:55:58.884955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T22:55:57.646501Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.646501Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:c7fa12b426e8295b48284c1b4959259289a65666b39f61dd7db2ad23b85c9b34","observation_id":"8174f2cd-c508-4680-9f6d-c4549fd6bb40","resolution":{"observed_at":"2026-08-08T22:55:57.646501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.864452Z","title":"Video generation models as world simulators","venue":null,"work_id":"894d5475-9cc2-4999-8428-5e5682184e2d","year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.652218Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:95eab4427fc58a9345c6eabade908d24d39bfb001f0230636bdd8a27cc82afef","observation_id":"420e5ea1-fbf4-469c-b729-ca554a287452","resolution":{"observed_at":"2026-08-08T22:55:58.869207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.849651Z","title":"Genie: Generative interactive environments","venue":null,"work_id":"ecd7cfd1-1056-4d33-a20b-f76ec0adb608","year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.657336Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:7db291e3f34453491759900524e7cd5a5bc95ad4aa64f6bd0b71ee465f2cb1b7","observation_id":"be5b90d5-2b37-4405-a8cf-e1477749d8ed","resolution":{"observed_at":"2026-08-08T22:55:58.854371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.833924Z","title":"Se3-nets: Learning rigid body motion using deep neural networks","venue":null,"work_id":"168fc5f1-95d0-40ef-9573-8a1422f3d2cb","year":2017},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.662988Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:f6f6eca9e1aa4d440a2cc263aeb91261157db1e08f2ee85251db26fb2cbb23db","observation_id":"8023e573-4cdc-4409-b45d-69a009470db6","resolution":{"observed_at":"2026-08-08T22:55:58.838814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.818832Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"8779872a-eab1-4fcc-ae30-16f21e557d2c","year":2022},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.667685Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:1c96e441b84851937f6f5d64ba95794c648d3b2336ef2dffc33f707cb1e801bd","observation_id":"8ffb5d91-ee1d-41d0-b062-728ee217cd20","resolution":{"observed_at":"2026-08-08T22:55:58.823575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.802405Z","title":"Decision transformer: Reinforcement learn- ing via sequence modeling","venue":null,"work_id":"d6923b3c-d1db-4881-a674-b76f06e5af7a","year":2021},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.672543Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:8f5980f91782735155ed643006aedacd9ee5cc27ea544bf507d49f2bbe0d48f1","observation_id":"c7942407-19d0-4233-9ef1-828951e89c34","resolution":{"observed_at":"2026-08-08T22:55:58.808172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06671","last_updated":"2023-02-22T19:18:28Z","snapshot_observed_at":"2026-07-06T14:51:26.249912Z","submitted_at":"2023-02-13T20:18:25Z","title":"GenAug: Retargeting behaviors to unseen situations via Generative Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06671","snapshot_observed_at":"2026-08-08T22:55:57.677962Z","title":"Genaug: Retargeting behaviors to unseen situations via gener- ative augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.677962Z"},"links":{"cited_paper":"/paper/2302.06671","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:15d3e9dfb3614dc58400671f865412405086ecc61b05f4b14ee42e55e8194e74","observation_id":"ddc1bdf7-0c2c-4b5f-8edf-e08b2fc7b07d","resolution":{"observed_at":"2026-08-08T22:55:57.677962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.785944Z","title":"Diffusion policy: Visuomotor policy learning via action diffu- sion","venue":null,"work_id":"c6d8b684-9fd1-4b55-8ab6-5440e3ef5627","year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.683295Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:fe045bbe8c25d0a4f67684f4c12b86af9a8cf64ff59ab5afcec3d9c89e6129f0","observation_id":"071f766c-e757-4a11-88a1-3e9f7e3d4219","resolution":{"observed_at":"2026-08-08T22:55:58.790802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.770472Z","title":"The epic-kitchens dataset: Collection, challenges and base- lines","venue":null,"work_id":"3d8da6cd-5df7-4a5e-8e0b-fb0819da5c79","year":2020},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.688095Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:5ade07db471c1be19aac756036d19c26508f0352fde76ed61087feaff4c767b5","observation_id":"4e1d0f67-4a10-4486-ae50-03b8838be978","resolution":{"observed_at":"2026-08-08T22:55:58.775466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.754929Z","title":"Rescal- ing egocentric vision: Collection, pipeline and challenges for epic-kitchens-100","venue":null,"work_id":"eae235ef-4071-4847-bc53-cf2c16e8a6a4","year":2022},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.692983Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:9f0b466fd28b5e2386e038d7007be968f852cf6916a37a2dba83752523f597c4","observation_id":"2218911c-af71-4994-8a33-9ef14071319e","resolution":{"observed_at":"2026-08-08T22:55:58.760008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11812","last_updated":"2024-08-21T17:57:51Z","snapshot_observed_at":"2026-08-03T05:45:43.939088Z","submitted_at":"2024-08-21T17:57:51Z","title":"Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11812","snapshot_observed_at":"2026-08-08T22:55:57.698295Z","title":"Scaling cross-embodied learning: One policy for manipulation, navigation, locomotion and aviation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.698295Z"},"links":{"cited_paper":"/paper/2408.11812","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:df0cb9f344032e2b70a730755024fc3ed1ecc1e23a0887bf43963122d9a571f6","observation_id":"e8858a0f-1d6e-4b53-80be-d98b1a78a5b0","resolution":{"observed_at":"2026-08-08T22:55:57.698295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10625","last_updated":"2023-10-16T17:48:45Z","snapshot_observed_at":"2026-08-09T12:57:58.196865Z","submitted_at":"2023-10-16T17:48:45Z","title":"Video Language Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10625","snapshot_observed_at":"2026-08-08T22:55:57.703554Z","title":"Video language planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.703554Z"},"links":{"cited_paper":"/paper/2310.10625","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:58106bf53c316df69f511397ee48d3274e572e7447874c32bacd4d04f5363d41","observation_id":"fe0454d2-332e-4621-81e6-df327f61e713","resolution":{"observed_at":"2026-08-08T22:55:57.703554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.739758Z","title":"Deep visual foresight for planning robot motion","venue":null,"work_id":"b3123a8c-bef0-40b3-bddd-fe654453b4a9","year":2017},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.709224Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:b07e5b69df443888a877ef2c18d2a0b8b746f1267861c6c0d3dbbd11d6c61e21","observation_id":"51bca55b-eeb0-454c-8157-aab1f6389bec","resolution":{"observed_at":"2026-08-08T22:55:58.744659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.723738Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":"c82dbd55-311d-46c3-b89a-4242b5afe326","year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.714304Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:ec95a7a15a9e15a064fc4ca61c724d2f27eacda62fa770e36303073035112cae","observation_id":"1179ad61-e956-41c1-b33b-235cbb9d6d00","resolution":{"observed_at":"2026-08-08T22:55:58.729188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-08T22:55:57.719335Z","title":"World models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.719335Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:6aa64de8b4205c0195e37cf2a0f048b697b0ec454dfac157cd234379a8971821","observation_id":"678df3dc-94b8-40e4-b32d-630917da09f0","resolution":{"observed_at":"2026-08-08T22:55:57.719335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-08T22:55:57.724214Z","title":"Td-mpc2: Scalable, robust world models for continuous control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.724214Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:78ffd6ba51ce78aa85c0e0a57f9a37d2f871e7ea93d6a052e86a88e58be63409","observation_id":"9c789e95-640a-4e36-a781-7e95ca907896","resolution":{"observed_at":"2026-08-08T22:55:57.724214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-08T22:55:57.729517Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.729517Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:0251443790d6b2dbb0a3ab789d0f5f51dea671d7dfda96e7a3b088391373ae21","observation_id":"91a24d93-85a3-47ad-9ecf-f1d0eb17b986","resolution":{"observed_at":"2026-08-08T22:55:57.729517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:57.734773Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.734773Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:b6c8ea77e638eb1755fc037caaef56bb122de83e77814d91471447fe112c86b2","observation_id":"efb5d37b-3a51-4389-b0b1-4caa209ef18c","resolution":{"observed_at":"2026-08-08T22:55:57.734773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.697713Z","title":"Video diffusion models","venue":null,"work_id":"ead023e2-d134-4719-b5d2-1bac896ad5d4","year":2022},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.739454Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:4a8d7538c3e5c5cc6d94add626d8ae8d3523a2f89af52fb76f0cba3d4dd107d0","observation_id":"1c30645c-e9b9-4922-9dec-013c8b9fe682","resolution":{"observed_at":"2026-08-08T22:55:58.702608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:57.744216Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.744216Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:c5a58a362bdb8ad3aefc62841163d88fde9a4a408c3e57af752295dba6af2784","observation_id":"63305648-8692-47cc-a99d-d75b9aa60361","resolution":{"observed_at":"2026-08-08T22:55:57.744216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09991","last_updated":"2022-12-21T01:06:18Z","snapshot_observed_at":"2026-08-06T05:32:02.292779Z","submitted_at":"2022-05-20T07:02:03Z","title":"Planning with Diffusion for Flexible Behavior Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09991","snapshot_observed_at":"2026-08-08T22:55:57.749481Z","title":"Planning with diffusion for flexible behavior synthe- sis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.749481Z"},"links":{"cited_paper":"/paper/2205.09991","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:24299dc7cff685df9725e189566cc44c81393c350f8deb3ce36c916169a40532","observation_id":"959fc950-fb89-405e-b15f-145572221667","resolution":{"observed_at":"2026-08-08T22:55:57.749481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-08T22:55:57.754533Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.754533Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:b548894842223705bed78d8ce0014393efc38117ea7ded2de2fd4d2e93a6df81","observation_id":"f4046f73-5de9-429f-a279-ba458a5c653d","resolution":{"observed_at":"2026-08-08T22:55:57.754533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-08T22:55:57.759988Z","title":"Videopoet: A large language model for zero-shot video generation.arXiv preprint arXiv:2312.14125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.759988Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:8c6b6ed6bf87c973ac471f795539fdd7747823794d1d28fa82458ca612a09717","observation_id":"1658ff66-ec44-41af-be90-ccac46f7846a","resolution":{"observed_at":"2026-08-08T22:55:57.759988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-08T22:55:57.765064Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.765064Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:a6d638449ad930fc124b189dbe267ed2257cb55406b1649e20ef72cd62418669","observation_id":"a6213946-386f-4db0-9baf-0a3be80f7522","resolution":{"observed_at":"2026-08-08T22:55:57.765064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.01566","last_updated":"2019-04-18T00:37:03Z","snapshot_observed_at":"2026-08-02T02:17:27.273861Z","submitted_at":"2018-10-03T02:10:16Z","title":"Learning Particle Dynamics for Manipulating Rigid Bodies, Deformable Objects, and Fluids","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.01566","snapshot_observed_at":"2026-08-08T22:55:57.770090Z","title":"Learning particle dynamics for manip- ulating rigid bodies, deformable objects, and fluids","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.770090Z"},"links":{"cited_paper":"/paper/1810.01566","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:9f0775536aff9167a8928325e6f74bf590960603d2a3455cb099166c9a5745ac","observation_id":"eed87c1b-9ad2-4a78-8ea8-d94ee031ff14","resolution":{"observed_at":"2026-08-08T22:55:57.770090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20280","last_updated":"2024-10-26T21:12:32Z","snapshot_observed_at":"2026-07-06T19:40:12.973874Z","submitted_at":"2024-10-26T21:12:32Z","title":"MarDini: Masked Autoregressive Diffusion for Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20280","snapshot_observed_at":"2026-08-08T22:55:57.775016Z","title":"Mardini: Masked autoregres- sive diffusion for video generation at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.775016Z"},"links":{"cited_paper":"/paper/2410.20280","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:123d9b68478a89bc13b10181315b311803817e536454f6d396c0668dd9412ed4","observation_id":"64c95c26-a4bf-4210-9e5b-e8b1d7145cfe","resolution":{"observed_at":"2026-08-08T22:55:57.775016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-08T22:55:57.780445Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual generation.arXiv preprint arXiv:2409.04410, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.780445Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:62c7283d415b0984f5910185f8b024caa205f457386b836d49e5d3adcef7f84b","observation_id":"05e7bb6b-2071-4bd2-af05-adeeb6be7418","resolution":{"observed_at":"2026-08-08T22:55:57.780445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.670838Z","title":"Interactive language: Talking to robots in real time","venue":null,"work_id":"7fb57336-9923-4200-9600-d26b8a8168cd","year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.785333Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:48bbbefe1571c59f6c22b03afb0be795c66d09a8725ea061b45507cc218e30b6","observation_id":"d5c93905-7735-4508-afaf-3bf8b26751cf","resolution":{"observed_at":"2026-08-08T22:55:58.675989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-08T22:55:57.790332Z","title":"What matters in learn- ing from offline human demonstrations for robot manipula- tion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.790332Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:45f66ffc6e882be290875d2d6f4c6dfcba6f9626d48288bda3a61f12605cdb7b","observation_id":"5984e104-c3e0-428d-b402-0f7f5e0584d6","resolution":{"observed_at":"2026-08-08T22:55:57.790332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.655512Z","title":"A mathematical introduction to robotic manipulation","venue":null,"work_id":"a3e9fed2-60ae-49a8-98de-11b8202f16fa","year":2017},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.795313Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:62d88fc684e3feded4a35368d700dfeb81a9fdf9f1a8656b80083044c2a79559","observation_id":"b34d408f-1b45-4612-8b75-6279c977ad70","resolution":{"observed_at":"2026-08-08T22:55:58.660319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.639684Z","title":"Visual reinforcement learn- ing with imagined goals","venue":null,"work_id":"fbad5add-61da-41db-b076-325617c9b002","year":2018},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.800397Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:746d68ef01a7055221b80d22c6452721b38a58a39886129e0f94f70412094c47","observation_id":"1f52d5dc-3e50-43b0-9476-f9a695ed62be","resolution":{"observed_at":"2026-08-08T22:55:58.644567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-08T22:55:57.805293Z","title":"Open x-embodiment: Robotic learning datasets and rt-x mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.805293Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:6fff151e8396b56d004c067bcc9d1392ddaf89133258d9c2dfb7553e55887a5c","observation_id":"dfdf6f05-9926-47a6-96c9-2c09ee242d80","resolution":{"observed_at":"2026-08-08T22:55:57.805293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:57.810479Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.810479Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:8ae5275299799703bc97ac557c300f1d6876d3ad071ea366b5d5720eefebd64f","observation_id":"33ea56b0-0278-47ad-b7f5-4a58cec84d07","resolution":{"observed_at":"2026-08-08T22:55:57.810479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:57.815261Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.815261Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:83cbfb2dea1a35c9dff8bf3b506d710470b4f1c63f55f1cfd6e69b97afc355fa","observation_id":"d984f113-f513-4c15-904c-819614b46387","resolution":{"observed_at":"2026-08-08T22:55:57.815261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.602005Z","title":"Language models are unsuper- vised multitask learners","venue":null,"work_id":"4c260bce-c780-49db-9c5c-1996a82ca95d","year":2019},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.820269Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:1c500f8238cea5f69d002099ebf280da334c75146b9a78e7061435ae9c6d56c6","observation_id":"90f431d4-78ab-4852-9e7b-a78e8e8a6724","resolution":{"observed_at":"2026-08-08T22:55:58.607498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19469","last_updated":"2024-02-29T18:57:37Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:57:37Z","title":"Humanoid Locomotion as Next Token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19469","snapshot_observed_at":"2026-08-08T22:55:57.824776Z","title":"Humanoid locomotion as next token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.824776Z"},"links":{"cited_paper":"/paper/2402.19469","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:e4bb786d952ee7ed79288edc62cc6649f03dfc6bfc9ef1d220be93b112f4b8a2","observation_id":"8d8b08bb-27d4-4951-9f9c-a602563fdc6b","resolution":{"observed_at":"2026-08-08T22:55:57.824776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12822","last_updated":"2024-11-24T19:37:04Z","snapshot_observed_at":"2026-07-06T19:34:46.714277Z","submitted_at":"2024-10-01T13:48:31Z","title":"AVID: Adapting Video Diffusion Models to World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12822","snapshot_observed_at":"2026-08-08T22:55:57.830074Z","title":"Avid: Adapting video diffusion models to world models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.830074Z"},"links":{"cited_paper":"/paper/2410.12822","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:f34ea5e6f49b7f8270858c3c117b5d617b82d1b2fb9455cf0ad589e2501cd83b","observation_id":"7cd095c2-1773-40dc-a1b0-6d06f41df856","resolution":{"observed_at":"2026-08-08T22:55:57.830074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.584756Z","title":"Masked world 10 models for visual control","venue":null,"work_id":"55d4878b-aa19-414c-97f2-434c12b81ce8","year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.835040Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:c54348d0c6a322890428274225575843640ff005e35f2e5e00d448bdce2c594f","observation_id":"1c39d4ec-d16a-45c5-9098-1eb97df77d9e","resolution":{"observed_at":"2026-08-08T22:55:58.589820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-08T22:55:57.839753Z","title":"Outra- geously large neural networks: The sparsely-gated mixture- of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.839753Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:45121efee84779004a5aeecf4ad4d4fd8459024380172941e8218e2b8fbcfea4","observation_id":"720dd5a6-1693-46d4-87fc-3f9b19217887","resolution":{"observed_at":"2026-08-08T22:55:57.839753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-08T22:55:57.844717Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.844717Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:821777887a593aee5a2c1c362160f4465fcdfc651669f9bd2058cac7f30042d5","observation_id":"bb60951a-04a2-4ed7-8f79-e46d2450070d","resolution":{"observed_at":"2026-08-08T22:55:57.844717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-08T22:55:57.849425Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.849425Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:ab8e90294671f88635f3bed1fb833408a54f661a8751296ecacc8a639b3ab636","observation_id":"a309b45c-ebfa-44fc-90fd-43ae68cfb4bf","resolution":{"observed_at":"2026-08-08T22:55:57.849425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-08T22:55:57.854361Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.854361Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:d9ab1bd3a54ed5ed29adf6716ba985051927cf04df6e8ccc57b6b92f37ef3103","observation_id":"08783b4e-8ccb-4b41-aca8-4fc9536a8368","resolution":{"observed_at":"2026-08-08T22:55:57.854361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.569135Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"93203b72-2d31-4e65-a6e8-a1a7ebf85b87","year":2012},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.859358Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:6a5065515edfafe7b70b439abe0d63568534b90d6db9c7c8c8cb67fd1d10bb41","observation_id":"15eba4ce-c618-4561-aba5-c710e09dd1dd","resolution":{"observed_at":"2026-08-08T22:55:58.574622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-08T22:55:57.864064Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.864064Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:a16db03c835e2a2420fb8f2d08b371405a93c11ad6704df27f31d54dfc6c8b5c","observation_id":"43fb186a-a882-43e1-8754-2a00b0ff9151","resolution":{"observed_at":"2026-08-08T22:55:57.864064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.553349Z","title":"Diffusion models are real-time game engines, 2024","venue":null,"work_id":"031202bd-68cf-4384-99f3-04c5e3bd7178","year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.869585Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:e3df25e61c1a667971ea5222d4c346230912b6d582911afa43587b186572469f","observation_id":"1bfadba5-4eb0-4fcd-a10d-b97cd2f89854","resolution":{"observed_at":"2026-08-08T22:55:58.558481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20537","last_updated":"2024-09-30T17:39:41Z","snapshot_observed_at":"2026-08-06T05:51:58.189896Z","submitted_at":"2024-09-30T17:39:41Z","title":"Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20537","snapshot_observed_at":"2026-08-08T22:55:57.874952Z","title":"Scaling proprioceptive-visual learning with heterogeneous pre-trained transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.874952Z"},"links":{"cited_paper":"/paper/2409.20537","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:7bc0dcc05a5bdd2d18d7615aeb75316cfc1468dfde1640f3f33e9059daa2018a","observation_id":"3d038d4e-6e15-477e-a971-e97cda0895f2","resolution":{"observed_at":"2026-08-08T22:55:57.874952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.535425Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"9dc29751-b292-4bbc-9c0c-93c15394b66b","year":2004},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.880305Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:b146f0fa33c7f790531113fd4fd7986030b8ff5847f0cd556b8fd3be6c487eef","observation_id":"9b3e77d6-48aa-40c7-a8bd-f076d879bff8","resolution":{"observed_at":"2026-08-08T22:55:58.540714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-08T22:55:57.885107Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.885107Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:d4abe5c0fcebe132caafd721d7aa74b48a79e375606d2783cff4e301290447be","observation_id":"d732df23-9454-40e7-b4ec-9883a72a9547","resolution":{"observed_at":"2026-08-08T22:55:57.885107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-08T22:55:57.890709Z","title":"Learn- ing interactive real-world simulators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.890709Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:91a2ea3ac39e11a0651edf88458ab01be5ede3fef3bc460074fc28cd91c09888","observation_id":"8cfd79ea-b2fc-4cbe-b8af-873e6cfcb84f","resolution":{"observed_at":"2026-08-08T22:55:57.890709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-08T22:55:57.895995Z","title":"Latent action pretraining from videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.895995Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:a877bc765e03e69b53ff3e6f69dbec82dad013c844466c738b3920331411c1dc","observation_id":"4bc6a08b-65f6-42cf-82cf-61b18de569f7","resolution":{"observed_at":"2026-08-08T22:55:57.895995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.518933Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta rein- forcement learning","venue":null,"work_id":"2ab1cb3e-63aa-46e6-bd71-e60402e8e20a","year":2020},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.901611Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:338a9204db8f2eaafa5561a53eed57a0141dce5604d2eafb1e80c754500fffb7","observation_id":"47ba9072-eef3-48c2-a631-19a51bc3b2b4","resolution":{"observed_at":"2026-08-08T22:55:58.524098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11550","last_updated":"2023-02-22T18:47:51Z","snapshot_observed_at":"2026-08-05T16:16:51.134330Z","submitted_at":"2023-02-22T18:47:51Z","title":"Scaling Robot Learning with Semantically Imagined Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11550","snapshot_observed_at":"2026-08-08T22:55:57.907557Z","title":"Scaling robot learn- ing with semantically imagined experience","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.907557Z"},"links":{"cited_paper":"/paper/2302.11550","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:36a9344df830a3444238c5d5aa6fb57b9281145dad78d3652ef59ce4216ff542","observation_id":"976e11c8-4181-49ac-9b3f-8f98e4514e27","resolution":{"observed_at":"2026-08-08T22:55:57.907557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13877","last_updated":"2021-04-28T16:48:44Z","snapshot_observed_at":"2026-08-05T16:11:31.400533Z","submitted_at":"2021-04-28T16:48:44Z","title":"Autoregressive Dynamics Models for Offline Policy Evaluation and Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13877","snapshot_observed_at":"2026-08-08T22:55:57.913251Z","title":"Autoregressive dynamics models for offline policy evaluation and optimization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.913251Z"},"links":{"cited_paper":"/paper/2104.13877","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:fb8c23152009dd85cd165cf03133cf927958fb07822244ab317294c76af737a0","observation_id":"2ea71d83-f38b-4be7-a2e4-9c0c625b6760","resolution":{"observed_at":"2026-08-08T22:55:57.913251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:57.918696Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.918696Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:6fdb75a1c90c39c62685a8c2a8098da81a7d62ab66254737ef5a6f8c2c046349","observation_id":"39ef3873-6159-4d68-8e44-1a391d9000f0","resolution":{"observed_at":"2026-08-08T22:55:57.918696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-08T22:55:57.923725Z","title":"Learning fine-grained bimanual manipulation with low- cost hardware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.923725Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:d71beca4429eb76d144b1069ff87a581f87a9586bf715d8f3e01ff3c84939cf1","observation_id":"e818c381-a38c-40c6-9de4-a00cc4f73f37","resolution":{"observed_at":"2026-08-08T22:55:57.923725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:55:58.490310Z","title":"Nerf in the palm of your hand: Corrective augmentation for robotics via novel-view synthesis","venue":null,"work_id":"666f784d-3388-4778-ab45-76a44c07e1f6","year":2023},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.928719Z"},"links":{"citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:6d4606dc7ced568ee18716d211e891720ee4b3b34f7baa6ea7a802e501b3c47e","observation_id":"61d69ff7-08ca-4038-b73b-6ecb25b916db","resolution":{"observed_at":"2026-08-08T22:55:58.497511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14540","last_updated":"2025-07-29T16:48:03Z","snapshot_observed_at":"2026-08-06T20:16:51.288291Z","submitted_at":"2024-06-20T17:50:16Z","title":"IRASim: A Fine-Grained World Model for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14540","snapshot_observed_at":"2026-08-08T22:55:57.933399Z","title":"Irasim: Learning interactive real- robot action simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.933399Z"},"links":{"cited_paper":"/paper/2406.14540","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:850aac18f2a8b4bf329f137cd91cf008027b3b0bdc526ff75774d1c7a8c6b04e","observation_id":"fece0194-6667-44f9-ab8a-e4c2e3c2b6e3","resolution":{"observed_at":"2026-08-08T22:55:57.933399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 9 inbound Pith citation observations for arXiv:2502.04296."}