{"as_of":"2026-08-05T03:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0db4316016579a84e49774d402a1223be8a9a6962d9fba30a66dceeb2631e09","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T17:02:00.653422Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:35:27.766844Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09056","snapshot_observed_at":"2026-08-01T06:35:27.766844Z","title":"Millivid: Hierarchical latents for long-range con- sistency in video generation.arXiv preprint arXiv:2606.09056,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21848","last_updated":"2026-07-27T16:34:17Z","snapshot_observed_at":"2026-08-01T06:35:27.013428Z","submitted_at":"2026-07-23T22:33:52Z","title":"Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T06:35:27.766844Z"},"links":{"cited_paper":"/paper/2606.09056","citing_paper":"/paper/2607.21848"},"observation_digest":"sha256:53c1d8887e6abb025f1b62d6c128e77404ed25d9c327b18421232d389fe4c864","observation_id":"c7148221-6191-4380-a24c-d480d8bd8f3b","resolution":{"observed_at":"2026-08-01T06:35:27.766844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.09056/citation-record","integrity":"/paper/2606.09056/integrity","json":"/paper/2606.09056/citation-record.json","paper":"/paper/2606.09056"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.24527","last_updated":"2025-09-29T09:42:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T09:42:27Z","title":"Training Agents Inside of Scalable World Models","version":1},"cited_work":{"arxiv_id":"2509.24527","doi":"10.48550/arxiv.2509.24527","metadata_source":"pith","pith_arxiv_id":"2509.24527","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Agents Inside of Scalable World Models","venue":"cs.AI","work_id":"f0464a07-aaee-486f-a0b1-a4bce0bbc3e4","year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2509.24527","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:21851edeeecf531188bbd88f521b0bc3d2fac598ac553577f717371334c5c652","observation_id":"f47289aa-6f9c-4f82-ac21-b042f51c7500","resolution":{"observed_at":"2026-07-03T00:47:30.427236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Learning universal policies via text-guided video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:5e4355dad5cdbe95bb68e493f351182492a3342ddc4fed8be7fcc8910e01f7d4","observation_id":"0d8e16a4-fb01-4229-bfa6-bc629d1a78d8","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"This&that: Language-gesture controlled video generation for robot planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:47ccafb4db6d0801e85ef698256cf86434e9d81d5213f835de9a75fbe9ecb2cb","observation_id":"f0169db3-0d8c-4ef7-82f5-eb3ee09f3604","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":"2602.15922","doi":"10.48550/arxiv.2602.15922","metadata_source":"pith","pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Action Models are Zero-shot Policies","venue":"cs.RO","work_id":"9a85fc69-74df-450e-94cd-69d186e9e830","year":2026},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:6c9e1a65e4662413dd85a67dd6cd680981e98484808df73fa0ff2c680e899253","observation_id":"bcd9fac4-4af7-4e5d-ba3c-96f5e4dd754d","resolution":{"observed_at":"2026-07-03T00:47:30.460210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15840","last_updated":"2026-05-08T06:37:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:35:54Z","title":"Large Video Planner Enables Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":"2512.15840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15840","snapshot_observed_at":"2026-07-10T18:47:31.628749Z","title":"Large Video Planner Enables Generalizable Robot Control","venue":"cs.RO","work_id":"6f56b125-35ab-41da-aa0c-d118d706bf3a","year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2512.15840","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:ad344d7308e9bfb13e0c6601c5bee525031ea872fd2d08ea4122e615df64897c","observation_id":"fe334e7c-d071-4f06-89a3-8155dc657067","resolution":{"observed_at":"2026-07-03T00:47:30.450018Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.06679","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:43:53.830454Z","title":"MultiGen: Level-design for editable multiplayer worlds in diffusion game engines","venue":null,"work_id":"b063216a-4f9b-4d07-a671-1e59754eda4b","year":2026},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:39dbe58fe3b6445029f38879f3f97272bef47cfeb10597203d629ba62663f0e7","observation_id":"0bc49282-13ae-413e-ba86-7f11089a1b42","resolution":{"observed_at":"2026-07-03T00:47:30.453958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Frame context packing and drift prevention in next-frame-prediction video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:2e011925f656d49fb92225f54554cda165c2720c48fe23a990c4049a474b244c","observation_id":"82c2a28a-f466-4646-b1ea-1680c92c56ab","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Learning long-context diffusion policies via past-token prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:62f1e00b492a0501ec57e5f57266bc5c97e64904ea3e4a55c66e13f35eb24547","observation_id":"089d6123-5910-4c8f-9a78-c761fcff8371","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, page 02783649241273668, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:69710ab7f90ff834957fba2612c34460433f64e93f8305d5cc29a2a8c958fd4d","observation_id":"045a6483-0c16-48fd-ad82-2a4cac865d67","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2023.xix.016","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":null,"work_id":"21c72e60-7b0d-4b8b-a3d2-dcb077b14621","year":2023},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:e5f80eae4a2374886274dd1aae8e6a8c184923550e0aa6220a163440b54d6b37","observation_id":"df3062fd-4979-4e49-82c7-1e6a5ee2ac6d","resolution":{"observed_at":"2026-06-27T17:11:05.760465Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:20:20.028931+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:20:20.028931+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Flextok: Resampling images into 1d token sequences of flexible length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:f47674f0e6cfd52d10f32d0c6c1e0b1441d97df9f79c0e14f10ccd32eabe20f1","observation_id":"c93c1329-634a-49ce-83fd-ef9d8b186e41","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:2e208faee2dfd11ae5fe0c835d58ec7226aa6f2c5aec43d15ae12d337814dcb9","observation_id":"875037fc-3a2a-44bd-ac43-31e0b6813406","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.21058","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:59:42.121465Z","title":"Mixture of contexts for long video generation.arXiv preprint arXiv:2508.21058","venue":null,"work_id":"b800ec2a-ab41-48e3-a98d-a26b4942bb2a","year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:d9f6fdb3e9d5293ea68af10997dab7b7d7ed8ea77e8b14afb26530c01b70a70b","observation_id":"7c4cb584-b02d-4e62-b221-c2accc2e05fd","resolution":{"observed_at":"2026-07-03T00:47:30.408820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:4ebdc2f42d27fe61cb12b54244d7761856cabb1f41b7170430fe14ab13bc958a","observation_id":"45330447-f80b-4173-8445-0a566a204182","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.12369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:19:13.356094Z","title":"arXiv preprint arXiv:2504.12369 , year=","venue":null,"work_id":"7159175f-77a7-43d9-8dc3-54bda91b0e0b","year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:8fb09bf703000e84a5a341e37f808bf4904759632bc5ff9c82057db6bea09ced","observation_id":"63fd7692-19b0-4626-a58a-4c22209de6ea","resolution":{"observed_at":"2026-07-03T00:47:30.405399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08995","last_updated":"2026-04-13T03:48:38Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:00:09Z","title":"Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory","version":2},"cited_work":{"arxiv_id":"2604.08995","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08995","snapshot_observed_at":"2026-07-09T07:56:04.713905Z","title":"Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory","venue":"cs.CV","work_id":"03ae1098-067d-4fea-90da-4ace0a031a03","year":2026},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2604.08995","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:30ef61603ff2b5c27896b675ad79150171a4371910fd335dbd322b9f8ce2d867","observation_id":"f90d23a8-731d-46cc-be89-3482a25d096e","resolution":{"observed_at":"2026-07-03T00:47:30.419199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.24718","last_updated":"2026-04-09T20:07:12Z","snapshot_observed_at":"2026-07-06T22:34:18.297603Z","submitted_at":"2025-10-28T17:59:58Z","title":"Generative View Stitching","version":3},"cited_work":{"arxiv_id":"2510.24718","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.24718","snapshot_observed_at":"2026-07-03T00:47:30.419777Z","title":"Generative View Stitching","venue":"cs.CV","work_id":"0d578880-4101-4335-993e-85a0144c5434","year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2510.24718","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:4a92aa8acadb7ae3088a1e5462913dbf905a4880efbbe20dbd0387c130e2a84b","observation_id":"1f486410-4457-4106-9ae6-3bbeadde44af","resolution":{"observed_at":"2026-07-03T00:47:30.421239Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.03482","last_updated":"2026-06-03T14:11:45Z","snapshot_observed_at":"2026-08-03T10:56:32.675561Z","submitted_at":"2026-03-03T19:58:31Z","title":"Beyond Pixel Histories: World Models with Persistent 3D State","version":2},"cited_work":{"arxiv_id":"2603.03482","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.03482","snapshot_observed_at":"2026-07-03T00:57:29.725751Z","title":"Beyond pixel histories: World models with persistent 3d state","venue":"cs.CV","work_id":"5a236ba1-904c-496c-b481-b53287062b70","year":2026},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2603.03482","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:57b735e9001cc02fb40897c95d51cfacc053132dfbcb53eaf546d79f5d85a399","observation_id":"3d81df46-d655-4fe2-a011-da6d5a8ee881","resolution":{"observed_at":"2026-07-03T00:47:30.415940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:47:41.299641Z","title":"Mem- ory forcing: Spatio-temporal memory for consistent scene generation on minecraft","venue":null,"work_id":"9d614233-f030-4526-bac0-e91d5c9ab88c","year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:6ccd3ef53eede32dde0c37988aff28642ff05250aaedd85f7785ae65d2d6bc20","observation_id":"9a8f2bc2-0de0-4d42-a5b0-8834ba0cecf4","resolution":{"observed_at":"2026-07-03T00:47:30.424978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"principal components","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:aa123eae1980135c52c7a86beb84173439a654598205e104effc2487e94c45e8","observation_id":"096e2e45-3da7-4072-94db-817765a6fb77","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:47:30.429572Z","title":"Detailflow: 1d coarse-to-fine autoregressive image generation via next-detail prediction.arXiv preprint arXiv:2505.21473, 2025b","venue":null,"work_id":"ba0fec0b-29d8-49de-a5d3-67d7c8667c36","year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:0e027caaf063fe90b8713b07785465c0c02a5ddfda57129ed2b9a22e12238785","observation_id":"5a61f97b-6c7b-4e63-a98a-81b65ab2c3b1","resolution":{"observed_at":"2026-07-03T00:47:30.431375Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Elastictok: Adaptive tokenization for image and video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:59fa56e8cd3193ff8608a5873b8f9bf9be14b954d70402deaeb86ece41e386c9","observation_id":"f7587fd6-656c-44c2-b173-2315bf639e53","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Scenetok: A compressed, diffusable token space for 3d scenes.CVPR, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:ef057e8012dafa04666a942254be9bf78f7f5e50e4fc19c256d403add84df9ac","observation_id":"2ffae357-cc5f-49a2-8658-c49e05810e67","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12887","last_updated":"2026-04-14T15:37:30Z","snapshot_observed_at":"2026-07-06T23:01:00.830207Z","submitted_at":"2026-04-14T15:37:30Z","title":"VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization","version":1},"cited_work":{"arxiv_id":"2604.12887","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12887","snapshot_observed_at":"2026-07-03T00:47:30.426505Z","title":"VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization","venue":"cs.CV","work_id":"8bcf2f0a-8ea6-4b9d-8950-dc090f845ead","year":2026},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2604.12887","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:74e685f52c4b0bc7cdd7cbd1fafbdd4effb81d02c805dcba02dcf25b501af253","observation_id":"074c408d-0a55-4863-96bd-d87011695396","resolution":{"observed_at":"2026-07-03T00:47:30.428152Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:47:30.407908Z","title":"Evatok: Adaptive length video tokenization for efficient visual autoregressive generation","venue":null,"work_id":"0e58f9d0-5e0a-45d3-95c4-9398036d5845","year":2026},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:c3d618ae3022f7bba5527ab31cd7c235b95547c96284cca81a45341e85a6dfff","observation_id":"8d85ecb1-d1cc-4715-b7d4-32acec2f846b","resolution":{"observed_at":"2026-07-03T00:47:30.409437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"FlexTok: Resampling images into 1D token sequences of flexible length","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:36993406fa2bb50a6518b81b33c00a1b78822e09be1a52e9c469e5908ebdb104","observation_id":"f2f636ea-8dbb-4a4b-bdda-44b2f4525d37","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"URL https://proceedings.mlr.press/v267/bachmann25a.html","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:1bc61d3113a412bca01cd4f1131dcf296bf932728d5142a12577d0504c1ee723","observation_id":"da819839-37e7-47fa-b070-c8c126e40ed3","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Matryoshka representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:14040e2dbb363139e137b71e31828dd483d91d8ef62ba467f060551d41769baa","observation_id":"5bcc1308-3c43-4f1f-ac3d-0044074402c4","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Freeman, Antonio Torralba, and Phillip Isola","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:83f5538ac4532b21ade88e23bc0b975987d2aaf36947dfff43e083835a64b0f3","observation_id":"9429f2aa-b4b0-48a7-a76c-d2050db20bc1","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Nvae: A deep hierarchical variational autoencoder.Advances in neural information processing systems, 33:19667–19679, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:ae0e8895c196bd620ea9ae88b567223df133a195fca7900799ef91baa8d988d8","observation_id":"23153c77-6250-406e-a2a7-337798229e1d","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Cascaded diffusion models for high fidelity image generation.Journal of Machine Learning Research, 23 (47):1–33, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:984cc0ae905fdf6a1da9e8d47431f8aeef35912da98c1ee884ce280a9527e278","observation_id":"54ea6e5a-6926-4056-b617-d8481ccc6f69","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:47:30.410635Z","title":"Scale space diffusion","venue":null,"work_id":"a2baa396-3d89-4269-a6f7-5d0c797e5275","year":2026},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:a78544378d4eebc8956a71171d71251df8fb3f2e06fe9c3c1cc161d10f24b42d","observation_id":"faa1e0b2-eb73-42c4-a045-d7fce97252ec","resolution":{"observed_at":"2026-07-03T00:47:30.412636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07126","last_updated":"2024-11-11T16:58:31Z","snapshot_observed_at":"2026-07-06T19:48:32.368124Z","submitted_at":"2024-11-11T16:58:31Z","title":"Edify Image: High-Quality Image Generation with Pixel Space Laplacian Diffusion Models","version":1},"cited_work":{"arxiv_id":"2411.07126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07126","snapshot_observed_at":"2026-07-03T00:47:30.400558Z","title":"Edify image: High-quality image generation with pixel space laplacian diffusion models","venue":null,"work_id":"e07c55c7-533e-4182-9a44-b5440d29a1f4","year":2024},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2411.07126","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:1cd5ef5cd01b739c61ef755db5a0829047d8b687ce28bbb1bd61e307ede0b9d9","observation_id":"b37ef80a-e564-4020-8157-249a188c01bc","resolution":{"observed_at":"2026-07-03T00:47:30.402374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:00589c2380f99458f32355a7480144fcbb6fa2aa378ca364cd56dfc7f06b3b7d","observation_id":"9b7e6a7f-eb97-4ff9-8d65-cbd5f6ff3db5","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:923c258d18bfbd9304a989629033ddaeff9f3f6812b98448f2cf8b742800c552","observation_id":"8316e6e5-e662-4c04-987d-24caa28df62c","resolution":{"observed_at":"2026-07-03T00:47:30.437515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":"2311.04145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-07-04T14:59:56.012796Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","venue":"cs.CV","work_id":"aa5d5317-9965-4f23-ba7e-8e2941e66385","year":2023},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:43d3a62c27fe139b008991c49a40d95e2083391e56768d4eb4b0007dc3e334d9","observation_id":"af85bd12-c53f-4ebb-83f0-970edf9eb28f","resolution":{"observed_at":"2026-07-03T00:47:30.430037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.05954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:07:43.037042Z","title":"Pyramidal flow matching for efficient video generative modeling.arXiv preprint arXiv:2410.05954","venue":null,"work_id":"86ba3b09-fc7d-4d26-acce-10677e0b5d69","year":2024},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:40bfcec4af1687c2a1f307a836ef3ad2a69cbd0dff291a10041594cd24dd8a6b","observation_id":"8da4ef78-d414-430e-89a5-b6809171487e","resolution":{"observed_at":"2026-07-03T00:47:30.360506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02396","last_updated":"2023-05-31T20:19:01Z","snapshot_observed_at":"2026-07-06T14:00:01.450718Z","submitted_at":"2022-10-05T17:15:10Z","title":"Temporally Consistent Transformers for Video Generation","version":2},"cited_work":{"arxiv_id":"2210.02396","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.02396","snapshot_observed_at":"2026-07-03T00:47:30.364831Z","title":"Temporally consistent transformers for video generation, 2023","venue":null,"work_id":"4564ef7a-f656-41a3-a6e0-95268e448e78","year":2023},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2210.02396","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:09f3169867be84a18a4a8c285ee370715cd3ec451592731a4c11adc7ea1b0aeb","observation_id":"d0ecf583-df66-448f-9d11-4f7b4304ff5a","resolution":{"observed_at":"2026-07-03T00:47:30.366762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":"2503.19325","doi":"10.48550/arxiv.2503.19325","metadata_source":"pith","pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","venue":"cs.CV","work_id":"9700bbdc-df42-461a-81fa-b29ffe683326","year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:47f2970994cae9e6691197bcc1db5c28808100d34adf16e5dcf8ad40d1ab723b","observation_id":"bfa87f58-3f01-4f2a-a30c-069eac569ddc","resolution":{"observed_at":"2026-07-03T00:47:30.424369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"The unreasonable effectiveness of deep networks as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:9a24e90f9b04be7b8cbbc57dac221565507553ed2b399e4f3e1d80532c892b4e","observation_id":"b80a58f5-4706-4241-b4b5-4437c12c2e38","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":"1705.06950","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-09T11:16:11.423695Z","title":"The Kinetics Human Action Video Dataset","venue":"cs.CV","work_id":"c8a3de61-cfd3-4aeb-bcf7-a0372c015748","year":2017},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:5b58fd1161f3411a04ae4e60a7104b3229790442937f14d3f1d25d7665a037a6","observation_id":"492a9bb9-876f-44a9-bf70-ce56a12c00ec","resolution":{"observed_at":"2026-07-03T00:47:30.434720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09817","last_updated":"2018-05-24T17:58:02Z","snapshot_observed_at":"2026-07-06T06:41:05.545426Z","submitted_at":"2018-05-24T17:58:02Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","version":1},"cited_work":{"arxiv_id":"1805.09817","doi":"10.1145/3197517.3201323","metadata_source":"pith","pith_arxiv_id":"1805.09817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","venue":"cs.CV","work_id":"f6abb68f-df5c-4569-af1b-9ede43a44468","year":2018},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/1805.09817","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:71184c2321a1f3ecab986b53a08123719ef98a279ed6b0901e6fd2980ba6d2d8","observation_id":"77b1492e-3e53-45ba-8a81-f069606b81be","resolution":{"observed_at":"2026-07-03T00:47:30.399513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Infinite nature: Perpetual view generation of natural scenes from a single image","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:ad5decf130c4ac8c096d9a2d1c0984083ca551a994b8f4632ce13b214a4d8d7d","observation_id":"7fd7c07e-7103-4774-a241-0ed2887d4071","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:e7ff86ba5324e162e5bb19493d9e535bad6fb4f60610b5c56dfea7fa4a03210e","observation_id":"4d6a99b3-7a38-4b33-9d4d-f11d2cb24485","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:a8a683fc6917bf62feb35a1f3875d0f4b484210192c7be4a29f2516ee09618b8","observation_id":"8f7ca1cf-7c57-42eb-80b6-a512d2202d21","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Sturm, N","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:d6bdbae873d74e515e5292a6e7df56495f66e699a78ad9939e88c248bc7a740f","observation_id":"bd48b375-861b-47e5-8ad5-63d65f5a9e1b","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10079","last_updated":"2021-01-19T07:47:28Z","snapshot_observed_at":"2026-07-06T07:47:41.035333Z","submitted_at":"2019-04-22T22:18:37Z","title":"The MineRL 2019 Competition on Sample Efficient Reinforcement Learning using Human Priors","version":3},"cited_work":{"arxiv_id":"1904.10079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.10079","snapshot_observed_at":"2026-07-03T00:47:30.355469Z","title":"The MineRL Competition on Sample Efﬁcient Reinforcement Learning using Human Priors","venue":null,"work_id":"0993403e-0928-436c-b0a9-918184b3d82e","year":1904},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/1904.10079","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:ba203d90770bc570ef3784b488809d946bacfa8e563169744848b1bfdc50e8f4","observation_id":"adce8110-474e-48a9-92be-15b2d874f841","resolution":{"observed_at":"2026-07-03T00:47:30.357339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.10704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:47:05.844751Z","title":"Error analyses of auto-regressive video diffusion models: A unified framework","venue":null,"work_id":"784ecf0d-4ab1-47b6-8028-e930b78348f3","year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:eb113d1e8768e8f4359fdccd105546c6a0002dd9766b9c9441d57de691cf1eb9","observation_id":"1e581e3b-5f77-4533-a68a-9b37b7d16365","resolution":{"observed_at":"2026-07-03T00:47:30.418424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE transactions on image processing, 13(4):600–612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:9ba928311601a437560519a9b22cc3407722994cd9377e48dc69eb27909eb757","observation_id":"3d83eef6-5f5b-457b-9b3b-b0e106a30069","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:51787d0f966998f234217aab1f351a9f6671a714479cd90278ed2056919012e3","observation_id":"11e2b6ca-4635-44e0-b351-e55090f2707f","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"LightGlue: Local Feature Matching at Light Speed","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:7144111a48c3513b4b39105609ea3c8acfa092e2a8bbab7c8af430cdbbc5b647","observation_id":"1a6935ed-bdfe-4c87-8ed3-10cc2f752420","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Barron, Sofien Bouaziz, Dan B Goldman, Steven M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:e8eeffb7c343631ed1da5ef3403bb1a381aeae0588691214c222f3dfb037cb79","observation_id":"175ddf44-f465-4cf2-8b78-5ed83656852d","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:2a4d677e6ebb59eeac4d6038c9d8076dc42b08a7529502692f3e80a73d6753c1","observation_id":"62c3d5d8-4278-49d1-9319-4dbb262f7d7e","resolution":{"observed_at":"2026-07-03T00:47:30.440460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:fa5ab19e10e1393fa78c72c58e5e3c99a5ea7b942a077664cba1efce05a4c32c","observation_id":"919b46fb-b113-4f5e-8719-4343887c53f9","resolution":{"observed_at":"2026-07-03T00:47:30.463371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":"1912.01703","doi":"10.1109/92.335012","metadata_source":"pith","pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","venue":"cs.LG","work_id":"c30b6d2c-7bb4-4ab0-8ef8-2015313610a9","year":2019},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:c971fbb3963353759c2d5c06bdf45c690c37b8bb89d2c1ee2cecf96f3ea3fe32","observation_id":"6518ef03-91d0-4ed1-a6f8-c3624bb84a9e","resolution":{"observed_at":"2026-07-03T00:47:30.443397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:cba35e25bc4076eae151ea957c8315964fb4b73ee191f9db5f7f8b70468371f7","observation_id":"1804aad7-a0ad-4b03-a454-d1a928ae33cd","resolution":{"observed_at":"2026-07-03T00:47:30.388391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":"1706.03762","doi":"10.1186/s13550-021-00830-6","metadata_source":"pith","pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention Is All You Need","venue":"cs.CL","work_id":"baafb5a2-5272-43bc-932f-09fa9ffe5316","year":2017},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:32cf63c08b41d30b0012bc68701e44c0f13d8e5f1a6dcc62c2669848733f2585","observation_id":"479dd018-ea2a-47df-aa7f-31e581ffc960","resolution":{"observed_at":"2026-07-03T00:47:30.375430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-07-31T02:35:46.853381Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":"2111.06377","doi":"10.48550/arxiv.2111.06377","metadata_source":"pith","pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Masked Autoencoders Are Scalable Vision Learners","venue":"cs.CV","work_id":"0747476e-5bd0-4596-908f-391611d9364e","year":2021},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:bbee21c1deead6eded21feb898c37c63ad6cdfd3c0124c8eb454b6f86afe426e","observation_id":"aad9367e-6ac7-43ea-b643-17fcb56a4d9e","resolution":{"observed_at":"2026-07-03T00:47:30.457351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:44.938872+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:44.938872+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:a3f93a15fa3981d633c63eef7de319fe35eac6ae12d56b2875ebcee130745913","observation_id":"e49c7320-dbed-4c64-be6a-8e2de71604fa","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:55d9375db5bb9d740fda8d0a0a2a391cf8fa671f6dc6b06d2c2682335335d3f4","observation_id":"b5015fc7-2932-45fa-ba92-20f4971d1f32","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:ac4e9c004d5507452bceaac4c04af3d419d4d4e46b5d26cc7039e5c19a873e0b","observation_id":"ba9ac8f8-a673-4684-ad91-39d90e9c381d","resolution":{"observed_at":"2026-07-03T00:47:30.443698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.03585","last_updated":"2015-11-18T21:50:51Z","snapshot_observed_at":"2026-07-06T04:11:47.439779Z","submitted_at":"2015-03-12T04:51:37Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermodynamics","version":8},"cited_work":{"arxiv_id":"1503.03585","doi":"10.48550/arxiv.1503.03585","metadata_source":"pith","pith_arxiv_id":"1503.03585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermodynamics","venue":"cs.LG","work_id":"986277c3-5997-4593-942c-17cdec737a72","year":2015},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/1503.03585","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:ea1a4c8c8d64946cf0950b550cac65fa57a13d34d7d9ea492af92f23fbdfac4a","observation_id":"6824112d-8574-4202-b4ca-e4784628d922","resolution":{"observed_at":"2026-07-03T00:47:30.446991Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:21:00.213109+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:21:00.213109+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:db44fe7ba486a35e5c86f9471cd3031bda359e5500a6d4328330c3cee03cee49","observation_id":"bed35524-43f0-41a7-a33e-ba17b802af53","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2202.00512","doi":"10.48550/arxiv.2202.00512","metadata_source":"pith","pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","venue":"cs.LG","work_id":"fd04f498-ff85-4de3-bcc7-31ef072b2ceb","year":2022},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:faef2fdb9af66625d7a2c2c9364e9d7a8bf2de542711178e98dc01ea02420926","observation_id":"07269df5-8a7a-46bb-b081-061060cc3140","resolution":{"observed_at":"2026-07-03T00:47:30.375203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"simple diffusion: End-to-end diffusion for high resolution images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:b6a0fc19e0eb308e56602a2b75b1ed877f8f84877b07b2fe08be4da9b4719f37","observation_id":"1c7275d6-4865-42e6-94b7-6a01670eb0f4","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:38557b23451f817ee4352bd0dc6efb565d088cb17dccb68766bbb6ad0fcf0433","observation_id":"8928406b-b811-42f9-b459-da724c3135a4","resolution":{"observed_at":"2026-07-03T00:47:30.378471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:26ed6d307caa082cfef664fc559d8a3c5a5e6b2c315e4a298b02908e0c33afeb","observation_id":"3b02e592-79a3-4c30-bd4d-7a6e869aba17","resolution":{"observed_at":"2026-07-03T00:47:30.369354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:02:00.653422Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion.Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:dcec3ec97ac5524fda59d4c2435fba47f87c4eb0c316e99ee5d73acde3313694","observation_id":"d8ced1e8-b133-4b53-8955-1e04d44b1e76","resolution":{"observed_at":"2026-06-27T17:02:00.653422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-07-06T16:40:28.142296Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2310.19512","doi":"10.48550/arxiv.2310.19512","metadata_source":"pith","pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","venue":"cs.CV","work_id":"4d4486c5-6317-4d8d-bb5b-3b100d732a83","year":2023},"citing_paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T17:02:00.653422Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2606.09056"},"observation_digest":"sha256:9f26bb130ee853f7823ce74f0ae9f72f9e97c1c8b919d9061d87c3b898a06d18","observation_id":"3afad763-004b-448f-a669-eb90c4f3952d","resolution":{"observed_at":"2026-07-03T00:47:30.385025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.09056","last_updated":"2026-06-08T05:46:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:46:01Z","title":"MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":32,"verified_exact":33,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 1 inbound Pith citation observation for arXiv:2606.09056."}