{"as_of":"2026-08-15T03:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df3706c5567c9fe23e979679c08559f47d6ffc27a5cbd40adb64e28a978e1460","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:16:07.560939Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.13556/citation-record","integrity":"/paper/2608.13556/integrity","json":"/paper/2608.13556/citation-record.json","paper":"/paper/2608.13556"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-14T04:16:07.419865Z","title":"Cosmos world foundation model platform for physical ai.arXiv preprint arXiv:2501.03575,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.419865Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:162c217105ada80a4212536927dfa5ebc0d9a20c95e5acd026b608b1201ecf68","observation_id":"e1ff04b0-f62e-4edf-8228-4f445fd41fea","resolution":{"observed_at":"2026-08-14T04:16:07.419865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-14T04:16:07.432474Z","title":"V-JEPA 2: Self-supervised video models enable understanding, prediction and planning.arXiv preprint arXiv:2506.09985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.432474Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:ac75092a2aa47da2110049c5bf275ca5d37acd1f1979110355c8a576eb78599e","observation_id":"4447f9fa-a3c3-431d-8097-f730f0dfeb96","resolution":{"observed_at":"2026-08-14T04:16:07.432474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-14T04:16:07.437307Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.437307Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:1c224bfbd41efafe6684153541b13ae3fbc3a670ea34d3d7a12e050327174fc5","observation_id":"bdcfce0e-4edc-4c09-a229-1410ffb3817a","resolution":{"observed_at":"2026-08-14T04:16:07.437307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:08.230608Z","title":"The latent perturbation is used only as a reconstruction-training augmentation; evaluation, latent-statistics estimation, and latent video generation all use clean latents","venue":null,"work_id":"dd8cb35d-812f-4f5a-b164-83ed7ab56baa","year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.556599Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:9046a05a9e9854f17f5d71d146409bec4c016a27ae1ed68e406ea7b2b41eb984","observation_id":"822e9cf7-499b-4321-8c06-45437b1d7d2c","resolution":{"observed_at":"2026-08-14T04:16:08.235615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-14T04:16:07.449932Z","title":"The kinetics human action video dataset.arXiv preprint arXiv:1705.06950,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.449932Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:a3edec38bc6cd926ba3175ede62cc0d6b2f3aa89036605fc21f2f6118508677e","observation_id":"7be6db4f-9549-4388-8706-111c5887fa99","resolution":{"observed_at":"2026-08-14T04:16:07.449932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-14T04:16:07.453726Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.453726Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:ba1226c530f7a2766ce471e4ac5e3393a4e48c62dac64d288b2a95810f0ce60e","observation_id":"c640daf3-f0a5-4252-9f5c-4bb9c82b55b5","resolution":{"observed_at":"2026-08-14T04:16:07.453726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-14T04:16:07.458705Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.458705Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:29076f1847a9989017ee5f679daa8f7d0dbc0e2c37d394c63bbb1141970cda54","observation_id":"4b88751b-242a-4767-b78d-6090785898a2","resolution":{"observed_at":"2026-08-14T04:16:07.458705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.463799Z","title":"Atoken: A unified tokenizer for vision.arXiv preprint arXiv:2509.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.463799Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:bad4e595b5041cd68bc2db17a3707c4fad68527afd3249509e61e84a2348ff23","observation_id":"32c377c0-0683-4177-a23f-c8d74756ed76","resolution":{"observed_at":"2026-08-14T04:16:07.463799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-14T02:43:25.975990Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-14T04:16:07.468746Z","title":"Open-MAGVIT2: An open-source project toward democratizing auto-regressive visual generation.arXiv preprint arXiv:2409.04410,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.468746Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:084f24e2b68f32c23baa9709dca137757c20df457c420555750951d4eecac095","observation_id":"1715a996-a8eb-4e7c-93d8-7855af826bc1","resolution":{"observed_at":"2026-08-14T04:16:07.468746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-13T10:44:26.934833Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-14T04:16:07.478488Z","title":"Vo, Maximilian Seitzer, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.478488Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:143a50c5b907665c7b7ee588d1518cd7e42b7c82ec37703b4b8802e4b8c3e529","observation_id":"24aedaf7-f34f-43c1-988b-43d5371d167e","resolution":{"observed_at":"2026-08-14T04:16:07.478488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18324","last_updated":"2026-05-18T12:42:34Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T12:42:34Z","title":"Improved Baselines with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18324","snapshot_observed_at":"2026-08-14T04:16:07.483649Z","title":"Improved baselines with representation autoencoders.arXiv preprint arXiv:2605.18324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.483649Z"},"links":{"cited_paper":"/paper/2605.18324","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:0d3901bf1774a69912a0f445b048dc2e651c058b4b4bd5f4a437eacbec52e35e","observation_id":"bce3e1be-f1a3-454b-b373-e8c803aa75d7","resolution":{"observed_at":"2026-08-14T04:16:07.483649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-13T22:00:40.727122Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-14T04:16:07.492798Z","title":"UCF101: A dataset of 101 human actions classes from videos in the wild.arXiv preprint arXiv:1212.0402,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.492798Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:98e34c1c47f4d19872465f8c93048c9a0c29e76ce9d69e8192c3b15c49b433e7","observation_id":"4c927a75-48a4-446e-a8db-1c66ec61b5ed","resolution":{"observed_at":"2026-08-14T04:16:07.492798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.501394Z","title":"Scaling text-to-image diffusion transformers with representation autoencoders.arXiv preprint arXiv:2601.16208,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.501394Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:a5a7b1a5f4f406fe5b1cd548ed0732119698ac09cb99ab4de47963fcea816969","observation_id":"1a1d4876-fec9-4f39-b268-392b5243f904","resolution":{"observed_at":"2026-08-14T04:16:07.501394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-14T04:16:07.504838Z","title":"SigLIP 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.504838Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:a24531f3224301f17dae120e3f1feb0a2c9797e7a58e02fb0240b272b3d323d7","observation_id":"dea9f47f-51ca-4dea-94e4-9db511d75c7a","resolution":{"observed_at":"2026-08-14T04:16:07.504838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-15T00:26:15.250313Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-14T04:16:07.509532Z","title":"Towards accurate generative models of video: A new metric and challenges.arXiv preprint arXiv:1812.01717,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.509532Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:d1656485f3da5ba3e2ef32998267ce2cfb18af4ef12ff93e06394bacc9cff643","observation_id":"6ed848e9-08e3-4044-99f2-b9f7936e713e","resolution":{"observed_at":"2026-08-14T04:16:07.509532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:08.255195Z","title":"Larp: Tokenizing videos with a learned autoregressive generative prior","venue":null,"work_id":"bd99afae-4099-46b2-bdb2-d2699aeb2eba","year":2025},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.518767Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:726ad230e81affe7e72c8c18e467343e758caee0e9e929afc8aaaa486926e737","observation_id":"0d46f0a2-d88e-4157-87d3-ebf0d5b62093","resolution":{"observed_at":"2026-08-14T04:16:08.260044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-12T11:09:04.579066Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17726","snapshot_observed_at":"2026-08-14T04:16:07.523981Z","title":"Omnitokenizer: A joint image-video tokenizer for visual generation.Advances in Neural Information Processing Systems, 37:28281–28295, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.523981Z"},"links":{"cited_paper":"/paper/2412.17726","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:7123b5860bd7cf323ca50ad757d296817f420af095cd348d35d07bf2c4556e05","observation_id":"c0fc0f33-5340-4164-8dc2-b8294f5720c0","resolution":{"observed_at":"2026-08-14T04:16:07.523981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05630","last_updated":"2026-05-07T12:30:29Z","snapshot_observed_at":"2026-08-13T17:16:14.184753Z","submitted_at":"2026-03-05T19:39:01Z","title":"Making Reconstruction FID Predictive of Diffusion Generation FID","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05630","snapshot_observed_at":"2026-08-14T04:16:07.532657Z","title":"Making reconstruction fid predictive of diffusion generation fid.arXiv preprint arXiv:2603.05630,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.532657Z"},"links":{"cited_paper":"/paper/2603.05630","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:144b2c767fe77f1b8c1f6c4fd97f059c00d2365eee12b20e2d0521a2f9e8444e","observation_id":"5c801366-1054-466b-b96e-bbc3f9721aa7","resolution":{"observed_at":"2026-08-14T04:16:07.532657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:08.243703Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"d8f3f0cb-3bbb-4fd3-af01-ab6007a0806d","year":2025},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.536617Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:d9c88d76fc8b130de767f4e335954d3e5820f173405bba0b1a6fa9053a5699c9","observation_id":"e19e2ac3-fd39-4026-88f7-8aa24b5b4913","resolution":{"observed_at":"2026-08-14T04:16:08.247634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-14T04:16:07.540481Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.540481Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:2f5dc4cadce48f7f65b0f8c89206450e19079121383330ca448512d5a0b8b044","observation_id":"07ba8789-d4c7-4792-84dd-94679d813625","resolution":{"observed_at":"2026-08-14T04:16:07.540481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-14T04:16:07.544422Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think.arXiv preprint arXiv:2410.06940,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.544422Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:d64c038035a5cf4a7594ee35511e813dd919bdf34ae270e01ecd25f870b5d673","observation_id":"3ce2d571-5fb6-4834-853f-f71141afcf86","resolution":{"observed_at":"2026-08-14T04:16:07.544422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-08-13T23:51:28.874833Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-08-14T04:16:07.548558Z","title":"Diffusion transformers with representation autoen- coders.arXiv preprint arXiv:2510.11690,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.548558Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:0924734b07ab361a158f22f69effa677e8ae817b678db9a40a6ea78bf8afccdc","observation_id":"d574185f-1288-415a-aa4d-085b3074756b","resolution":{"observed_at":"2026-08-14T04:16:07.548558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.552563Z","title":"Efficient universal perception encoder.arXiv preprint arXiv:2603.22387,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.552563Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:8ddd1d472b5fcb5e25fd97f05c37831c11b28144809a3966279d9b54901828bc","observation_id":"668e9aa1-a0a4-4e1e-bc87-0ea517977c57","resolution":{"observed_at":"2026-08-14T04:16:07.552563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:08.216213Z","title":"Only the input channel count and corresponding time shift change for EUPE-B","venue":null,"work_id":"03a2f863-29cb-4100-a4c6-6cc1382e3b60","year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.560939Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:772f628c3f0a6f22c9431e51cd80bfb6727027af426903f0e752eec8dc8bd9c9","observation_id":"f503f54a-b211-4ffd-9eeb-50438244f92e","resolution":{"observed_at":"2026-08-14T04:16:08.221888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.528689Z","title":"Representation entanglement for generation: Training diffusion transformers is much easier than you think.Advances in Neural Information Processing Systems, 38:7714–7743, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.528689Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:e3c3d3d427e5d4505fbfe0ed5de53da089a42f6e17bae0c681e4442b837a1753","observation_id":"4a60b787-5796-4cda-9d61-5ab9045089ec","resolution":{"observed_at":"2026-08-14T04:16:07.528689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-14T03:33:46.294739Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-14T04:16:07.497419Z","title":"RoFormer: Enhanced transformer with rotary position embedding.arXiv preprint arXiv:2104.09864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.497419Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:eaf98818921050b668328158d2b44738955ce5ea00f292184f17227d6a359bc2","observation_id":"caceaa4c-1ffa-4ba9-be4c-a72b7725b96e","resolution":{"observed_at":"2026-08-14T04:16:07.497419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.445929Z","title":"Dera: Decoupled representation alignment for video tokenization.arXiv preprint arXiv:2512.04483,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.445929Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:29ed671d28f448ee6ee79a57d09469f9d4729222127055839371e0b241d5609d","observation_id":"a0fe687e-725d-44d6-b5c2-0b3ce4674630","resolution":{"observed_at":"2026-08-14T04:16:07.445929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-14T04:16:07.514157Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.514157Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:4dc18a9b3736bf600d73e7b6f698a1f117e408708147e3b8c0844555333bc47d","observation_id":"ddcbd4b4-db9c-40cf-b329-2bc79b53a10b","resolution":{"observed_at":"2026-08-14T04:16:07.514157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-08-14T18:44:38.993682Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-14T04:16:07.441723Z","title":"A short note about Kinetics-600.arXiv preprint arXiv:1808.01340,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.441723Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:58338577046f6638a7717636ab6bf9fe18f7337514d1b19ceaa617c1134603fe","observation_id":"6d972246-bfff-44ac-bf89-e1863b9d3ed9","resolution":{"observed_at":"2026-08-14T04:16:07.441723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14482","last_updated":"2026-06-11T10:07:56Z","snapshot_observed_at":"2026-08-06T07:23:27.418432Z","submitted_at":"2026-03-15T17:02:40Z","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14482","snapshot_observed_at":"2026-08-14T04:16:07.473562Z","title":"Unitok: A unified tokenizer for visual generation and understanding.Advances in Neural Information Processing Systems, 38: 129274–129297, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.473562Z"},"links":{"cited_paper":"/paper/2603.14482","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:6d56fbfd139457f082069a6a34b757c2b8da06967b97b4f2ae57d133cd74ac63","observation_id":"4a781aca-ad0e-49de-a977-ae39dad674cd","resolution":{"observed_at":"2026-08-14T04:16:07.473562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:08.269155Z","title":"CoVLA: Comprehensive vision-language-action dataset for autonomous driving","venue":null,"work_id":"591258a8-1d36-44ab-911b-ecd6c577362b","year":1933},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.427895Z"},"links":{"citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:a3780b9aec3f7dfca841ffcffabaa00c29b5345479267329ce9049683088558d","observation_id":"ff700b73-2f1e-4f9f-8c12-40d2fd0a3c5c","resolution":{"observed_at":"2026-08-14T04:16:08.273629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14831","last_updated":"2025-06-06T23:43:53Z","snapshot_observed_at":"2026-08-12T18:53:57.602487Z","submitted_at":"2025-02-20T18:45:44Z","title":"Improving the Diffusability of Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14831","snapshot_observed_at":"2026-08-14T04:16:07.488440Z","title":"Improving the diffusability of autoencoders.arXiv preprint arXiv:2502.14831,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:16:07.488440Z"},"links":{"cited_paper":"/paper/2502.14831","citing_paper":"/paper/2608.13556"},"observation_digest":"sha256:a99974848b2fcaef7b1ec506b3bbdeba4b677a3974f17017ebd91aa33df56553","observation_id":"83a764d7-a9ff-4c8b-a812-46ac2f97e315","resolution":{"observed_at":"2026-08-14T04:16:07.488440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.13556","last_updated":"2026-08-13T17:59:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T03:18:49.187679Z","submitted_at":"2026-08-13T17:59:43Z","title":"V-RAE: Rethinking Video Latent Spaces for Generation"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2608.13556."}