{"as_of":"2026-08-04T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0ca5a86ae14625af366b64ae36dcd5a9c1b957efef123ff60942007f2dd4b96","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:23:19.583713Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:01:24.112587Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16479","snapshot_observed_at":"2026-08-02T05:01:24.112587Z","title":"Latent-compressed variational autoencoder for video diffusion models.arXiv preprint arXiv:2604.16479,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13522","last_updated":"2026-07-15T07:21:00Z","snapshot_observed_at":"2026-08-02T05:01:21.464969Z","submitted_at":"2026-07-15T07:21:00Z","title":"Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:01:24.112587Z"},"links":{"cited_paper":"/paper/2604.16479","citing_paper":"/paper/2607.13522"},"observation_digest":"sha256:e19093e5b7c065f9c8327a2a63edccf4b98e5c16a021284bb2be8f1821783606","observation_id":"00d907ee-09eb-41de-a468-c6ec1b203ffc","resolution":{"observed_at":"2026-08-02T05:01:24.112587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.16479/citation-record","integrity":"/paper/2604.16479/integrity","json":"/paper/2604.16479/citation-record.json","paper":"/paper/2604.16479"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-07-11T00:07:42.711856Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:75329a923fdbce69d521253eb3d982e92bf4c9be024347913528a606f9740135","observation_id":"dfed5bca-6fb6-40ee-834b-290c87435230","resolution":{"observed_at":"2026-05-11T10:41:03.061762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in time: A joint video and image encoder for end-to- end retrieval","venue":null,"work_id":"cd1efa97-e1e0-478b-ad70-02abb141f866","year":2021},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:b019d227c1ed889d7102e22438407295882268724873b76eb8521c36fa6ed4aa","observation_id":"299ca983-65ea-478c-a38d-a9abea0c6237","resolution":{"observed_at":"2026-05-18T02:32:20.016766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-11T02:27:48.842637Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:0be0a5d5e74740d61381af9b2ddd1b4f70a6ec78d9dee07d79b4caddf92f36d0","observation_id":"62de98d4-5b97-4e57-a82c-1cc21d72cc0f","resolution":{"observed_at":"2026-05-11T10:41:03.273409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video generation models as world simulators","venue":null,"work_id":"ad3ec4e6-4ddb-4e4f-a791-1cc6bd1b9aac","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:019058a32a5cdefed8438565c94a61db5dc93d1ce8e6bbca372038505d7c2c07","observation_id":"62664a9d-9ae2-49f5-b8a0-7593a75b9d30","resolution":{"observed_at":"2026-05-18T02:32:20.022196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":"2410.10733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-07-09T07:06:02.921871Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models","venue":"cs.CV","work_id":"fb6e768c-674c-4587-921d-4c0ad09a87fd","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:8552b904855e7eb340a64bfd4b07e7ef78880f085fc4026f980a7b922b633025","observation_id":"20901210-6fd1-41c5-b864-9ae3cf45ed07","resolution":{"observed_at":"2026-05-11T10:41:03.226989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:45.168345Z","title":"Dc-videogen: Efficient video gen- eration with deep compression video autoencoder","venue":null,"work_id":"9e08b3a1-d003-44e0-88e6-d710a4965842","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:ce69a824254311bbe9fd68ece7e5b4a9604e7df22a06349b38c7022349d32a50","observation_id":"9ef849ae-98c7-451d-abc4-c3364675db64","resolution":{"observed_at":"2026-05-11T10:41:03.083637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dc-ae 1.5: Accelerating dif- fusion model convergence with structured latent space","venue":null,"work_id":"b3d30280-39d8-4835-acb0-9a4bc5fd8f16","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:ba720141e9448ae08962a44643d9adc96fc2cafdbd33ee05de33e431fda8ef96","observation_id":"bd28493f-3edb-4436-b076-4de25ed501f4","resolution":{"observed_at":"2026-05-18T02:32:20.024781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Od- vae: An omni-dimensional video compressor for improving latent video diffusion model","venue":null,"work_id":"43fef6f3-3e14-43ed-9396-b32b5b863f45","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:80e5a81f690cfd5f84c0de0b217fa5bdee0896da66b90c4ddb0e924e8faab7cc","observation_id":"a95f81c1-9a04-4660-8bdb-7c43a13f9e54","resolution":{"observed_at":"2026-05-18T02:32:20.027418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panda-70m: Captioning 70m videos with multiple cross- modality teachers","venue":null,"work_id":"eef85965-f370-4955-9158-c93a2eb63526","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:4be79bd9b73f6f5fead61e17c8e84ef5a1ebbc9b622831f2eccb3d49f5fc709f","observation_id":"6d4affe2-e4f6-4c8b-9a5f-4db35d603316","resolution":{"observed_at":"2026-05-18T02:32:20.029737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"f90be29f-e77b-4d7d-82ee-9a9a090acf24","year":2021},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:b6a0f6c280a013fa9662e3ddbff75b27812f3629599a8db8c434c0b92a4fd75f","observation_id":"6d9acdb6-ad50-4c36-8fac-137715dc5cf9","resolution":{"observed_at":"2026-05-18T02:32:20.031995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video generation arena leader- board","venue":null,"work_id":"e356dfb8-2222-40bd-be22-b54442c54a87","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:d21129f53659f060a3ecede93f466588a0f65ede2779df2cf120ed34e0d29fca","observation_id":"b718b1df-7e54-4312-935b-527521294bf7","resolution":{"observed_at":"2026-05-18T02:32:20.064237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":"2506.09113","doi":"10.48550/arxiv.2506.09113","metadata_source":"pith","pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-07-11T01:07:45.150925Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","venue":"cs.CV","work_id":"b2e36b5d-99e4-45b4-9358-64f6d3501983","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:93958b309aea61479b0787d9565a312523880571e6399197b1ceaa377892e7ed","observation_id":"5688cdf8-fe5f-463c-b86c-14fdcb0ff23d","resolution":{"observed_at":"2026-05-11T12:09:57.662354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative adversarial nets.Advances in Neural Information Processing Systems, 27","venue":null,"work_id":"3a302cc1-1680-48f5-abd6-90f29b054f71","year":2014},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:1d57341944b483254a9ffc541d3e31ca0555077b46fdcace5312c0de81118a66","observation_id":"fe0fc68e-b065-4cca-bed9-cdce1f5c7ed0","resolution":{"observed_at":"2026-05-18T02:32:20.061886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An introduction to wavelets.IEEE computa- tional science and engineering, 2(2):50–61","venue":null,"work_id":"ffc0d9cd-0ec2-42b0-811b-62dfc55350a6","year":1995},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:144c8c6d9a69cb0dc627c8a71a360ca5cb3bd52a9fa83741647ddab50be5c54c","observation_id":"019c6939-0c20-44b8-ab20-4cf7bd6e40e6","resolution":{"observed_at":"2026-05-18T02:32:20.066750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:1e0a15f5608b28bfc23a81dc4241f7619abc768ad24a9541f77206b06d022c34","observation_id":"379c8280-c1fa-4db6-8b19-b58afae57b6f","resolution":{"observed_at":"2026-05-11T10:41:03.030009Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:c239f55d57576df82da460c90abf05ebed4f534c6c4c7b07bfa6dc03267f266d","observation_id":"1b6693c7-a193-487d-a603-9726cd377731","resolution":{"observed_at":"2026-05-11T10:41:03.364378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09755","last_updated":"2025-01-16T18:59:04Z","snapshot_observed_at":"2026-07-06T20:22:09.358394Z","submitted_at":"2025-01-16T18:59:04Z","title":"Learnings from Scaling Visual Tokenizers for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":"2501.09755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09755","snapshot_observed_at":"2026-07-07T15:43:53.781661Z","title":"Learnings from scaling visual tokenizers for reconstruction and generation","venue":"cs.CV","work_id":"b198a6f3-7796-4bb9-ab48-da1ef827995f","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2501.09755","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:09e53cd3671470ba2e363d513af4d1fbaf70ae07977554ff04cac9b29b61dd80","observation_id":"ac0c1624-78af-40ce-9719-35b212adf4b2","resolution":{"observed_at":"2026-05-11T10:41:03.077326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:1829247301a26b09396bebad6b9663c3e994ec6593dc98b6b3d9557020e2ec99","observation_id":"1f1b6ae9-bb4e-4dc1-b469-8e31eb10843c","resolution":{"observed_at":"2026-05-15T04:27:43.523852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"simple diffusion: End-to-end diffusion for high resolution images","venue":null,"work_id":"eb185840-10ed-40ac-8277-81be9ac56811","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:a39ea3c2ed70413dc176adf3d547dc47efaf7e52ef84664afd967a1bb7e24281","observation_id":"2e8e02ed-5c3f-4c03-9a86-dba9533f73c5","resolution":{"observed_at":"2026-05-18T02:32:20.070341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":"7994b381-9e1a-4af6-bdcf-913f1ae7dbab","year":2010},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:59e665787796e7e4f915ef85a8e0605b0d8b434cc979c7bb7ff4e94f1476894d","observation_id":"2c9a178d-1bb3-46f4-add7-f34f44d93e5c","resolution":{"observed_at":"2026-05-18T02:32:20.079767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":"1705.06950","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-09T11:16:11.423695Z","title":"The Kinetics Human Action Video Dataset","venue":"cs.CV","work_id":"c8a3de61-cfd3-4aeb-bcf7-a0372c015748","year":2017},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:d5a52c6573538324ceb01f75ea5c5de88fa086e1f81d2ea2082f954b848da94f","observation_id":"f3c9203b-3fe4-4318-93c9-3c3577e834cd","resolution":{"observed_at":"2026-05-11T10:41:03.295921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:2c2793b3960b856d69eac8e8a1ebfb9ea476bc9ccc2df57e6a6f0e72816529e6","observation_id":"7325a249-a7d9-48c0-a616-17cfd1c12dd2","resolution":{"observed_at":"2026-05-11T10:41:03.177123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:da7669e1debfe2edee3eaaed9a0e7dc1f03fba26f4324ab1c6e2b63058983d3f","observation_id":"b8adbe17-00c9-478a-890c-41f63f0d2cc7","resolution":{"observed_at":"2026-05-11T10:41:03.044934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:58ed10c9f44a45a178a455b55cac3ea0a2bc7ad9f61c566a853acda870be6bc3","observation_id":"d8789e48-97b0-4e7a-b65d-b281bf12358b","resolution":{"observed_at":"2026-05-15T17:51:05.830483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-11T01:07:45.135143Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:d6795e4d437cb45427c6b96c6d304482e59275c7fe95889e5312018549b69c9a","observation_id":"2bca163d-c335-4628-b5b3-037118c5bc6a","resolution":{"observed_at":"2026-05-11T10:41:03.018392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video autoencoder: self-supervised disentanglement of static 3d structure and motion","venue":null,"work_id":"435f9810-85c5-4c25-9a7c-8a2bfd1fdc28","year":2021},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:041d7ba6c6b8a5c7b06965288d23646e176ab05a6423fcade5e418fb1e5eceba","observation_id":"45ba7cd5-1331-4cd5-8f01-3c90311fa8b0","resolution":{"observed_at":"2026-05-18T02:32:20.056940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model","venue":null,"work_id":"4720b139-b5ab-4ce2-849c-e7004263b2e4","year":null},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:9508340a85a26ec2465ec296690647aade501ab5d942fb0b0acc559e628891c3","observation_id":"d5a3f91a-7680-48b3-8914-5bd17281410f","resolution":{"observed_at":"2026-05-18T02:32:20.044026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":"2412.00131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-07-08T14:44:59.776032Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","venue":"cs.CV","work_id":"51c0ab25-66f7-4d1a-a028-86b9b1b9e313","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:533df12a40c19a428fd9ffba6cafb5206112b429c81523aa73d719acf472052c","observation_id":"8353aabe-6aa1-4242-8a43-366ddb86beb0","resolution":{"observed_at":"2026-05-11T10:41:03.345396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07136","last_updated":"2025-06-08T13:30:11Z","snapshot_observed_at":"2026-07-06T21:38:39.914904Z","submitted_at":"2025-06-08T13:30:11Z","title":"Hi-VAE: Efficient Video Autoencoding with Global and Detailed Motion","version":1},"cited_work":{"arxiv_id":"2506.07136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07136","snapshot_observed_at":"2026-07-03T20:28:55.564481Z","title":"Hi-vae: Ef- ficient video autoencoding with global and detailed motion","venue":null,"work_id":"1585ed10-85b0-43a2-9212-64e0f2a8818f","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2506.07136","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:f7f2277376fccf4c75d7f01f1ace3457b3c17f0b9ed4f9e48fba515c5c014ece","observation_id":"59b3d51f-4e21-4d0a-9cba-4fba4daa9806","resolution":{"observed_at":"2026-05-11T10:41:03.093142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:01fe19162dcb6fe055c009cea5bf26b808d8bbb3146f051dec3819a829b2c651","observation_id":"78409137-931e-4603-9148-3cdba8c041a7","resolution":{"observed_at":"2026-05-11T10:41:03.316506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latte: Latent diffusion transformer for video generation.Transactions on Machine Learning Research","venue":null,"work_id":"29429d6c-966d-430d-8e6f-d350e37cde73","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:d69118098c0f8d18bd1125ee6a9e896b41ef81d943c96c1e53a375da1a395078","observation_id":"4c32aa39-611f-420a-95df-449cd8b044ca","resolution":{"observed_at":"2026-05-18T02:32:20.051289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-02T14:57:48.676109Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":"2407.02371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-07-05T16:41:18.954519Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","venue":"cs.CV","work_id":"00dd95a8-d503-4a41-9603-785dcf4a0b8e","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:43e9be44de467cedae793327655fead2638f7caf95c6d1fec2c69527e1c61c52","observation_id":"ba2dd2a9-6785-41a6-a0ce-e476e6b03df6","resolution":{"observed_at":"2026-05-14T20:34:53.267725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-07-10T13:47:05.847810Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:550734316f2b726c2ad03aac78b539cd268f6987089ffe2c580cb4a9dcca8627","observation_id":"8114c507-9fcb-43bf-835d-136e00231656","resolution":{"observed_at":"2026-05-11T14:16:26.778393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"d8ffd5d8-a10b-407a-a9ce-946305796008","year":2022},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:d05429f0dd1c76207647e500d2fb2430446684ae2eac45f33c7a4e828b596e37","observation_id":"5c6fce5f-89e4-4c23-b771-5806db933590","resolution":{"observed_at":"2026-05-18T02:32:20.074653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal generative adversarial nets with singular value clipping","venue":null,"work_id":"277c75f0-2723-46df-a098-4fa3beea49ac","year":2017},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:fb521c3f879241afac3941ec1686a8b918d0d5380ee2bc184ca80d4719405a2d","observation_id":"4010fa6e-836f-40a9-a49b-d47def46bd88","resolution":{"observed_at":"2026-05-18T02:32:20.046459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The JPEG 2000 still image compression standard","venue":null,"work_id":"9654dac3-f81d-4098-9a5f-a57a9f4e1618","year":2000},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:d5723f3472341732d308600d2a37af37b964b7f83e4cafeb94636292999aade2","observation_id":"d4c993ac-391b-4521-bcc5-67f7c7a4aca3","resolution":{"observed_at":"2026-05-18T02:32:20.054174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"2ace92a7-3c37-4118-b9f9-09bd61444d45","year":2022},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:416e8e5eaab66481f5acc8a3e04dddd4bf03d70636054e8e048aef997bb5a9d1","observation_id":"e3fbc601-646c-47c6-a677-8c997a906602","resolution":{"observed_at":"2026-05-18T02:32:20.048897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14831","last_updated":"2025-06-06T23:43:53Z","snapshot_observed_at":"2026-07-06T20:39:57.316580Z","submitted_at":"2025-02-20T18:45:44Z","title":"Improving the Diffusability of Autoencoders","version":3},"cited_work":{"arxiv_id":"2502.14831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14831","snapshot_observed_at":"2026-07-04T16:59:58.004889Z","title":"Improving the diffusability of autoencoders","venue":null,"work_id":"68095bbe-b8a6-4304-baab-6153bba7a4c1","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2502.14831","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:b3fc7d26622495161a300aa60617eede875cad684f3e2fa354861d2261fb94c3","observation_id":"22b7c1fa-f686-4732-a324-d4e83df66dfe","resolution":{"observed_at":"2026-05-11T10:41:03.024402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":"1212.0402","doi":"10.48550/arxiv.1212.0402","metadata_source":"pith","pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-07-11T03:07:53.363433Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","venue":"cs.CV","work_id":"5dfb46e7-e952-409d-a3c7-ba7f20aebad6","year":2012},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:268c6e95a07ff50f6637c8a83bae4bd1e31711a031ad8a37c8b6275b735f243f","observation_id":"14da305a-1bd1-4404-9fc6-e7b623cbfa84","resolution":{"observed_at":"2026-05-11T10:41:03.251740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07195","last_updated":"2025-08-10T06:06:19Z","snapshot_observed_at":"2026-07-06T22:10:40.258498Z","submitted_at":"2025-08-10T06:06:19Z","title":"Adapting LLMs to Time Series Forecasting via Temporal Heterogeneity Modeling and Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2508.07195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07195","snapshot_observed_at":"2026-07-02T22:27:26.593716Z","title":"Adapting LLMs to time series forecasting via temporal het- erogeneity modeling and semantic alignment","venue":null,"work_id":"86d50fe8-b9c0-4bbd-97bb-e8f27bfda5d0","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2508.07195","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:eef8fd176a4e6c9b7276120a08424d5c6093ebc346ffe4e61cb28eb58c2726d7","observation_id":"b5459e31-b2f8-4ed5-a603-69b9b53627d4","resolution":{"observed_at":"2026-05-11T10:41:03.307568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1010.4084","last_updated":"2010-10-20T01:52:05Z","snapshot_observed_at":"2026-07-06T02:17:55.479578Z","submitted_at":"2010-10-20T01:52:05Z","title":"Haar Wavelet Based Approach for Image Compression and Quality Assessment of Compressed Image","version":1},"cited_work":{"arxiv_id":"1010.4084","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1010.4084","snapshot_observed_at":"2026-07-04T18:11:21.620230Z","title":"Haar wavelet based approach for image compression and quality assess- ment of compressed image.arXiv preprint arXiv:1010.4084","venue":null,"work_id":"3a7c55f7-2aab-492a-b00e-4d68636e4e79","year":null},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/1010.4084","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:7a4cbadcb4321af0299b04c5fafa1f3c94cbf0986d1b3df5005f5a5c34a033ce","observation_id":"e5292539-05bd-4aab-a127-72e04750685d","resolution":{"observed_at":"2026-07-04T18:11:21.620230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FVD: A new metric for video generation","venue":null,"work_id":"3c4fa128-f5f5-4ba8-9a22-b49c6b62353c","year":2019},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:fdeb35444be3381a358ebc6e6ded3e6e245f7df20e7b17945d0dd12b3a57ddbd","observation_id":"75ce7ae5-0377-4ea9-b494-9c7b4ea5a487","resolution":{"observed_at":"2026-05-18T02:32:20.014436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 30","venue":null,"work_id":"a6aa0b6c-5262-47f8-b1cf-f7233168aa95","year":2017},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:9a92cbdece7768fc033dd47b74bca7a97982c852567aa36bafe3d3c7b97221b8","observation_id":"7a42e7d1-a736-4ea2-b3b7-2ef1d992341c","resolution":{"observed_at":"2026-05-18T02:32:20.018956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:baa05d5eba0d417a2554365c9beb2cc67dfa72a1e1c736bdb2df5fe36db5fac4","observation_id":"1d8fd16f-127a-4aa7-89ac-9dd60d02c1db","resolution":{"observed_at":"2026-05-11T10:41:03.215355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:02:58.874726Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE Transactions on Image Processing, 13(4):600–612","venue":null,"work_id":"832f6be1-709d-43a5-9863-2da7232507e6","year":2004},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:1cfd6aa3e79d250bb6115beecf827bff41db3e2ab62c5066cdbf0991736ecb1e","observation_id":"718de5d1-f640-48e9-b5ef-ad0c8738b35f","resolution":{"observed_at":"2026-05-18T02:32:20.036895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved video V AE for latent video diffusion model","venue":null,"work_id":"7e64db3c-a131-47f7-b66f-66ed8a3eea87","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:775a0a66bef2006c8b59b2550c25e03baa6c0a99a26a62cbaa34e975c83112cd","observation_id":"f00a44cd-fde9-42b1-8786-25d8e2eae49f","resolution":{"observed_at":"2026-05-18T02:32:20.041693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.10567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:36:27.557856Z","title":"H3ae: High compression, high speed, and high quality autoencoder for video diffusion models","venue":null,"work_id":"9ebe9298-b066-41ec-940a-20dbe4f2f8a1","year":2025},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:432a0590781cb78beeef60b9782dbe14e7ee474a91459bcd723bff4d7f79b74e","observation_id":"c279d6c0-affa-4d50-842d-6f4cecb259e9","resolution":{"observed_at":"2026-05-11T10:41:03.162685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to generate time-lapse videos using multi-stage dy- namic generative adversarial networks","venue":null,"work_id":"92599231-042e-4892-ac45-69ea00c863c1","year":2018},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:9fd8303e1c9deec6eee139452dbb3cd36975254fa0ee1a6718989d97f3513fd7","observation_id":"3f1f18fe-4366-4385-8537-b9c8b50e29db","resolution":{"observed_at":"2026-05-18T02:32:20.034424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-11T00:07:42.878250Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:2d7a1eed7a7ecab23d8aee3c5fe89eed401ceeff2303a39a8eccba66b42f1664","observation_id":"5636f674-a34d-423c-93c8-18822b8e2238","resolution":{"observed_at":"2026-05-11T10:41:03.053184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:f0a03929ecc94af49e85b2e38ebd5a2a805312347c71c91681efbc6133887f89","observation_id":"77bafbe1-84b6-488a-acff-59a4c5739655","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14148","last_updated":"2024-03-21T05:48:48Z","snapshot_observed_at":"2026-07-06T17:48:08.016138Z","submitted_at":"2024-03-21T05:48:48Z","title":"Efficient Video Diffusion Models via Content-Frame Motion-Latent Decomposition","version":1},"cited_work":{"arxiv_id":"2403.14148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14148","snapshot_observed_at":"2026-07-03T20:28:55.535457Z","title":"Effi- cient video diffusion models via content-frame motion-latent decomposition","venue":null,"work_id":"d262800e-d0e2-4bf8-ac7e-255fab126f46","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2403.14148","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:16c710d07749acc78ba5f79a9c48bd5db1babbd22f7fd066f85e3dca3d9877d3","observation_id":"1c000e58-fda9-4a7a-a9b9-0108e4c15c48","resolution":{"observed_at":"2026-05-11T10:41:03.353140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"fa51ebaf-d561-4c4c-89e3-c9f3041a555e","year":2018},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:56b9060a42586f9e23d50fee5e971a61fb9120ed92d9b38e57a0393cc1cf46ef","observation_id":"8c7ce93b-2f00-4337-a11b-2cfeeed89b72","resolution":{"observed_at":"2026-05-18T02:32:20.039061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on perceptually optimized video coding","venue":null,"work_id":"806600e6-ec73-4d14-9d5a-b40ce9371fee","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:7e21b14acc2450f0495a0ecba5a600e12297ee967c92847e40a71f215c1ef31b","observation_id":"b0cd959c-cd32-423a-819f-a2579642c43c","resolution":{"observed_at":"2026-05-18T02:32:20.059288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cv- vae: A compatible video vae for latent generative video mod- els.Advances in Neural Information Processing Systems, 37: 12847–12871","venue":null,"work_id":"3d694347-8ad3-46fa-9ad9-2e476997b261","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:bf38d0ee83a2eddaf7ae14f179c2f8707ee14e186cb1543e27b87b9fc98dccf9","observation_id":"5a609579-f837-4fd6-9024-cd913e77c140","resolution":{"observed_at":"2026-05-18T02:32:20.077188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":"2412.20404","doi":"10.48550/arxiv.2412.20404","metadata_source":"pith","pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Open-Sora: Democratizing Efficient Video Production for All","venue":"cs.CV","work_id":"8b29ba7b-3d84-4281-85b7-9eaf905afd7f","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:82838606481b0a97a86f7b4b9d0477ee0422f22f80def05cb470b16b685ea48e","observation_id":"192448e4-2953-4271-bbb2-8cd6066d7af5","resolution":{"observed_at":"2026-05-11T12:01:52.219350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-07-06T19:36:41.445591Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":"2410.15458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-07-03T23:59:06.234618Z","title":"Allegro: Open the black box of commercial-level video generation model","venue":null,"work_id":"2a9fb750-b69a-4cb3-bd82-2a77e49bd173","year":2024},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:0351cf0f72e3bfc7711ae3dd57ebf2f7f0a639d46c6529295f81b6376d1aced0","observation_id":"f16c48cd-0194-4afb-9b9a-68c00bc42e9e","resolution":{"observed_at":"2026-05-11T10:41:03.125071Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":29,"verified_fuzzy":26},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2604.16479."}