{"as_of":"2026-08-14T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b07e17c73b50689090fbd7d5275bb4153465bef598da845f9d7fd4908f26e53","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:00:31.863822Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T08:52:31.686474Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T08:52:31.987543Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"cited_work":{"arxiv_id":"2411.14762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14762","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient long video tokenization via coordinated-based patch reconstruction","venue":null,"work_id":"2bc56a9d-5270-4eeb-9604-9eb7f5a72800","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2411.14762","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:ab8644b25afde02fbcf3a657ae089c57ecad608e697fbb047f088a4b7936135d","observation_id":"70bc0a3e-e3ef-4560-86b2-de67a24c6e60","resolution":{"observed_at":"2026-05-11T08:52:31.993969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14762/citation-record","integrity":"/paper/2411.14762/integrity","json":"/paper/2411.14762/citation-record.json","paper":"/paper/2411.14762"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.792275Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"ec4ea9a6-69d5-4a29-b898-7f4915afe6c5","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.572869Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:60c43092e0a40d683c3c2b8d25d0afc5a69d1ca4ccd1a630faf3d5efb48b44ee","observation_id":"fdcf8ded-eaa4-48f4-ac5e-3ef9afc0e199","resolution":{"observed_at":"2026-08-12T15:00:32.797094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.778815Z","title":"Video generation models as world simulators.Ope- nAI Blog, 2024","venue":null,"work_id":"7668b309-67b1-4f60-a27f-bbf59787a920","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.577481Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:603ebf8df2c05b26f5a9379468cd2f4b25b1ed4baff2d31ba973187cecfeeea1","observation_id":"f75b73ef-49af-4791-8269-8e9a2363f1b3","resolution":{"observed_at":"2026-08-12T15:00:32.783433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.765127Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"3727c2b3-e0a1-4e1f-abdd-a2ab44d8375c","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.581261Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:b143456520646b8af2a291a314fd9d6dd77308c10770ca77f615df90c7329ece","observation_id":"eb1be525-3e00-4e47-9835-08ef5b59f461","resolution":{"observed_at":"2026-08-12T15:00:32.769593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.749582Z","title":"Efficient geometry-aware 3d generative adversarial networks","venue":null,"work_id":"733bdc1a-f94f-47f5-ac2b-591d9c28a06f","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.585350Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:a677cb7d0140af8d5cf8d63c2abba674f18b439c1a3d4c4bc16ff2a9b7f11eee","observation_id":"3d82438e-94fb-4764-95b3-9d558cdb7a53","resolution":{"observed_at":"2026-08-12T15:00:32.754149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.735155Z","title":"MaskGIT: Masked generative image transformer","venue":null,"work_id":"85e22085-159b-483e-9039-35db09e6bab0","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.588957Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:ff133c0c1b520132ccdf6125a5e9f63ff3b76a0a866a4f85d4da54343b3204e9","observation_id":"aa3b9a8d-a7bd-45b2-a84e-1161229179ad","resolution":{"observed_at":"2026-08-12T15:00:32.739628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.722000Z","title":"VideoINR: Learning video implicit neural represen- tation for continuous space-time super-resolution","venue":null,"work_id":"549c1074-0aed-4a03-bcb1-543a66f40111","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.592709Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:4413e06de55926ccdb2adc2150cccf43b23f8ee16b3b3c9a5cb97596bd70cb93","observation_id":"5e026116-80e1-4e49-bc7d-a2b52585c019","resolution":{"observed_at":"2026-08-12T15:00:32.726521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.708433Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"e9d0feb2-d5cd-4ed7-ab0a-1a1288f6dc26","year":2021},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.596493Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:02da22e5920d39149fcefc9f7d4ca66dd8721d1f804acb4ebfa10415881ee1c4","observation_id":"eb7fb135-130b-4adc-8f15-7e81c1d3dfcc","resolution":{"observed_at":"2026-08-12T15:00:32.713298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.692869Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"23c76726-4021-454a-9ae1-4e42f022b6ff","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.600143Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:07100c90c7ae50dc51cc750ef303b126e179afef28d627c94003cb109fb025e7","observation_id":"e3104583-958f-464b-8f19-53c50cea674e","resolution":{"observed_at":"2026-08-12T15:00:32.698626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.679861Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":"a866bc01-1785-40f5-be1e-acc63c3f6041","year":2025},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.603912Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:10c3460e5a9fa2eabedf15d60b665628a3993372185557153496575476c14d90","observation_id":"f3793d6f-e1eb-4587-aa6c-6d9df4e143f2","resolution":{"observed_at":"2026-08-12T15:00:32.683996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.666216Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":"39435156-92b1-4de3-9f7c-7def9851a40e","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.607393Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:ed5a0e986526f4f673cb03c370b8aa910599f2df0c44cd318a03c70b7bfaab3c","observation_id":"6ab4570e-0667-49a7-a293-7d0f1f07e86f","resolution":{"observed_at":"2026-08-12T15:00:32.670460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.654198Z","title":"Long video generation with time-agnostic vqgan and time- sensitive transformer","venue":null,"work_id":"5ecf458b-2967-4cd0-b63c-6f1ef520f821","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.611475Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:129febe3395d69edc064bdeb362694459774e094d7cb60e74e816b3b019016da","observation_id":"34bcc14b-7ae8-4cd8-8814-30d0d0ec37d6","resolution":{"observed_at":"2026-08-12T15:00:32.658379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:31.615363Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.615363Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:96232e62ed9b829cf1873294c1ce8bebb5b941875d0ea794970ea0cf3df90b80","observation_id":"97a2ac37-c453-4817-861f-2f0f12886975","resolution":{"observed_at":"2026-08-12T15:00:31.615363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.634443Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"64823b77-42d2-4289-98a0-b71712dea9b9","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.619377Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:f1142d76c6a9661b4639cd437f98eea4c40c937281ca652a25e984cd66ef0cf5","observation_id":"23499501-afd2-4824-a499-3965b05ee614","resolution":{"observed_at":"2026-08-12T15:00:32.638853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.621955Z","title":"A technical overview of av1","venue":null,"work_id":"ce136f18-3e49-4b20-9786-0e8a55a776f9","year":2021},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.623316Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:51e710c29e1ae961cb35e14949488154e6368df5fce42308d02ed50e1c936039","observation_id":"4db7a237-a658-48e2-87a1-e618b108fc0c","resolution":{"observed_at":"2026-08-12T15:00:32.626160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-12T15:00:31.627658Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.627658Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:7c3dd21ca1292a1b1d8170033ea7c9720791b1423e2e14b530dcb9a6426af4c0","observation_id":"9b64092f-be6f-4740-991c-a871edfe2b6f","resolution":{"observed_at":"2026-08-12T15:00:31.627658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.608251Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"d7b2722a-2506-4ef6-a96b-fd7b193914c3","year":2020},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.632169Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:f7855ef0c4ff04a9ab46ba8890dce1f918b265fe8bee0c5144474f0adeb6ec6d","observation_id":"7986910f-9192-4604-b608-ee87e563ef7d","resolution":{"observed_at":"2026-08-12T15:00:32.613170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.595795Z","title":"CogVideo: Large-scale pretraining for text-to- video generation via transformers","venue":null,"work_id":"1038e80e-787c-4b27-bffa-1ba46dd664e2","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.635831Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:26ba93f71cf83f7ec9153117feb2ec49fce35be8cd0fd10ab1e6edd0578e6e93","observation_id":"06fba8ce-8705-4ce4-aa4e-c69e33e6896f","resolution":{"observed_at":"2026-08-12T15:00:32.600180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.583166Z","title":"LRM: Large reconstruction model for single image to 3D","venue":null,"work_id":"94e0040f-bb3b-463b-b8c9-c171972c9edc","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.639953Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:04def98d68bb75e4f9746f34e879aeed592c5a7ee74a5039cb743b6f70fa3d14","observation_id":"b89f7285-0f2e-4717-92a7-7e192ee4b81c","resolution":{"observed_at":"2026-08-12T15:00:32.587947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02463","last_updated":"2023-05-03T23:59:13Z","snapshot_observed_at":"2026-08-12T18:09:04.196531Z","submitted_at":"2023-05-03T23:59:13Z","title":"Shap-E: Generating Conditional 3D Implicit Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02463","snapshot_observed_at":"2026-08-12T15:00:31.643821Z","title":"Shap-e: Generat- ing conditional 3d implicit functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.643821Z"},"links":{"cited_paper":"/paper/2305.02463","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:f196a8500be1870fb31c6e02375baa8abc388fcb2e297ad2e670d6279dd1bf9b","observation_id":"ccc72d19-cf63-4fcd-a704-37c7873e9d70","resolution":{"observed_at":"2026-08-12T15:00:31.643821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.571741Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":"0095e1b1-b13f-42fb-ad32-4a3cb2df4f88","year":2020},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.648125Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:6b40be6117aabfc9f7597543ea470f4e4dbdfecd26ef36cc988f753607f663c4","observation_id":"119ccc18-5727-4a3a-8897-8997a5ba4761","resolution":{"observed_at":"2026-08-12T15:00:32.575638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.559974Z","title":"Hybrid video diffusion models with 2d triplane and 3d wavelet rep- resentation","venue":null,"work_id":"2a2acc19-b4e9-48d7-8317-652baa18cc6b","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.651927Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:3e9b3a503eadfe5b812e221f1ba0773e6b0a487ce90ad1f3cae9b0ad9b0584ee","observation_id":"2583c661-2372-4d60-87fe-c2a7f33577af","resolution":{"observed_at":"2026-08-12T15:00:32.564535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.548273Z","title":"Scal- able neural video representations with learnable positional features","venue":null,"work_id":"ae21140b-3ed8-464b-89bf-a872a12d8bdc","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.656101Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:76ea61733f2170ca6156536b4fc26e284119e0b1c7be9629bf8f0dc575c2df16","observation_id":"9bcbdfec-f263-4587-879f-00f1ef29cf94","resolution":{"observed_at":"2026-08-12T15:00:32.552140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.536527Z","title":"9 Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":"fac7f024-d23a-4c34-9540-925c951072a2","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.660065Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:2977437fe4fa389c9d3f83f43adac513019de67a0cd92ab6547589ae590c31b8","observation_id":"b01e019c-8d81-4a69-91fb-c4a39d026ed2","resolution":{"observed_at":"2026-08-12T15:00:32.540537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.523090Z","title":"One-2-3-45: Any single image to 3d mesh in 45 seconds without per-shape optimiza- tion","venue":null,"work_id":"af2d5e09-15e1-4a11-8290-0f272f27afe4","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.663773Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:6f926182934ae96777fd7d1f6c5283bb46b8c877486012519706103820481c72","observation_id":"89bcc7af-9278-4274-9cf9-8bb033ec06c1","resolution":{"observed_at":"2026-08-12T15:00:32.527621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.508646Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"42b52bc2-84fe-4857-ac5a-24af58b92d9c","year":2018},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.667725Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:5b859958da20082c0fd6f28e00ad30a87a978e1135995ed177093e54d3c5448a","observation_id":"25a2cb62-04f1-4d72-9ff9-3a1e82af3650","resolution":{"observed_at":"2026-08-12T15:00:32.513140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.496991Z","title":"Vdt: General-purpose video diffusion transformers via mask modeling","venue":null,"work_id":"5af450c2-567f-46b3-82ba-cdbd035c7c2c","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.672238Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:332be4910bfc3776b3b3426fb7b67af5f92e9c45d769e63a4204c6f7bcc39371","observation_id":"4b571676-00d6-4ce0-a8ca-29d01e70efc0","resolution":{"observed_at":"2026-08-12T15:00:32.500891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.485181Z","title":"SiT: Explor- ing flow and diffusion-based generative models with scalable interpolant transformers","venue":null,"work_id":"58b5817b-13cb-4593-a84a-37293d0dfb19","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.676893Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:8cc49d57553f9faecf73d5f25a3396076c6b26dc40fe118042484ddf1259ca4c","observation_id":"bc0fb863-4141-40b1-a09b-09d638cb210f","resolution":{"observed_at":"2026-08-12T15:00:32.489274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.473644Z","title":null,"venue":null,"work_id":"34bc9aad-c864-4da5-8fcf-3d8f58227596","year":2006},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.681174Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:26e69c55c0dde01d4ca3bb545ded950b27863bd266159cc16bff3ff0a988e1ae","observation_id":"d457ce73-e466-4c2e-8381-becbc9a8c05f","resolution":{"observed_at":"2026-08-12T15:00:32.477424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.462602Z","title":"GTA: A geometry-aware attention mechanism for multi-view transformers","venue":null,"work_id":"4f31641d-a066-4c9a-8d46-4629191a34e5","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.685014Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:6bef28e59c59a4aa151dde0e831ae5e36390f9c90939957888d16aa5337ee779","observation_id":"67b4eefb-c27d-444d-9096-c39431ff008a","resolution":{"observed_at":"2026-08-12T15:00:32.466216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.451450Z","title":"A technical overview of vp9—the latest open- source video codec","venue":null,"work_id":"568e3f47-24e3-48d4-89b3-a395aa3ae1bb","year":2015},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.689257Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:5e6a0668d771a3e7396cfce8113e9db2c9082f0831d7ed268a049ea74128b9ae","observation_id":"1dbf2046-3ea5-4a77-93b0-f49b07b4714c","resolution":{"observed_at":"2026-08-12T15:00:32.455366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.440207Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":"e4d13183-4e47-405c-8426-19ff727ddec6","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.692949Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:9c282dd00c5be714a12c30fe0a7a5f69f4b457cfffd885d9fbfed94bbc476c02","observation_id":"ad6e4414-6f95-47fe-a77c-c24e55c5d805","resolution":{"observed_at":"2026-08-12T15:00:32.443835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-12T15:00:31.696802Z","title":"Searching for activation functions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.696802Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:4767849af55ebdb1bff7d29e7bf52a84dcf8f4dc401da2b00cb05d66a3db27ae","observation_id":"57d5776b-bb05-4dcc-a1c5-a1ef3a6604e4","resolution":{"observed_at":"2026-08-12T15:00:31.696802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.428861Z","title":"Gen- erating diverse high-fidelity images with VQ-V AE-2","venue":null,"work_id":"ce3cbe37-7e89-4a76-8eed-f71f21bfb40a","year":2019},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.701691Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:8a93dde8e9b1dceee72a1a6b5cf3a07adc47658ce08aafe6da8c261c079ca637","observation_id":"5aa3a3e9-6158-4f0f-9702-dac7df8b7070","resolution":{"observed_at":"2026-08-12T15:00:32.432784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.417787Z","title":null,"venue":null,"work_id":"3a9227d6-952c-4521-91b5-e2a85cf88526","year":1996},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.705694Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:9404d71b800fc196bc306814dd622434117df9d09280a38064325ff39fa744bb","observation_id":"f2886f5a-f047-40c4-af65-c37818a9c56c","resolution":{"observed_at":"2026-08-12T15:00:32.421758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.405138Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"39743667-7018-475e-916b-1728951992f6","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.709569Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:b25dd6168e1dc72b63a14b91f95966262408f3a28544076cf3ee49b6cf02f5d5","observation_id":"a18308e8-319a-4fe1-b3e3-757968f84b19","resolution":{"observed_at":"2026-08-12T15:00:32.409639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.392365Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":"fc5c2051-b576-40f3-ad20-4d97ac9e4754","year":2015},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.713764Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:80cd2b26abfb6eef8cc66a87cef42ac47be9d74c3924fbd2606246695fc5153c","observation_id":"3d34d4a6-566b-48cd-a0bb-1362fd2f2706","resolution":{"observed_at":"2026-08-12T15:00:32.396543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.380933Z","title":"Make-a-video: Text-to-video genera- tion without text-video data","venue":null,"work_id":"d2e8a3bc-53a7-4d5f-8f64-4c72970f989c","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.717461Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:74fc10439e2d2c2c27a69cf584e6a28b7243344c676684d69e6711f970dcb33a","observation_id":"91c6350e-d218-4ee8-9233-7f2c3d88a18b","resolution":{"observed_at":"2026-08-12T15:00:32.384816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.369570Z","title":"Implicit neural representa- tions with periodic activation functions","venue":null,"work_id":"e6cfd303-c6c2-44c6-a377-b7f0bc9c6c98","year":2020},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.721583Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:525e86eb84535d9b04938163f486a41dbb9171e6a132b9d11086a64f29fb4cb6","observation_id":"f3185d23-d447-4bdf-a296-083fe22438fb","resolution":{"observed_at":"2026-08-12T15:00:32.373542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.358434Z","title":"StyleGAN-V: A continuous video generator with the price, image quality and perks of StyleGAN2","venue":null,"work_id":"a9b33314-92e6-4813-a5a7-b4444c78da20","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.725686Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:a8fe6a0e42ebb5f133161bf092c3f4caa931594b2689f55c826f65114e14140e","observation_id":"13444ad6-3774-42a8-9510-6b8b174bca62","resolution":{"observed_at":"2026-08-12T15:00:32.362332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.346479Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"3c23b4a5-004a-4971-9544-be9ea4819d68","year":2015},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.729635Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:33afbcde2eef7303e6ffed1806e27e99907c2b0cf01c0067d5e78881676c0ae0","observation_id":"9fff845b-dfb7-496c-b99e-717e285337d9","resolution":{"observed_at":"2026-08-12T15:00:32.350579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:31.733649Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.733649Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:dfc32cd139c56ec43d976c8d4378db98a02ff95ec0ae086b903e2d60434123b3","observation_id":"1f597a3a-b91d-4043-a645-2e654262f980","resolution":{"observed_at":"2026-08-12T15:00:31.733649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-13T22:00:40.727122Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-12T15:00:31.737759Z","title":"UCF101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.737759Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:4da0fba77f9a456285347b671bc8e23b2dd6bff0e95b4812a52b88da13a189f2","observation_id":"d5c6504b-2b2a-4f1e-be6f-544205df4572","resolution":{"observed_at":"2026-08-12T15:00:31.737759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.322561Z","title":"Overview of the high efficiency video coding (hevc) standard","venue":null,"work_id":"345e6933-181f-436a-984d-a109f44758ee","year":2012},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.742133Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:2758d81c2daf665961b15ead484e49a9da14e194e24b936173677e5e2844422d","observation_id":"4d800118-b594-4f40-a788-3b185c273d1f","resolution":{"observed_at":"2026-08-12T15:00:32.327288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.308816Z","title":"High efficiency video coding (hevc)","venue":null,"work_id":"decf5b28-003c-4e52-9129-389e5333dd87","year":2014},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.746289Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:d115a12e69e93d8191bae7e8a993e3a41fba1de5f4d6f60604326799e25d2a66","observation_id":"3ef89911-018b-4328-8a64-e81a56f45be6","resolution":{"observed_at":"2026-08-12T15:00:32.313267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-12T15:00:31.750358Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.750358Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:d649af51addbcf163984beed16e4b3ce0acd32cb19f4f5ba41d4484c8f9c2b16","observation_id":"cb39484a-e85c-428f-8d84-f58fea5c2a79","resolution":{"observed_at":"2026-08-12T15:00:31.750358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.295994Z","title":"A good image generator is what you need for high-resolution video synthe- sis","venue":null,"work_id":"876851cb-942d-4caa-9936-ad4b71719682","year":2021},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.755065Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:66a5b9c8f3e8ffafb22966530c9242f0364e6a5ed9a4c204b642fcdf31da7c1f","observation_id":"0215fffb-bf82-4712-85b6-80e83bcdab26","resolution":{"observed_at":"2026-08-12T15:00:32.300153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.282196Z","title":"MoCoGAN: Decomposing motion and content for video generation","venue":null,"work_id":"2cf9bfa6-bf18-46e3-bb73-2a93f1c3f303","year":2018},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.759054Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:bb0ba6e7aebe6d495c12ff6ad94293ec7740f35a60e58870030d5f50a3fb508f","observation_id":"7fb30c56-3d25-4d54-9f8f-83e725facdc9","resolution":{"observed_at":"2026-08-12T15:00:32.286251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.269962Z","title":"FVD: A new metric for video generation, 2019","venue":null,"work_id":"78640949-0513-4161-9951-1ffb4891f844","year":2019},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.763337Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:927b9797f0558dc2caabe7896cad878873c85eb6db6e5e2d1a01075c968b0f50","observation_id":"9097d2a1-1571-4097-897d-24e5046186b7","resolution":{"observed_at":"2026-08-12T15:00:32.274143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.256020Z","title":"Neural discrete representation learning","venue":null,"work_id":"b91fbd0a-cb46-43d0-955d-ae6500d9b6c5","year":2017},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.767489Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:8a40b6c226c49ff31f27a2ea4261602b349d8697fa18c096083d5127260a3700","observation_id":"4d08fda6-9913-4f49-bf22-d1030e6af355","resolution":{"observed_at":"2026-08-12T15:00:32.260738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:31.771230Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.771230Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:23b5b9643aeb59f4e1350ccdcc2b84796bc3ccb3ac7958aa2e11ac4f9cd2da25","observation_id":"77a92c12-139b-4592-98c1-d859db907317","resolution":{"observed_at":"2026-08-12T15:00:31.771230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.234895Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"b7f1f18d-c86f-40a3-a576-de8d2646bc38","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.775210Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:27d2adf0553f07f0bf8bedb1d49acaa90053c9126c066d7ccb95d5a9672ca34a","observation_id":"1e750476-372d-4cb5-a05b-aff5c483d654","resolution":{"observed_at":"2026-08-12T15:00:32.239330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21264","last_updated":"2025-06-16T22:06:19Z","snapshot_observed_at":"2026-08-14T16:06:34.494217Z","submitted_at":"2024-10-28T17:57:07Z","title":"LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21264","snapshot_observed_at":"2026-08-12T15:00:31.779652Z","title":"LARP: Tokenizing videos with a learned autoregressive generative prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.779652Z"},"links":{"cited_paper":"/paper/2410.21264","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:e8d8b67a7c5354a92327c6592ba7e3f761f9aa32b76defa1f0fad58e9d401811","observation_id":"5e73021d-f44d-4ac8-8af3-0535260537c7","resolution":{"observed_at":"2026-08-12T15:00:31.779652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.219859Z","title":"OmniTokenizer: A joint image- video tokenizer for visual generation","venue":null,"work_id":"ae3cf756-4747-446d-a9ee-e2ab684c6a77","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.784395Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:120f652816e3f098ef39bfcb11866126813bc6b22714b2ba94e06dc42a741977","observation_id":"f7fc426f-fe45-4413-af71-f7bb0955850c","resolution":{"observed_at":"2026-08-12T15:00:32.225131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-12T15:00:31.788200Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.788200Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:768ba236fe035edc958b1e849ebaec1e8355c4add406442c8c09c6c432d7771d","observation_id":"2d9ba59e-87c2-4426-b397-bd9c44f16421","resolution":{"observed_at":"2026-08-12T15:00:31.788200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:31.793683Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.793683Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:95f3764ad6d9bc7382f341aa8aa790a40804a3939ee4c61a92f6080e789664e4","observation_id":"62662224-3a6e-4b82-bace-80303f622e74","resolution":{"observed_at":"2026-08-12T15:00:31.793683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.190484Z","title":"Overview of the h","venue":null,"work_id":"16f62310-7d96-4584-8b40-7560826d4027","year":2003},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.798745Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:7742ba73f2ad7c0c8b9260c4bdda96e9b88a2f4715b365a896ee1bd16c55a5a5","observation_id":"f9676269-962f-46f7-aaa5-e263ee516df8","resolution":{"observed_at":"2026-08-12T15:00:32.201195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.176864Z","title":"Group normalization","venue":null,"work_id":"16433f8a-a2e2-4b75-ac39-61ce24e21026","year":2018},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.803530Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:53a17add8c2ebb2ae2a14d845b644397d5662cdb80498c7565fea4fa9300155e","observation_id":"8f20aa74-0595-41db-8739-232e8b4a8c1e","resolution":{"observed_at":"2026-08-12T15:00:32.181726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-13T14:30:50.605700Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-12T15:00:31.807670Z","title":"Videogpt: Video generation using vq-vae and trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.807670Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:974f650e9de65bcc7c98edcb5b14e1f6cce4ef3b1eaee8e1ad6c0eaeba1f8bb4","observation_id":"0a4afa8b-aee9-4585-8e79-e699a29ca685","resolution":{"observed_at":"2026-08-12T15:00:31.807670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.164374Z","title":"Temporally consistent transformers for video gen- eration","venue":null,"work_id":"4d409c51-2f4a-4327-b9aa-b9bf684cadcc","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.811547Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:9766509f425d1b4c189ac6244ac2bdf971b2bcf5120537f9d5c8d6ed91f223d9","observation_id":"d2082f80-eb7f-4a40-9876-f6cc0be50748","resolution":{"observed_at":"2026-08-12T15:00:32.168884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08368","last_updated":"2025-02-02T19:28:27Z","snapshot_observed_at":"2026-08-13T14:17:36.830788Z","submitted_at":"2024-10-10T20:54:15Z","title":"ElasticTok: Adaptive Tokenization for Image and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08368","snapshot_observed_at":"2026-08-12T15:00:31.815756Z","title":"ElasticTok: Adap- tive tokenization for image and video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.815756Z"},"links":{"cited_paper":"/paper/2410.08368","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:205607a6a5df34e823b7de2e05877bae74ac94c505cb3daffd45b65d421d69c2","observation_id":"47d1455c-4771-4e51-b3fa-d1ece7871991","resolution":{"observed_at":"2026-08-12T15:00:31.815756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-12T15:00:31.819677Z","title":"CogvideoX: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.819677Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:18445413a9fd63e8a52a20694831313923cd516514ef5ee5ff7192d65db8bb5a","observation_id":"4992d67d-bb4f-46f8-b665-d215be3bcc53","resolution":{"observed_at":"2026-08-12T15:00:31.819677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.151320Z","title":"Towards end-to-end generative model- ing of long videos with memory-efficient bidirectional trans- formers","venue":null,"work_id":"bca3ec90-fcab-497a-bd9c-391df072d954","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.823951Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:0dbff4f3934be23666a1a54fd7e6f1576acace65b5d1f1c87ed3078fb5fd64a8","observation_id":"1dd3f11c-d7c5-4685-83c3-505f9eec3555","resolution":{"observed_at":"2026-08-12T15:00:32.155536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.138104Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"52999631-6ad2-401a-8ac8-070ebb4e1e72","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.828818Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:4d0561271d0a0104eefa043f8d66608b393e52169cfb672d886ad236da903b22","observation_id":"165bd51e-bf33-4a2c-ae8b-8b7a02a5f4fe","resolution":{"observed_at":"2026-08-12T15:00:32.142567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.124956Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":"013aa276-fad9-468f-9eb4-73ecd2ba00e9","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.832494Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:988c927037db4187864c4639274c8bb0b832dc6a0c84c0856a5488d693ccc0f0","observation_id":"63aef45f-b108-4b22-9938-1df582be05ac","resolution":{"observed_at":"2026-08-12T15:00:32.129370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.111873Z","title":"Generating videos with dynamics-aware implicit generative adversarial net- works","venue":null,"work_id":"83785e9c-5e0e-461c-bcfb-29dad88f47d9","year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.836383Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:025f6f641a1891f7afc0c35838683ade0ed509a324bab89d551d0880f0c2f633","observation_id":"610180e5-aa84-4e69-8a43-d941f533ed4d","resolution":{"observed_at":"2026-08-12T15:00:32.116479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.098622Z","title":"Video probabilistic diffusion models in projected latent space","venue":null,"work_id":"b189c62c-282b-4ce6-964f-f1cfa416f196","year":2023},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.839912Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:fb0b3c2f1c57457f27048736278c3653a25b5c760739c75b3090c77516f2fc23","observation_id":"acdafe3f-e627-4e2f-8b1e-01db5e71de82","resolution":{"observed_at":"2026-08-12T15:00:32.102853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.086257Z","title":"Efficient video diffusion models via content-frame motion-latent decomposition","venue":null,"work_id":"c6b4efd8-111a-4d9b-bc7c-9a5cfe508ddf","year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.843624Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:383366d7606f2438f18ad326172db291e1e0e5526d76bb5f79c136e9dd596013","observation_id":"b29d40b4-e2b6-46a0-89e3-48e5402a8ac6","resolution":{"observed_at":"2026-08-12T15:00:32.090647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.071035Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"74a0dbad-a44e-4996-b0c5-67589142261c","year":2018},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.848252Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:1731dddd88b3dbff22240b0cf75fba5c197221ba0d0f5ce7307dd3fbc9d63dbf","observation_id":"a37244c2-9d80-4882-ab5b-a1cc90c788c6","resolution":{"observed_at":"2026-08-12T15:00:32.076180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-12T15:00:31.851805Z","title":"Transfusion: Pre- dict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.851805Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:5ae4cb490a2a447df9a6177571161dc2e8c6fe131b8baa8c47f53565ec8ca00b","observation_id":"242ebf3b-1c68-4012-a82f-02b04a5cc823","resolution":{"observed_at":"2026-08-12T15:00:31.851805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-12T15:00:31.855686Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.855686Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:912154201db088e75d47a4a28683e357263977721396dd077f76f2a3fde60d6b","observation_id":"6b27ceea-0e36-440c-ac8c-cd605693df84","resolution":{"observed_at":"2026-08-12T15:00:31.855686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.056325Z","title":"Architecture We use the same structure as SiT, except that our patch embedding and final projection layers are im- plemented separately for each plane","venue":null,"work_id":"a2c14f93-d460-4601-933b-a7dadf181726","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.859918Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:1175f8a37bdb1337e373daa2e5ebe3b61a1b17b7de0a068cb4a80609ded14371","observation_id":"9edbdde8-17b5-41f8-8473-b1604ffba88c","resolution":{"observed_at":"2026-08-12T15:00:32.061934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:00:32.041516Z","title":null,"venue":null,"work_id":"e9d71043-c6f4-4b34-89b6-da7f00c5c3ac","year":null},"citing_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:31.863822Z"},"links":{"citing_paper":"/paper/2411.14762"},"observation_digest":"sha256:65f667b45633b010b9e52f4332df931bfb3692c10812d60ec17067cc85538b3f","observation_id":"4d1fa4bd-360f-484c-8f47-e2142ff03862","resolution":{"observed_at":"2026-08-12T15:00:32.047444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T17:08:43.319337Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 1 inbound Pith citation observation for arXiv:2411.14762."}