{"as_of":"2026-08-13T03:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd0da65c2bacbfdf456cbbdd8f6313d82cc2adaff8e190df48101a510b4e2c52","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:30:08.639585Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.04432/citation-record","integrity":"/paper/2412.04432/integrity","json":"/paper/2412.04432/citation-record.json","paper":"/paper/2412.04432"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.168681Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.168681Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:8f3fc06ee34e3292fa16fed1d4d96ff654d5188b56b92d99060affce1d517772","observation_id":"88694565-ba9c-483c-9310-62f1116ee105","resolution":{"observed_at":"2026-08-11T21:30:08.168681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.176057Z","title":"Frozen in time: A joint video and image encoder for end-to- end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.176057Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:566f90295d8fd65615ff31a130ebdf45ddc6f865fcccbbc71d13227a34380413","observation_id":"a66d8743-ee4c-4cf2-a342-e0680679f100","resolution":{"observed_at":"2026-08-11T21:30:08.176057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03126","last_updated":"2022-03-16T01:35:49Z","snapshot_observed_at":"2026-08-12T01:15:35.596933Z","submitted_at":"2021-12-06T15:55:30Z","title":"Label-Efficient Semantic Segmentation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03126","snapshot_observed_at":"2026-08-11T21:30:08.182315Z","title":"Label-efficient seman- tic segmentation with diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.182315Z"},"links":{"cited_paper":"/paper/2112.03126","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:77c564a06d5e0c3e89912cacfdbbe52499032d105c8a3e8e93f35ff2ed88081b","observation_id":"c3653f49-ce7b-4db9-bca3-17cfb9b98bfe","resolution":{"observed_at":"2026-08-11T21:30:08.182315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T21:30:08.188344Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.188344Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:13b3ee51bdeb1034b4b7b0d6620012c17b0407917b3ce1cf102634928284f346","observation_id":"1141abc7-39f4-4ee4-8990-e6794b58c03d","resolution":{"observed_at":"2026-08-11T21:30:08.188344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.194537Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.194537Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:7bef8186c8c08a1b1a898309c7ae4f5d99c9d58725efda7c0f153766c666c1a4","observation_id":"efe63e62-cdbc-402e-9126-83c9b5a1a303","resolution":{"observed_at":"2026-08-11T21:30:08.194537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.200580Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.200580Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:f45ff6ea272e44b05197febdb59ae0339450ae9f8dc724e6c547a7788bee776f","observation_id":"909f728c-c898-4638-8dcf-45839aabe643","resolution":{"observed_at":"2026-08-11T21:30:08.200580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.207912Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.207912Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c854d9e76227d81eda1d84630f0bfa75a148ac1f5de7c080d2d37959bd396cce","observation_id":"86c3547e-c80a-4fff-86e7-bd5e635aa5ee","resolution":{"observed_at":"2026-08-11T21:30:08.207912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-13T01:39:12.659510Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-11T21:30:08.215677Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.215677Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3bf47b9c9348d7511d2e75ab61d838463232874db2fc8b9a4395a7094ced71bd","observation_id":"2b16fd6b-064d-41c6-964e-870eaf58ba7a","resolution":{"observed_at":"2026-08-11T21:30:08.215677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.223266Z","title":"Panda-70m: Captioning 70m videos with multiple cross- modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.223266Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3b3bd87faa6e611bd432aa63e8e0b819e43ee4d0a2d435f730d8bdc66069d980","observation_id":"c0ce776a-30ba-417f-b86f-382fbed87148","resolution":{"observed_at":"2026-08-11T21:30:08.223266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T21:30:08.228320Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.228320Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c87c6936292fe0d4c4f963bae2ce1efc2664f552d3bfe4de786f1dbc314632cd","observation_id":"1b448b3a-e129-4e2f-ae98-5b15608bdc83","resolution":{"observed_at":"2026-08-11T21:30:08.228320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-11T21:30:08.233464Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.233464Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:89ed18539658ec7dd234c18b501e5f2dd825dcc2a52ee5e3f76147e29f5c218d","observation_id":"1e5ce52d-6fdd-4227-813f-db3e6673e0e7","resolution":{"observed_at":"2026-08-11T21:30:08.233464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-11T21:30:08.238448Z","title":"Dreamllm: Synergistic multimodal com- prehension and creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.238448Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:ca847a69137e47ee41fa1cd776ae471500511753b2dcd83528ac7862c8cf0f11","observation_id":"ed797b34-139a-4a90-b8a4-5d1692e981bc","resolution":{"observed_at":"2026-08-11T21:30:08.238448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T21:30:08.243491Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.243491Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:5b7f40128fa3d74551435d9103ba06ac664471c52beb9a02e56f97ea74b2d9bf","observation_id":"13653f45-ea1f-44b6-84ae-2caaae821200","resolution":{"observed_at":"2026-08-11T21:30:08.243491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.248720Z","title":"Preserve your own correlation: A noise prior for video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.248720Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:df03fc5280efac251924e28cf6f937c1c09c8ba1e44f33565d1a51c278334aaa","observation_id":"6688d341-cf16-46d8-93cb-9d55b7306015","resolution":{"observed_at":"2026-08-11T21:30:08.248720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08041","last_updated":"2023-08-12T04:42:29Z","snapshot_observed_at":"2026-08-06T07:20:51.958343Z","submitted_at":"2023-07-16T13:41:39Z","title":"Planting a SEED of Vision in Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08041","snapshot_observed_at":"2026-08-11T21:30:08.253576Z","title":"Planting a seed of vision in large language model.arXiv preprint arXiv:2307.08041, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.253576Z"},"links":{"cited_paper":"/paper/2307.08041","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:77f4260e23ce156bad14770cc860770c18d5ede0c83356beda7fb9151834136a","observation_id":"61e1d6ab-c3e5-4ca6-b4f9-94f8caa32e1e","resolution":{"observed_at":"2026-08-11T21:30:08.253576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-11T21:30:08.258608Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.258608Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3e19608f950dc381638f5258bcbff160c4e2f8387dfeef69cc05beedb0fefdbf","observation_id":"340650dd-c441-4c0e-abe9-d8a31787b639","resolution":{"observed_at":"2026-08-11T21:30:08.258608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-11T21:30:08.264244Z","title":"Seed-x: Multi- modal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.264244Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:5d18f6b42d01d6c18c9f247e4fbaf0c07fc047972167b1972315c7c1212a1f82","observation_id":"becff120-b99a-4655-9fd4-f82b888aec5f","resolution":{"observed_at":"2026-08-11T21:30:08.264244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.270201Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.270201Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:db983d67bdd87e709f47bf652dce838749d7a4cfad691e932ed98902c0805f4a","observation_id":"e32baaa1-befe-4e5e-aea0-dd386d2109a2","resolution":{"observed_at":"2026-08-11T21:30:08.270201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.275037Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.275037Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:f4c717c1f161c96305b9e452e935ee14bc1c8d4df0cd5907a3b12aa9ea27fe58","observation_id":"3ba5d9ee-2ce3-4e7b-819b-55bf959b6088","resolution":{"observed_at":"2026-08-11T21:30:08.275037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.279158Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.279158Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:1ee5fb9bfe7065d56eef62b02ad1411718c4e6f624c69505e1cb15eb2ca84872","observation_id":"0a968b18-3a95-4fea-81de-f8fef9e5b59f","resolution":{"observed_at":"2026-08-11T21:30:08.279158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-11T21:30:08.283173Z","title":"Cogvideo: Large-scale pretraining for text-to-video gen- eration via transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.283173Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:a994ac30cbf543e8b49fdb64731941f6a3a6058a41aae714e930c99c613c0200","observation_id":"b755da2d-c28e-4cc4-9a73-49602892c054","resolution":{"observed_at":"2026-08-11T21:30:08.283173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T21:30:08.288095Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.288095Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:f1d63ea3ec87ba25181802b11fd23d446537b678a973a78d15ff71865201fa3f","observation_id":"22240207-50b5-41fd-8fcf-ec7b6705b946","resolution":{"observed_at":"2026-08-11T21:30:08.288095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.292734Z","title":"Soda: Bottle- 9 neck diffusion models for representation learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.292734Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:7f2b339bd1ebff84247f4c2ac01bcecac33f27c519f26ac726fde41e51dd9aae","observation_id":"5d5f184f-f8a5-4363-897c-e257a19ae903","resolution":{"observed_at":"2026-08-11T21:30:08.292734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T21:30:08.296984Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.296984Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:447c1a9c0dc8e2af194e60d066f91809b85a6cd47ab2ea7cd116a154015623ef","observation_id":"cb7702ea-a184-4ec5-bd09-88df05d65a5f","resolution":{"observed_at":"2026-08-11T21:30:08.296984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.301962Z","title":"Unified language-vision pretraining with dynamic discrete visual tokenization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.301962Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:5acfe18eaddf0e590cbe6f84a0474f427f899ddb536062ca9b2476770aef5f62","observation_id":"29319ca1-0dca-4645-828c-3294497c6842","resolution":{"observed_at":"2026-08-11T21:30:08.301962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.307015Z","title":"Video-lavit: Unified video-language pre-training with decoupled visual-motional tokenization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.307015Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:7b3265cc799774b9f2ab2322676da4192a5a7a4ba6e9603e36426d280873a1ad","observation_id":"75d80948-3a44-42e7-9357-0bdca8bf4644","resolution":{"observed_at":"2026-08-11T21:30:08.307015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T21:30:08.311855Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.311855Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:b89b9f4d17e507ace41d97adf7fec126144d6873c8b178ac0d89222ef56aa423","observation_id":"29bb5ce6-43a3-407e-b862-90e29103bc8e","resolution":{"observed_at":"2026-08-11T21:30:08.311855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T21:30:08.317096Z","title":"Auto-encoding vari- ational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.317096Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:4b88db9c0f2dc338c3b67cdf16fa8ed57948db76e73cc2b922776ad79a2c5e7d","observation_id":"85f4df18-8a6f-4929-89a7-9cd91a6c13e1","resolution":{"observed_at":"2026-08-11T21:30:08.317096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-11T21:30:08.321924Z","title":"Videopoet: A large language model for zero-shot video generation.arXiv preprint arXiv:2312.14125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.321924Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:2b2264bab214d90388b2dbf2a39446200a34b9aa1606f584f3171af784fc3c79","observation_id":"89b8fc7b-47c5-489e-8ce0-d763fdc692b5","resolution":{"observed_at":"2026-08-11T21:30:08.321924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T21:30:08.327003Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.327003Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:d0c90122786efcbfa00b73e96e68eec75d5fbe95d4816b58845501fc07fa09af","observation_id":"f919c1c9-babb-4d9a-a1db-0dd7a2363342","resolution":{"observed_at":"2026-08-11T21:30:08.327003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-11T21:30:08.333026Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.333026Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:cd031a3cd8164d89d5d824f3da899e9fc3abf0bcc54d35a4887624b0adff6821","observation_id":"ae669222-29c1-4638-a93e-276574568f4a","resolution":{"observed_at":"2026-08-11T21:30:08.333026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.338245Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.338245Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:2d559ccaeaec9aaeea9c4e51ee3dca5c90e856d4387b3678d187f6700c3df60d","observation_id":"9fa4197d-2cbb-4e51-ab97-6a21c561bf87","resolution":{"observed_at":"2026-08-11T21:30:08.338245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-12T23:40:46.718337Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-11T21:30:08.343535Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.343535Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:e5bc2335f856f795f028da9310ae1ca2f5b3094c075d85020b06a252fd6f1de4","observation_id":"1861889d-2ac4-4230-8f59-d8d84a041b02","resolution":{"observed_at":"2026-08-11T21:30:08.343535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.348486Z","title":"Tgif: A new dataset and benchmark on animated gif description","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.348486Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c5fc379c6041b25dfa64b0c522219f55f2450a5462ba7e92bfeb7444a889426f","observation_id":"b5e12df6-ef38-45fc-86af-f14c4ddeeb1c","resolution":{"observed_at":"2026-08-11T21:30:08.348486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-10T13:02:01.821606Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-11T21:30:08.353411Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.353411Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:9102e757346904cf1f5bcbd242833100f7f030f76e110e9dbb55a278be65a728","observation_id":"af313e59-6bb0-49e6-8aba-a3778c0c5bbf","resolution":{"observed_at":"2026-08-11T21:30:08.353411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-11T21:30:08.358731Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.358731Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:d73622799fe32af9a537ac5c490f03005f47a5526f47c9821395427db8783008","observation_id":"634a98ee-5c43-499e-a08b-822ca1cf8a47","resolution":{"observed_at":"2026-08-11T21:30:08.358731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T21:30:08.364042Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.364042Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:da72f04856767e60f69e0cb0443553a1208459b0216620a96d0695f1337d9b92","observation_id":"cf0289fb-3bf5-4700-8762-b53642a822f8","resolution":{"observed_at":"2026-08-11T21:30:08.364042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.116498Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":"ce4c1918-2ff6-446f-8477-f478f9eed19c","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.369328Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3f7180e18c41bb10156bc3c3c9cd011a0fe96cf6b9069f74ed7a58408446a05d","observation_id":"2babac02-5914-4200-a41a-0875694d62ee","resolution":{"observed_at":"2026-08-11T21:30:10.121409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.374239Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.374239Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:b42d082691c3d767ed48dfa00bf0512fe82e3cfbadef4712f5a0e8a58c8aff0a","observation_id":"810fa34a-c5b2-484b-b674-741ba7105249","resolution":{"observed_at":"2026-08-11T21:30:08.374239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-11T03:45:32.889856Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-11T21:30:08.379980Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.379980Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:39a465f4e11b60c49f13a8e25fe570bed52594d3bc2a57387bc8d623b9d02bd9","observation_id":"2e1afc70-109d-4c54-9589-d9d3e2102445","resolution":{"observed_at":"2026-08-11T21:30:08.379980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-01T22:57:31.468506Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-11T21:30:08.385354Z","title":"Unified-io 2: Scaling autoregressive multi- modal models with vision, language, audio, and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.385354Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:53b639ae78a4eca7850f74efdb119a41583a227d63cfa2a633fe80e08fe8fe3a","observation_id":"e8ef846f-071d-402c-b08e-c4830fcd9b60","resolution":{"observed_at":"2026-08-11T21:30:08.385354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T19:40:57.491981Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-11T21:30:08.390529Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.390529Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:d8e4abdb55ca21982f0bad4452ad03431786c56d9e9fd996f1bcedcea3eb118c","observation_id":"3bdb0bea-db6f-4b54-983f-14f23fce4394","resolution":{"observed_at":"2026-08-11T21:30:08.390529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T21:30:08.395867Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.395867Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:a52aab534bdf62fdf158d5783db5e590f07e3c42e1126b752c65cbebf15cf86c","observation_id":"9ac167ca-53c0-45e6-9f98-d13922eae03e","resolution":{"observed_at":"2026-08-11T21:30:08.395867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.087024Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"7553f58c-b3a2-49d7-8cd7-91da18def8c3","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.401277Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:539066209f84924e17ebbb258646f9ae36ed53d40b1063c57961695e59b615d4","observation_id":"7982e3ec-573f-4b6d-b0f6-0bf9b7ce002e","resolution":{"observed_at":"2026-08-11T21:30:10.092270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.067820Z","title":"Snap video: Scaled spatiotemporal transformers for text-to-video synthe- sis","venue":null,"work_id":"012f0579-6b6d-4828-a8d1-b75c33871393","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.405298Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:b9ce2741c4bcbc56d35dfca028630b6c3367f798b9b812014f15dfd9590616d4","observation_id":"b83e4cab-1aff-4174-94e9-3686c3919300","resolution":{"observed_at":"2026-08-11T21:30:10.073428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.051605Z","title":"Gpt-4v(ision) system card, 2023","venue":null,"work_id":"bfcdba90-d143-4486-9361-6ab28682ea4e","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.409431Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:f0c3dd96a6d94ec859a823d2923c14ad8803eea93f96b3e1615097c585988fac","observation_id":"584aa6ec-297e-4804-bb3b-1efd5c2e749b","resolution":{"observed_at":"2026-08-11T21:30:10.056575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.035746Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":"daf7a5ee-97aa-4a70-be27-14564744da06","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.413406Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c87096ce61db69120c73f3a7fa8a995b324ac135919c77b0f656632d23dff535","observation_id":"e460fd8c-2921-4eb6-aa4a-144f7c26046f","resolution":{"observed_at":"2026-08-11T21:30:10.040769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.020136Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"0fcb3261-b138-438f-b30f-43a23887d5fc","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.417513Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:8c978e185545a591506ee689790457dc3e9239f7fefe053f02f4a13c20187c00","observation_id":"2d65fc94-30e8-43fe-8193-24a3d17670ff","resolution":{"observed_at":"2026-08-11T21:30:10.025216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.003289Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"39a4333f-71c8-4a44-9adc-d6b73335fe85","year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.421944Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:97873cd8cfd0127b2cb4dfbbebc2602a2772997812f82d662d86c582eed83b47","observation_id":"8b5e5b8c-d601-4d6d-81e5-48b7e6a3ac27","resolution":{"observed_at":"2026-08-11T21:30:10.008927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.426561Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.426561Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:9bdd55829819692eabfc6ab3c06499c95fad33c03d05b35a9c869a0b14119cd1","observation_id":"627e1c39-512d-46b5-aead-988b3954a783","resolution":{"observed_at":"2026-08-11T21:30:08.426561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.972416Z","title":"Laion-5b: An open large-scale dataset for training next gen- eration image-text models","venue":null,"work_id":"e76974b6-cabb-4cd5-9073-a7ff4a86d1b8","year":2022},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.431183Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:52ba1e55ac894b24bcce3b17c96cda29b4b8fee50d454255969e97164d1e5fd9","observation_id":"a00f56ba-dccd-4e88-8fa6-4119135a5d2f","resolution":{"observed_at":"2026-08-11T21:30:09.977976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.956340Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"48e6fe34-2aca-46f3-ab44-27eb217e4bb3","year":2018},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.435975Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:192a083391a99f2a0953f8e13144209abbc2bb0feeaa366eb2bf4e6b35314c5d","observation_id":"53bf96ac-008b-4f6f-86d1-23bb9a64e7cd","resolution":{"observed_at":"2026-08-11T21:30:09.961577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T21:30:08.440449Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.440449Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:94a2cf5839e2348afee309b1013bf42766084a7bbb20739507112e0bb9674e83","observation_id":"aa65f3de-f780-458d-854a-b55b950e8bc5","resolution":{"observed_at":"2026-08-11T21:30:08.440449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-08-10T12:19:42.891683Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-11T21:30:08.445180Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.445180Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:1e2785437bd37ce185f97aa721af08d0dee77079d3ba1fc23d9f17df31097b00","observation_id":"3e5760db-8a9d-48ed-a2a0-cae4ef3d152c","resolution":{"observed_at":"2026-08-11T21:30:08.445180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-11T21:30:08.455468Z","title":"Generative pretraining in multi- modality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.455468Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:218c89fad08b51f1502639467db551a62f96617118a2f1c4d6c84fe8c9618ce5","observation_id":"23d37623-318c-40de-bb60-39c1e808cc58","resolution":{"observed_at":"2026-08-11T21:30:08.455468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-11T21:30:08.460392Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.460392Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:46ecae8b511b5dd1cf5742fe8d7b2f27040304de78b162381917119a5bd758c8","observation_id":"d67f96e7-aeec-4e04-bfc4-f8fe67278784","resolution":{"observed_at":"2026-08-11T21:30:08.460392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T21:30:08.465177Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.465177Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:2ba873108b37e0b104395e7393477a27a51e68edae46cf75ed5722f83792b9bb","observation_id":"ffd95997-71a4-4c28-a41d-d502774f0377","resolution":{"observed_at":"2026-08-11T21:30:08.465177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T21:30:08.469723Z","title":"Gemini 1.5: Unlocking mul- timodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.469723Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:f6fde26d9ef180160e98a35e6daec0a54fdd35b7f26be3fc33778239e723b784","observation_id":"9d011547-2090-42b1-bca7-07e699c125c0","resolution":{"observed_at":"2026-08-11T21:30:08.469723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T21:30:08.474548Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.474548Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:21f8801e78d988b85b7b6dc5898f544082dfef36ae21c14aa634ae4a270ed465","observation_id":"a2e2c36e-18a0-4084-a2f3-ab37912dc0b5","resolution":{"observed_at":"2026-08-11T21:30:08.474548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.939327Z","title":"Givt: Generative infinite-vocabulary transformers","venue":null,"work_id":"cd469aea-4f59-4ead-b55a-c07e8c2dcf2e","year":2025},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.479670Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:efad138d936978b3a53f70a21ac89debe78fb8b9eaf718ea3c6fe04e1ad15b8e","observation_id":"4d9e5565-71fb-4537-ad98-e25f5de9769c","resolution":{"observed_at":"2026-08-11T21:30:09.944108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-11T21:30:08.484543Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.484543Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:639286fb253b594d7362b5474e85c09932574f204d26febcb11ea22810ff90b0","observation_id":"d44ab93e-0129-40e2-9e46-fa3c620d224e","resolution":{"observed_at":"2026-08-11T21:30:08.484543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.489443Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.489443Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:98aac2dbdbbd274f15e41dc432d523b834871cc48de468ce7ae7c0b4dd0160e9","observation_id":"d8e3564c-f760-455b-a901-5daaa7423144","resolution":{"observed_at":"2026-08-11T21:30:08.489443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21264","last_updated":"2025-06-16T22:06:19Z","snapshot_observed_at":"2026-08-12T22:13:33.857480Z","submitted_at":"2024-10-28T17:57:07Z","title":"LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21264","snapshot_observed_at":"2026-08-11T21:30:08.494766Z","title":"Larp: Tokenizing videos with a learned autoregressive generative prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.494766Z"},"links":{"cited_paper":"/paper/2410.21264","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:cf439e66d90b909d3595454a4c15100daf5a738bf4a8535146e74483b2aae031","observation_id":"8fabbf4d-909f-490c-900e-0d38893bd01c","resolution":{"observed_at":"2026-08-11T21:30:08.494766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20171","last_updated":"2024-08-24T03:55:36Z","snapshot_observed_at":"2026-08-12T23:12:40.280328Z","submitted_at":"2024-07-29T17:00:09Z","title":"Diffusion Feedback Helps CLIP See Better","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20171","snapshot_observed_at":"2026-08-11T21:30:08.500992Z","title":"Diffusion feedback helps clip see better","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.500992Z"},"links":{"cited_paper":"/paper/2407.20171","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:78f2772f33ef23cad7e0cd01585a98f9fa0cd84ed90390bb98ae4efc9893cf1f","observation_id":"acd3ac56-11cc-44f0-af08-c1734937bba7","resolution":{"observed_at":"2026-08-11T21:30:08.500992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.914001Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"20ab7ff5-f70c-4c35-ad59-a886f9e8b317","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.506963Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:9ce9a73cdb0e4c86fb8c446bc61ecb09c6b6c19cbbe067618b43390d2ec83908","observation_id":"9c894d03-6918-4594-8b30-10cc637b7bdc","resolution":{"observed_at":"2026-08-11T21:30:09.918380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T21:30:08.511826Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.511826Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3ba68763bc35861b0b643bbbe5e0e1a93751b2effd1de58555b794b60cfcb681","observation_id":"8c79c8ba-9b7d-429c-a1ac-5da90d8ee83b","resolution":{"observed_at":"2026-08-11T21:30:08.511826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-11T21:30:08.516416Z","title":"Internvid: A large-scale video-text dataset for multimodal un- derstanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.516416Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:5de9616fc8b1ed6c49d9ade71408451bc08c68edf7ec88480811319c96168466","observation_id":"d04bee03-6122-498b-b595-26ce1cbf779a","resolution":{"observed_at":"2026-08-11T21:30:08.516416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02757","last_updated":"2025-04-02T07:57:32Z","snapshot_observed_at":"2026-08-12T22:31:22.501227Z","submitted_at":"2024-10-03T17:59:02Z","title":"Loong: Generating Minute-level Long Videos with Autoregressive Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02757","snapshot_observed_at":"2026-08-11T21:30:08.521692Z","title":"Loong: Gen- erating minute-level long videos with autoregressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.521692Z"},"links":{"cited_paper":"/paper/2410.02757","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3d84570b309ff03b203a34646212990e76fee32f0949419025ace8645f90c868","observation_id":"a68f103a-d157-45b2-89d8-ff723c089931","resolution":{"observed_at":"2026-08-11T21:30:08.521692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.897726Z","title":"Diffusion models as masked autoencoders","venue":null,"work_id":"a685b43c-7a04-441e-8421-f47080d7cb47","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.525932Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:86e891f25d6bf25a250c95d02400d4cb818f915812aecd941b0bc007ab13302b","observation_id":"3874d8e5-ffbf-437c-b867-d3e88740b3c1","resolution":{"observed_at":"2026-08-11T21:30:09.903063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-08-12T04:22:15.303374Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-08-11T21:30:08.529926Z","title":"Godiva: Generating open-domain videos from natural descriptions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.529926Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c6e1d6528e37f0eb96ae20870b3579ed6ab043fbf787f19bd4ea53c077415fa5","observation_id":"895b9fd6-7f2c-4ee3-ba7a-fb937343097c","resolution":{"observed_at":"2026-08-11T21:30:08.529926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-11T21:30:08.534148Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.534148Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:4886078f6ac1537d2e27a724b71470ca0fd09700cfe8c85fa0aa506c74ce29a7","observation_id":"5f8e2a87-06d8-46c0-8006-f621f08f4bf6","resolution":{"observed_at":"2026-08-11T21:30:08.534148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-11T21:30:08.538409Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.538409Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:79ee9b20c1358e5e9d2949959b23d6eab860b47f3fd4620458bdc43cdeb1eece","observation_id":"ae4aec21-24c1-4aa6-a82b-ac9ff1b200ac","resolution":{"observed_at":"2026-08-11T21:30:08.538409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-11T21:30:08.543892Z","title":"Vila-u: a unified foundation model inte- grating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.543892Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c3a2da29f4beca30a2b3045797be1154d0a2b8322e18c91a796f616760169a1f","observation_id":"8353176b-b0b5-496b-be99-8f8a59fae0ab","resolution":{"observed_at":"2026-08-11T21:30:08.543892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.881423Z","title":"Denoising diffusion autoencoders are unified self-supervised 11 learners","venue":null,"work_id":"3a8f5a25-9ba1-4feb-892a-b1a9917641ac","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.548835Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:2a085240ed7f54cd48a94c14b7d69139eb90ac1450ae39ed1e3a35297a780355","observation_id":"b2458da6-fa1f-4222-b13f-a3f3ff68e8e4","resolution":{"observed_at":"2026-08-11T21:30:09.886501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.553398Z","title":"Next-qa: Next phase of question-answering to explaining tem- poral actions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.553398Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c8dd847032eef8bd647d24716027592255991c121a1c7af729876af4cf9f5c4e","observation_id":"87b8863b-1442-43e3-b4aa-97c7a56ae7f9","resolution":{"observed_at":"2026-08-11T21:30:08.553398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-11T21:30:08.558166Z","title":"Show-o: One single transformer to unify multimodal understanding and genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.558166Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:d59cc854bc4a7c24e5ff12546e31be39a64f60c0c6c393504ceb38287efa31fd","observation_id":"f7f5a051-14fd-4c19-a0d9-39a0c5b42968","resolution":{"observed_at":"2026-08-11T21:30:08.558166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:08.563006Z","title":"Dynamicrafter: Animating open- domain images with video diffusion priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.563006Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:9166d94f1e662b2cd54f9e100ee467f51ab80031aed830cef2ab6eb1b5e8785f","observation_id":"05bebe21-3796-4d4a-b25b-e5b0b4b53e1f","resolution":{"observed_at":"2026-08-11T21:30:08.563006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.843519Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"200e9096-b811-43fc-b07e-3f3b6c25c4c1","year":2016},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.567869Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:1d55c42576c72be4f3602e04abc2f65b8d91719c482b7ef7ec20de555ea006c7","observation_id":"a7a79945-bb2e-4b85-ad0c-333def12026f","resolution":{"observed_at":"2026-08-11T21:30:09.849437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.826160Z","title":"Open-vocabulary panoptic segmentation with text-to-image diffusion models","venue":null,"work_id":"294bc132-68e5-43af-a3f2-e95a85f9bfa8","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.572476Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:7ece4777e989594632fba08c2347448cf218ce6bb3d648ee90f25e6d092af7b9","observation_id":"424b2904-3b46-4d0d-aa8d-298bcf40faba","resolution":{"observed_at":"2026-08-11T21:30:09.831409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-11T21:30:08.577527Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.577527Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:2e3f726e7a2e50bc6f03af53a219a67799c57bb120112bff110acfbc32f93872","observation_id":"4a214b0c-b715-44a1-877a-52a85490991c","resolution":{"observed_at":"2026-08-11T21:30:08.577527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-11T21:30:08.583416Z","title":"Videogpt: Video generation using vq-vae and transform- ers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.583416Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:6fa388dfde28a1c2cf8613be29b5353547052d3da10bee25697ef8db36d43de4","observation_id":"e4506835-9bcd-491f-b237-7ce7b03527e5","resolution":{"observed_at":"2026-08-11T21:30:08.583416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10798","last_updated":"2025-06-04T07:35:31Z","snapshot_observed_at":"2026-08-12T22:23:27.107761Z","submitted_at":"2024-10-14T17:57:18Z","title":"MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10798","snapshot_observed_at":"2026-08-11T21:30:08.588482Z","title":"Mmar: Towards lossless multi-modal auto-regressive prababilistic modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.588482Z"},"links":{"cited_paper":"/paper/2410.10798","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:6531f0393aa76e5c9201923a2ee0ff07cb75e3c5d7666e3a0cd3cfbca45a3aaf","observation_id":"fa14b4d0-9b7e-4349-8337-a3f88209eff9","resolution":{"observed_at":"2026-08-11T21:30:08.588482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-12T23:24:01.714587Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-11T21:30:08.593471Z","title":"Seed-story: Multimodal long story generation with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.593471Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:7abe53e091c29c87336237a0a3073c93ec012800e32f540d5d03f78873cdd92b","observation_id":"d6d15063-c71c-42ca-afbd-4471e4f63b73","resolution":{"observed_at":"2026-08-11T21:30:08.593471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-11T21:30:08.598608Z","title":"Clevrer: Collision events for video representation and reasoning.arXiv preprint arXiv:1910.01442, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.598608Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:3fd850fd08225926ba6a9ef899a1472ff519ff2e562db682d469e938c43ef0e1","observation_id":"1bee4769-a4db-476a-9edd-2644cc8520d7","resolution":{"observed_at":"2026-08-11T21:30:08.598608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-11T21:30:08.603875Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.603875Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:086b769bdc83870486441167282f1c23931f7ac9e8f8f3f9965495e69c96e9f0","observation_id":"14e4bc1c-ffd9-4d5f-8291-b8edfe12a830","resolution":{"observed_at":"2026-08-11T21:30:08.603875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.808828Z","title":"Capsfu- sion: Rethinking image-text data at scale","venue":null,"work_id":"717009e2-b496-43a6-ad58-4da24c046e50","year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.608451Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:72ee7d1ecee39bdc8ee95916ad4b423ab6de3ca8ef2ec22bea70aeacd1b676f2","observation_id":"e95660d3-6d9b-49a9-8628-e96bdc167775","resolution":{"observed_at":"2026-08-11T21:30:09.814067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.792012Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"ef6aee07-7490-483b-a300-fb912d29c9df","year":2019},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.612556Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:ff861da1fce71384f24528d5f561a044670ccb4dc3ab90e5233355b248f9a80f","observation_id":"5fc67231-9f23-4423-ae6f-ccfda4171d1c","resolution":{"observed_at":"2026-08-11T21:30:09.797396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16280","last_updated":"2024-09-24T17:51:04Z","snapshot_observed_at":"2026-08-12T22:38:25.854863Z","submitted_at":"2024-09-24T17:51:04Z","title":"MonoFormer: One Transformer for Both Diffusion and Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16280","snapshot_observed_at":"2026-08-11T21:30:08.616778Z","title":"Monoformer: One transformer for both diffusion and autore- gression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.616778Z"},"links":{"cited_paper":"/paper/2409.16280","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:a0933fabf02cc47f16a6dc4d7ff3f147aed0a78f098376057dcea4de871fd57e","observation_id":"e1c248f8-9454-4c7e-9168-e4bc1ffe0389","resolution":{"observed_at":"2026-08-11T21:30:08.616778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.775895Z","title":"Unleashing text-to-image diffusion mod- els for visual perception","venue":null,"work_id":"ac044886-4c99-4992-9f6f-503894adbe6c","year":2023},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.620784Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:1534f6331cc74e61cff5a3ae409c46ed1c017042e8248af58389f29e172c798d","observation_id":"55abc623-112a-43fc-b6d1-e5db92259baf","resolution":{"observed_at":"2026-08-11T21:30:09.781187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-11T21:30:08.624654Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.624654Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:f49274cad9a2c1257f510911d79e3e17f3ddf60311404d70d5ae0f9efb1f9f15","observation_id":"aabc4237-ac62-4232-a343-d0d6653d64cd","resolution":{"observed_at":"2026-08-11T21:30:08.624654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.757308Z","title":"Towards auto- matic learning of procedures from web instructional videos","venue":null,"work_id":"afc2d2df-8c12-4840-b136-b60bd9413f4b","year":2018},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.628936Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:c9e5d02b46910120e65f1eeb74995ef1030ddc681893d5a336a19f5ed59266a7","observation_id":"326892c7-b028-44cb-9c25-a51330864047","resolution":{"observed_at":"2026-08-11T21:30:09.763515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-08-12T12:55:00.219026Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-11T21:30:08.634738Z","title":"Vl-gpt: A generative pre-trained transformer for vision and language un- derstanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.634738Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:8801286ea203807a81a9effc0db462305662a41f86e761cb8b4761f260395ddb","observation_id":"226b838e-729e-416e-b6dd-31d478af8707","resolution":{"observed_at":"2026-08-11T21:30:08.634738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:09.741591Z","title":"Curious George","venue":null,"work_id":"3e0aeb88-a63e-40fe-9393-6812175779a3","year":null},"citing_paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:08.639585Z"},"links":{"citing_paper":"/paper/2412.04432"},"observation_digest":"sha256:e04868c3372a5ce2d946ce26075fbc2caeb3dc27514bc9dcdc0fd2e15f85f0a1","observation_id":"c3206fa4-c4f1-4d61-be4b-b95d74817d99","resolution":{"observed_at":"2026-08-11T21:30:09.746735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04432","last_updated":"2024-12-05T18:53:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T17:25:56.105513Z","submitted_at":"2024-12-05T18:53:04Z","title":"Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":73,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 0 inbound Pith citation observations for arXiv:2412.04432."}