{"as_of":"2026-08-07T05:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f54bd8e45c75219c0aa8b1b4e0743fbd497f58146b7bc12ddb5d63b8a9bb2059","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:43:56.260106Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.01938/citation-record","integrity":"/paper/2507.01938/integrity","json":"/paper/2507.01938/citation-record.json","paper":"/paper/2507.01938"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:53.552636Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.552636Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:9a61caed07bddd5db094665234faa7c5112eae7e1179f1be57d50746e979e88e","observation_id":"43c302e5-3448-4025-a67e-3f2addf75b44","resolution":{"observed_at":"2026-08-06T20:43:53.552636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:43:53.636519Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.636519Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:2bc51f838512ce23af93f6885d9fe62357590ca9805a80f189a3d85fc88700ef","observation_id":"9ebc2bbc-2b1f-4875-8e90-0bf649427181","resolution":{"observed_at":"2026-08-06T20:43:53.636519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:59.955291Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"2087bc1a-7101-443b-a925-b4d4bc0c78e1","year":null},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.737971Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:65de409c68b9f4866b46aeeadaac00b5ae1811359df0c82c5fe4728e601ee209","observation_id":"4802eb36-4927-402e-9cb4-ba5de35f8b21","resolution":{"observed_at":"2026-08-06T20:44:00.100101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:59.791174Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":"4656fd2b-affe-40dc-9f1e-0501710dd304","year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.797460Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:2507171e16956234fdeb44ac7e0be4983a5fb9a8e5a441f355f155537a69efb0","observation_id":"bacf8874-ee68-4c67-b252-4550bb47cc04","resolution":{"observed_at":"2026-08-06T20:43:59.868703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T20:43:53.858179Z","title":"Muse: Text-to-image generation via masked generative transform- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.858179Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:81b1b380a2162870d0084bc6e1fe25671920934ee3d67fb294d5781b62e2822e","observation_id":"dc6d1286-0035-4aa1-9ff1-5e25eab8a452","resolution":{"observed_at":"2026-08-06T20:43:53.858179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:59.599814Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":"d23f15f7-8f35-447c-82bf-bc69b6dd8215","year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.945900Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:de876f52409989b16c64b9307f7126c60642994ad743ff340123951f783dc69d","observation_id":"893d855c-e8c7-4912-934f-7574eb969633","resolution":{"observed_at":"2026-08-06T20:43:59.654667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:59.336775Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"77e23f65-b494-4752-9d9b-e295999236f4","year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.131696Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:69c6fb0b463be6e05ca1a14da5bb89024867dda893c9bdd7c790cad61a61998f","observation_id":"b16689d6-c1ab-4694-956c-5fefb917da8e","resolution":{"observed_at":"2026-08-06T20:43:59.461151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10462","last_updated":"2025-04-02T13:30:29Z","snapshot_observed_at":"2026-07-06T18:31:21.929350Z","submitted_at":"2024-06-15T01:27:58Z","title":"CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10462","snapshot_observed_at":"2026-08-06T20:43:54.222341Z","title":"Comm: A coherent inter- leaved image-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.222341Z"},"links":{"cited_paper":"/paper/2406.10462","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:4ed07bcac3da26b5474d241b02010bdcf0460649536c7f0de43727ea60737b0b","observation_id":"5ae716e0-f550-4984-a7e7-c66ce3d745bf","resolution":{"observed_at":"2026-08-06T20:43:54.222341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:59.033797Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":"77db57f5-73b4-4a37-bdaa-edad6e98012d","year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.373281Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:d1e47a7049ba39798f95390bdf0a7fac696751e4f0662eaae9adca016b45e31c","observation_id":"72c26b38-ff68-4f8c-9868-bfce4f575a80","resolution":{"observed_at":"2026-08-06T20:43:59.182767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-06T20:43:54.436324Z","title":"Autoregressive video generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.436324Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:a42ac93e46073537ddd9cfe5ec44cc2a42c23de2f481fcdf712d0e03eea36093","observation_id":"54f45424-b34c-4608-89b0-aff910a20f3f","resolution":{"observed_at":"2026-08-06T20:43:54.436324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:58.814502Z","title":"Long video generation with time-agnostic vqgan and time- sensitive transformer","venue":null,"work_id":"0acb055c-bda6-4e07-a75c-45b759fb1902","year":2022},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.501787Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:1dd52974099e674813d642f99e38832eb7c4c611d9998189a850906821771efc","observation_id":"9778989b-e92b-49d3-868a-b5a4894899e0","resolution":{"observed_at":"2026-08-06T20:43:58.909897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:58.643863Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"5e792f07-5cdc-46b9-9b3e-d9cebab799bb","year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.601603Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:3ed662f0d8b5e8c3dedef231428a69a62b0fe095001b7a0a65b3bbf325848863","observation_id":"af402e0c-d85b-4ea5-bd6b-07dec89b34af","resolution":{"observed_at":"2026-08-06T20:43:58.718900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:58.485155Z","title":"Language is not all you need: Aligning perception with language mod- els","venue":null,"work_id":"4a6cd7c1-14d7-4adf-a8f7-b45f1c52579e","year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.657760Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:9d603d67873ca6f2c03489c437c322208b5ab862b5cbfb6942295c6f5e2684c5","observation_id":"914b15d5-6e58-4f7d-a702-6ff1ec805cbd","resolution":{"observed_at":"2026-08-06T20:43:58.551569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:58.301978Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"8fa4a9c2-73a9-42e8-8b96-9216d11bff74","year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.740002Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:ca94870905255851d20de1b66387904e332acf7056e1df4b3b1e300dcd4abcaa","observation_id":"d7786ac6-bae9-48bf-9099-ed46134fe665","resolution":{"observed_at":"2026-08-06T20:43:58.374454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T20:43:54.807590Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.807590Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:177173e3371e4a48a59eeb0aa34cbf1f5e210493fd431ec174a9a8d4d1ebc0e7","observation_id":"c2f98bf3-07c7-456a-ab32-346e99bbbc1e","resolution":{"observed_at":"2026-08-06T20:43:54.807590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:58.100233Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"c9c39f85-3197-4f79-b8c6-cb5d95cf014e","year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.870766Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:cd1060b00b99f736c4572718793b63994c0b50909785de9f8662f52f1030d49a","observation_id":"78cac45b-6862-4a70-85a1-77d031eb7518","resolution":{"observed_at":"2026-08-06T20:43:58.184731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.943112Z","title":"Miradata: A large-scale video dataset with long durations and structured captions","venue":null,"work_id":"65583fc1-2b36-41f6-a339-ce48b8d083f4","year":2025},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:54.927779Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:2757f7d32a1d1d4f551ed71a95e5fe98272ba8bb512db1ef4afea93a53ccad2d","observation_id":"e987e9a4-bb83-4785-bf3c-4dbd864715b2","resolution":{"observed_at":"2026-08-06T20:43:58.023559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-06T20:43:55.005493Z","title":"Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.005493Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:75889a85465d0e0c2473a5c87a837dae97de1ce2532cffd0f5eb67a9ac4b2c3f","observation_id":"b4c6a182-0564-4b9c-844f-bb400bca1984","resolution":{"observed_at":"2026-08-06T20:43:55.005493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.834176Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":"cfed3939-adf4-439a-b319-b446865cd71e","year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.068501Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:473f28fcc112b2f01850b37f9aeb5c300ae2b2a2c8e4c8ec15b4bfa4fd30b595","observation_id":"7ce8d505-8d75-4718-a23e-d4d7ae723baf","resolution":{"observed_at":"2026-08-06T20:43:57.877839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.677837Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":"7120e962-1a76-4751-a6cd-5c9baefe8d79","year":2025},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.161115Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:a07c4629379d6cefa2447bc241e2c1345392ddf703641a2a9bda612c51b81a2c","observation_id":"0f68c233-efe3-4ba6-af5f-2241af2a0f34","resolution":{"observed_at":"2026-08-06T20:43:57.745356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-06T20:43:55.215759Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.215759Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:528e90ac3ba491d758c4309a2a415e82ce214ec59374679528d801b32c413187","observation_id":"e87fad39-fdeb-4355-a567-ee6e2f2406ed","resolution":{"observed_at":"2026-08-06T20:43:55.215759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.497961Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"37f37ffe-b7f8-43c1-be6d-dd2140d1112b","year":2019},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.273819Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:3761f7d998602e36611847cfe28ef600e3910c39f0c133df2fe66afe79696867","observation_id":"f7658d01-f6fa-45a2-afa7-233a783f36ac","resolution":{"observed_at":"2026-08-06T20:43:57.593196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-06T12:43:20.523348Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-06T20:43:55.332249Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.332249Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:8f3398721bfd7b55401f9ddd2bd538f97dac5a1138f9a0dd166588b6b6606a2a","observation_id":"89f81468-e333-496d-89e9-bb1d430facfe","resolution":{"observed_at":"2026-08-06T20:43:55.332249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.417925Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.417925Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:556b1ce09b78b909f217c5cbe55947418ab70ad711850827995bf48ca4ed5e1d","observation_id":"798a4ad3-fd62-4e98-bbfa-b8dbaddf5a59","resolution":{"observed_at":"2026-08-06T20:43:55.417925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.316513Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"59159e39-9a91-436d-b7ae-6fe57e9a3118","year":2021},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.498051Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:846ee5ec1d7c9ded746d2c09e197e5af441af0ed746804f4c24594df1d3b0533","observation_id":"fa9d88cf-5aae-4e94-ac11-49ca387fde33","resolution":{"observed_at":"2026-08-06T20:43:57.392652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.572174Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.572174Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:11e1016ddc069f9ca761533e5827be478cf31564af0278821404da90733c33df","observation_id":"9189915f-074b-4403-b8f3-ffb67b1a3b52","resolution":{"observed_at":"2026-08-06T20:43:55.572174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:57.141585Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"f1325ef0-9b30-4d63-a008-15ff51fd74cb","year":2022},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.613145Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:5bcac3f39fcffbd4f9ec0788ff5eb0bf4a0fc22f2b00e388606c9ccebb5ed99e","observation_id":"d2d364bf-b8a7-4e32-a9bc-c6e60bf5a320","resolution":{"observed_at":"2026-08-06T20:43:57.221343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:55.668887Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.668887Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:46d36d44f0b9d2e662566665828c9c48623761b314b6e4f90bb1b3708e2873a7","observation_id":"53aeb84d-0c09-40bc-a54b-87155aaad337","resolution":{"observed_at":"2026-08-06T20:43:55.668887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04277","last_updated":"2024-10-14T07:20:01Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:25:33Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04277","snapshot_observed_at":"2026-08-06T20:43:55.726610Z","title":"Videotetris: Towards compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.726610Z"},"links":{"cited_paper":"/paper/2406.04277","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:abf613fca40f31acfd749748b29da8e9aa8d72cc6f868e38c1b83d28f3f5f34b","observation_id":"60b811d9-46b6-4faf-b471-aa4e413b4c5b","resolution":{"observed_at":"2026-08-06T20:43:55.726610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.975872Z","title":"Mcvd-masked conditional video diffusion for prediction, generation, and interpolation","venue":null,"work_id":"f70a8f11-2454-435a-933e-d2ddae4f9b89","year":2022},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.792112Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:9197f338f73ec59c8ca1df673804429522577c2ba9d6f32ff55a78beef21da41","observation_id":"affb843b-73a5-4689-9c36-cc35776635b7","resolution":{"observed_at":"2026-08-06T20:43:57.045291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T20:43:55.887241Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.887241Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:b4d2d553b92f40a8be55df17d3237df9f7e9819358619bd131e979867a470a22","observation_id":"c2bdba8a-bd9b-481b-8228-7e8c00c13748","resolution":{"observed_at":"2026-08-06T20:43:55.887241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T20:43:55.960100Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.960100Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:e18a84a213ec6d331ba094898c7c800dd642523eac532f4509edf0f362d0e067","observation_id":"2f0879d8-0e8e-4004-86de-263b2740616c","resolution":{"observed_at":"2026-08-06T20:43:55.960100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.767302Z","title":"Ad- vancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"19dd8b87-2aa0-40b2-af28-ca7fe50728a0","year":2022},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:56.037650Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:86f9c73709cb01f74e279b9f2b5f874efbf24890689106221603170959eeed7f","observation_id":"a67842d9-e018-4f27-a2d6-f5a6c0c93625","resolution":{"observed_at":"2026-08-06T20:43:56.897955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06040","last_updated":"2024-10-25T06:32:09Z","snapshot_observed_at":"2026-07-06T18:27:58.433967Z","submitted_at":"2024-06-10T06:17:55Z","title":"Vript: A Video Is Worth Thousands of Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06040","snapshot_observed_at":"2026-08-06T20:43:56.117027Z","title":"Vript: A video is worth thousands of words","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:56.117027Z"},"links":{"cited_paper":"/paper/2406.06040","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:e140ad370bdd58fdfa42fed109accf670492cd46abf1087d656d29bb55021f98","observation_id":"ae47c4a9-105c-400c-bcc5-1530b30d7e8f","resolution":{"observed_at":"2026-08-06T20:43:56.117027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T20:43:56.196408Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:56.196408Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:bf47ad958578024b41c189d59bc4441e4c0e242db722da5d55c4363f1cc54db7","observation_id":"79c2dbd5-ad44-4826-90c9-d8dd9ada56d2","resolution":{"observed_at":"2026-08-06T20:43:56.196408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:43:56.570045Z","title":"Multimodal c4: An open, billion-scale corpus of images interleaved with text","venue":null,"work_id":"3801f22a-1675-4e37-8ab8-05f5ac67c1fb","year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:56.260106Z"},"links":{"citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:9bbdf2be80542392e1db1d2d23ce6b01e9b74a1e5157cddf8e43f6ddbfcbed56","observation_id":"acf65951-163e-4df2-8e47-77145e20c97e","resolution":{"observed_at":"2026-08-06T20:43:56.654879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.01938."}