{"as_of":"2026-08-11T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dee81bb9d2621c82d31728790a40802649bebd5564af9d26e6bcee5b1317a5fb","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T06:30:22.431538Z","state":"measured"},{"denominator":182,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":182,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":102,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:37:15.144767Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T06:39:37.513098Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:bffd3672c32e1294ad07ceb96a710f5f16c3a516aabf8f4763de571b8337d4c2","observation_id":"30cf6ee8-b393-4a98-a875-f59fc3f89e8e","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-11T03:45:32.889856Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T06:36:57.165551Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2402.08268"},"observation_digest":"sha256:9c03cc45a0cc48a12b82f3fe3fad748b89e23552ce1b0b927817330bb15979f7","observation_id":"2cef23cf-dd78-421f-8fb5-c06e9eed97b9","resolution":{"observed_at":"2026-05-16T06:36:57.228815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-18T04:55:20.362512Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2402.15852"},"observation_digest":"sha256:a9065845c4da55fd982b14eb682e81c9d29ed1e49050e82a19fe449d603dbd93","observation_id":"22cc7e27-cc01-4b20-8d2a-bcb0ed010feb","resolution":{"observed_at":"2026-05-18T04:55:20.531559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:37.599691Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2406.03520"},"observation_digest":"sha256:e2e71e072b913004b3775319826d5a1c616adbda46e8aaf55c6159d6a8922761","observation_id":"9915c743-fac1-41b1-8c82-2680e3f2a07e","resolution":{"observed_at":"2026-05-20T11:34:37.712578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:5be5f924ecdebb6473e4e41c3ba8bf81a549ad6f656a890db23c6f7147d8ddbb","observation_id":"254ea295-dc89-47aa-88d6-a4c06d781fba","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:fed146dc0c3ec54e1488399965c260405e3bba472cde9a1e481fc09984668178","observation_id":"b1f9af37-9ea6-41d4-97e8-84f9661fd234","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2412.15689","last_updated":"2026-05-06T21:36:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-20T09:07:36Z","title":"DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-23T06:57:50.897865Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2412.15689"},"observation_digest":"sha256:d0edcab59764f1c81179f0d17de4e7fd6de4ff489cfde9ccba4d12a78385edcb","observation_id":"adfe7ec5-250f-4a63-a73e-c224ec7f4af0","resolution":{"observed_at":"2026-05-23T07:02:41.848080Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-11T04:37:15.144767Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18688","last_updated":"2025-08-05T01:03:48Z","snapshot_observed_at":"2026-08-11T04:31:55.677181Z","submitted_at":"2024-12-24T21:24:41Z","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","version":2},"reference_index":180,"source":"pdf_text","source_observed_at":"2026-08-11T04:37:15.144767Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2412.18688"},"observation_digest":"sha256:5776a1ce426db40b0b22d444aae29c0428fea2922c740fe5207c7c145e9e0bab","observation_id":"310a8a70-87d0-4e22-a6fe-f963c762f638","resolution":{"observed_at":"2026-08-11T04:37:15.144767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-10T22:08:54.320861Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02706","last_updated":"2025-01-06T01:18:11Z","snapshot_observed_at":"2026-08-10T22:04:51.641295Z","submitted_at":"2025-01-06T01:18:11Z","title":"Multilevel Semantic-Aware Model for AI-Generated Video Quality Assessment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:54.320861Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2501.02706"},"observation_digest":"sha256:50b9f13213e7c7a5182c4c5ed6be44438c6d766f5cf10069b854c861e722a78d","observation_id":"a9fe933a-7450-4abe-84e2-758c87633611","resolution":{"observed_at":"2026-08-10T22:08:54.320861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-10T22:04:48.803216Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02976","last_updated":"2025-01-06T12:36:21Z","snapshot_observed_at":"2026-08-10T21:57:13.352119Z","submitted_at":"2025-01-06T12:36:21Z","title":"STAR: Spatial-Temporal Augmentation with Text-to-Video Models for Real-World Video Super-Resolution","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:04:48.803216Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2501.02976"},"observation_digest":"sha256:6e13383b032c1e224ba794ba55c9c472912a8f4f4ee4f846f4fd27f945b81843","observation_id":"3a2033c9-7e3d-468f-8566-2ddd04618277","resolution":{"observed_at":"2026-08-10T22:04:48.803216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-10T21:39:55.119247Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05484","last_updated":"2025-01-08T05:49:39Z","snapshot_observed_at":"2026-08-10T21:34:24.499708Z","submitted_at":"2025-01-08T05:49:39Z","title":"Tuning-Free Long Video Generation via Global-Local Collaborative Diffusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:39:55.119247Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2501.05484"},"observation_digest":"sha256:cef2445b688817d8a651ee96491d963029706d7cc5a06d468f4c769064a49cfc","observation_id":"addab3fb-7910-4c90-b151-5e3a3adc0d1d","resolution":{"observed_at":"2026-08-10T21:39:55.119247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-10T20:42:45.264582Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07563","last_updated":"2025-01-13T18:53:08Z","snapshot_observed_at":"2026-08-10T20:36:14.691441Z","submitted_at":"2025-01-13T18:53:08Z","title":"Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:45.264582Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2501.07563"},"observation_digest":"sha256:e2a65f6d0bc735ffd828884686d59b6bee4053427fd02fd4258f54d739ea5dfb","observation_id":"2db45f1e-d9ec-4042-84cf-291503112f36","resolution":{"observed_at":"2026-08-10T20:42:45.264582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:fe1dda7bc6dfe3e7dd4633099b927d4b14955b3468747ed43771ae557d525fd5","observation_id":"e8d8b3c2-c456-4eff-af15-513248c8a146","resolution":{"observed_at":"2026-05-17T02:52:20.783565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-10T11:17:24.856008Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16714","last_updated":"2025-09-07T04:06:42Z","snapshot_observed_at":"2026-08-11T02:55:22.772355Z","submitted_at":"2025-01-28T05:40:20Z","title":"Separate Motion from Appearance: Customizing Motion via Customizing Text-to-Video Diffusion Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T11:17:24.856008Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2501.16714"},"observation_digest":"sha256:caa94cd04dfe23b7e1d56b8752a1b0dfa7bc5742dde229b8a4f4baef55216fc2","observation_id":"4b653dc5-c7c2-4fc4-b10e-e1a3f159239a","resolution":{"observed_at":"2026-08-10T11:17:24.856008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-09T18:51:12.672171Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00500","last_updated":"2025-02-04T15:19:12Z","snapshot_observed_at":"2026-08-10T02:49:33.781140Z","submitted_at":"2025-02-01T17:40:11Z","title":"Video Latent Flow Matching: Optimal Polynomial Projections for Video Interpolation and Extrapolation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T18:51:12.672171Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2502.00500"},"observation_digest":"sha256:84e357cfe5261f4c9ebf458e9d4aa60caff5dea3eaba9dff11c29b4056b4f935","observation_id":"9559f07b-405e-443b-a987-5ea42ef568f3","resolution":{"observed_at":"2026-08-09T18:51:12.672171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-08T21:07:32.451450Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-10T10:23:34.227473Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.451450Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:a08ba1e7b7f0d383c8913f6e1707fca19d7304ac860e9cd895f75b0068e2e92d","observation_id":"18044e88-1e2a-46ac-bbdf-2208eaf7b3f0","resolution":{"observed_at":"2026-08-08T21:07:32.451450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2502.06608","last_updated":"2025-03-27T17:25:50Z","snapshot_observed_at":"2026-07-06T20:34:02.031605Z","submitted_at":"2025-02-10T16:07:54Z","title":"TripoSG: High-Fidelity 3D Shape Synthesis using Large-Scale Rectified Flow Models","version":3},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-16T21:51:18.323840Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2502.06608"},"observation_digest":"sha256:e402d1e28f581e67c16a969654da752bcc1920dcac17eaa73b3d946e734af53a","observation_id":"f8652f3e-296d-4467-9c6a-28b536d0992c","resolution":{"observed_at":"2026-05-16T21:51:18.394902Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T02:40:06.454859Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2503.13377"},"observation_digest":"sha256:f5a80dec396a3a0b6f445871240b0b2351be8523cb0bd5a42eec696ccac5c161","observation_id":"af0bf21b-6be7-4169-b4fe-d7b0c07e597d","resolution":{"observed_at":"2026-05-17T02:40:06.538109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T15:02:31.081961Z","title":"Internvid: A large-scale video-text dataset for multi- modal understanding and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-10T08:12:47.722803Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.081961Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:b0019b1fb5cc24891b65458e77f2ae146078b492fea150330928e39adbca117f","observation_id":"8a76d122-1a03-4998-9597-ac78e3d31d83","resolution":{"observed_at":"2026-08-07T15:02:31.081961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T15:19:14.859109Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-10T17:14:45.967006Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:14.859109Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:290b6ef00b308c042ad54a9737c67ef5702087b295d398b30a57f84c5838e5d6","observation_id":"42352660-1d21-46ab-8edc-e8126a2874be","resolution":{"observed_at":"2026-08-07T15:19:14.859109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T14:48:11.064681Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17574","last_updated":"2025-05-23T07:33:25Z","snapshot_observed_at":"2026-08-09T05:23:10.336112Z","submitted_at":"2025-05-23T07:33:25Z","title":"InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:48:11.064681Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.17574"},"observation_digest":"sha256:b21621c962b533faaa6e8ef08ca1de6d4c443b4e00b49c7ad0c718644965ab17","observation_id":"fde07f22-2d32-4440-ba1c-660bc9eb2124","resolution":{"observed_at":"2026-08-07T14:48:11.064681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T13:59:35.298215Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.298215Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:d57f690d828f3f8bee5aa754014ce45090e8f2c610bc4ca38bc36f60ef18761b","observation_id":"8daffc84-86b1-4a83-8ec4-10a2186913ec","resolution":{"observed_at":"2026-08-07T13:59:35.298215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T13:22:18.607441Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22167","last_updated":"2025-05-28T09:33:52Z","snapshot_observed_at":"2026-08-10T11:36:23.109698Z","submitted_at":"2025-05-28T09:33:52Z","title":"Q-VDiT: Towards Accurate Quantization and Distillation of Video-Generation Diffusion Transformers","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:18.607441Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.22167"},"observation_digest":"sha256:9cae4c019902d3265da2a065e742c7bd028ad66f3f787344a0a4a9478831a6b3","observation_id":"7d3d1fc9-29a7-43ef-ba22-2208dff8b6e8","resolution":{"observed_at":"2026-08-07T13:22:18.607441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T12:32:54.042453Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-09T06:10:22.489105Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.042453Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:de131811f35027197ba4bf7dddb66b1b03d247454135a29b31930a59267e4a14","observation_id":"213c9c4c-bd20-43cf-8c8d-d90308fb481e","resolution":{"observed_at":"2026-08-07T12:32:54.042453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T11:12:10.899127Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.899127Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:e47610944228afdadf297a9a3d1c8622a1e45189dbed10e2dde9834f9d3a8324","observation_id":"d9559444-4464-46cf-b125-2bc3146cfffa","resolution":{"observed_at":"2026-08-07T11:12:10.899127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T10:40:44.268995Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-10T23:29:38.010763Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.268995Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:e2817df4d0e1db3940b86001ee1c41cdbe59023a9354e2b5d765a7346777893b","observation_id":"e871c747-e2c3-4241-9229-d221f6bd513f","resolution":{"observed_at":"2026-08-07T10:40:44.268995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T10:28:34.955458Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05343","last_updated":"2025-06-11T15:48:38Z","snapshot_observed_at":"2026-08-09T14:23:10.699088Z","submitted_at":"2025-06-05T17:59:54Z","title":"ContentV: Efficient Training of Video Generation Models with Limited Compute","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:34.955458Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2506.05343"},"observation_digest":"sha256:30aca345e430b56c856913da164ea3ba66edee8305a820f480c1a81da37d8ada","observation_id":"260a8e1d-40b1-41b9-8a9a-644b5b27499b","resolution":{"observed_at":"2026-08-07T10:28:34.955458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T06:00:58.005525Z","title":"Internvid: A large-scale video-text dataset for multi- modal understanding and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06253","last_updated":"2025-06-06T17:25:48Z","snapshot_observed_at":"2026-08-09T07:19:17.693738Z","submitted_at":"2025-06-06T17:25:48Z","title":"Bridging Perspectives: A Survey on Cross-view Collaborative Intelligence with Egocentric-Exocentric Vision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:58.005525Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2506.06253"},"observation_digest":"sha256:d1a4b6ba493bcad6f08c8fb19bf8f8e2dfbc2275c24a25794797bb29ad99f3da","observation_id":"dea69658-9404-4c83-ad71-b20e3413cc57","resolution":{"observed_at":"2026-08-07T06:00:58.005525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T04:19:04.292024Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11371","last_updated":"2025-06-13T00:15:54Z","snapshot_observed_at":"2026-08-10T17:54:24.795016Z","submitted_at":"2025-06-13T00:15:54Z","title":"A Watermark for Auto-Regressive Image Generation Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:04.292024Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2506.11371"},"observation_digest":"sha256:670c62b541901086d28ecd351e99eca41b90b6ae8ce45feb3035177420cbec16","observation_id":"b53b07d8-dadc-49c1-b29b-1c4f81601bb7","resolution":{"observed_at":"2026-08-07T04:19:04.292024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T00:30:42.096528Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13846","last_updated":"2025-06-26T16:39:32Z","snapshot_observed_at":"2026-08-09T03:08:09.368495Z","submitted_at":"2025-06-16T17:59:40Z","title":"Fake it till You Make it: Reward Modeling as Discriminative Prediction","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:42.096528Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2506.13846"},"observation_digest":"sha256:f4b14f3e0f8969332e4fe54065b37201b6362bb62fe97d7b3c21f9e967ad25a5","observation_id":"2a27074b-2994-4a4c-a2fd-60636dec451c","resolution":{"observed_at":"2026-08-07T00:30:42.096528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T22:37:39.102494Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21116","last_updated":"2025-07-08T02:46:17Z","snapshot_observed_at":"2026-08-06T22:30:40.624519Z","submitted_at":"2025-06-26T09:30:57Z","title":"IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:37:39.102494Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2506.21116"},"observation_digest":"sha256:93fb704783deda5646dea5f4f43557cd4d31fa99cec57f7fb2469446a3b4756d","observation_id":"a2aabb4b-3746-44aa-a81c-b58cff382e30","resolution":{"observed_at":"2026-08-06T22:37:39.102494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T20:43:55.960100Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-10T19:30:42.529309Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:55.960100Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:8fdd9fc10ae877eb47858d913893746201990117d0c967ad661f1535dab2e685","observation_id":"2f0879d8-0e8e-4004-86de-263b2740616c","resolution":{"observed_at":"2026-08-06T20:43:55.960100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T19:39:51.503054Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05173","last_updated":"2025-07-07T16:25:47Z","snapshot_observed_at":"2026-08-10T05:03:32.372350Z","submitted_at":"2025-07-07T16:25:47Z","title":"Semantic Frame Interpolation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:51.503054Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2507.05173"},"observation_digest":"sha256:11e6f03cdc41d24e7aa77e542752f405b0d47999e78c7f9926c4b08a35c39dbc","observation_id":"27f8fedf-7160-4197-ae13-899b34717564","resolution":{"observed_at":"2026-08-06T19:39:51.503054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T16:39:30.750694Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12952","last_updated":"2025-07-17T09:46:43Z","snapshot_observed_at":"2026-08-07T11:02:23.505503Z","submitted_at":"2025-07-17T09:46:43Z","title":"LoViC: Efficient Long Video Generation with Context Compression","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T16:39:30.750694Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2507.12952"},"observation_digest":"sha256:fd75abe3eeced3843764e6cc55402f3b1662874c3c43b476c24829c1b138b549","observation_id":"4545fb88-e229-402d-a9d1-46d9a3e1f23b","resolution":{"observed_at":"2026-08-06T16:39:30.750694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T14:44:28.044936Z","title":"Internvid: A large-scale video-text dataset for multimodal understand- ing and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18100","last_updated":"2025-07-24T05:24:01Z","snapshot_observed_at":"2026-08-07T05:25:39.986769Z","submitted_at":"2025-07-24T05:24:01Z","title":"Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:28.044936Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2507.18100"},"observation_digest":"sha256:edc6825f33518aab036411970615b66b1e30ca37aebd040c6f6b8342979d2f09","observation_id":"59763ee7-6e67-4e6d-b335-f5a1fe341371","resolution":{"observed_at":"2026-08-06T14:44:28.044936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T14:36:17.724007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-10T08:12:14.836020Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.724007Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:805d3340d46f12b96394598b0010fc830781b7c7b40bf19ec11699cf0a71a746","observation_id":"3d0b065b-b671-4a08-90de-556ab4257c7a","resolution":{"observed_at":"2026-08-06T14:36:17.724007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T06:04:29.952467Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.952467Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:b36b126e6edc6e2793f9bfce6b68f5022a7436a35f8d1b8f78eb96b04bfced92","observation_id":"85d6e32a-0eb4-48bd-b14e-ec1ec0be758d","resolution":{"observed_at":"2026-08-06T06:04:29.952467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-06T01:05:34.727296Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.727296Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:7796e734c9cbd909c7daf301f8ff7e854b2e36976307a3dd54e0167d8e06d7e3","observation_id":"e61e9f2e-3702-4292-8b84-2a4633fad0de","resolution":{"observed_at":"2026-08-06T01:05:34.727296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2508.05269","last_updated":"2026-05-12T08:51:03Z","snapshot_observed_at":"2026-08-08T00:47:58.031078Z","submitted_at":"2025-08-07T11:11:56Z","title":"B4DL: A Benchmark for 4D LiDAR LLM in Spatio-Temporal Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T00:09:57.236162Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2508.05269"},"observation_digest":"sha256:0db5b0f5ee6189f4081a81545dc12fe5cf875d652e018615fdd21aea4a254376","observation_id":"a967589a-3573-4762-9131-6d72587aaac4","resolution":{"observed_at":"2026-05-19T00:11:55.966378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-05T22:01:26.008102Z","title":"arXiv preprint arXiv:2307.06942 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07683","last_updated":"2026-06-29T02:15:03Z","snapshot_observed_at":"2026-08-06T21:12:13.753696Z","submitted_at":"2025-08-11T06:59:32Z","title":"TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:01:26.008102Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2508.07683"},"observation_digest":"sha256:ea94123d44bcd6294ffef4eed3b849bee067ba5cdd3c10f5e1744ceb94feb0a8","observation_id":"17bc81e9-9c7c-408d-a652-5150043f612e","resolution":{"observed_at":"2026-08-05T22:01:26.008102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-05T20:20:24.611355Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.611355Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:066e92a59f3badaf12556f2fd997697a6ab8ff289affdaa8ebaf7b48bd8cd793","observation_id":"b12fb950-5c87-4313-9cd8-23b23ac671e4","resolution":{"observed_at":"2026-08-05T20:20:24.611355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-05T20:17:50.734115Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10860","last_updated":"2025-08-14T17:31:18Z","snapshot_observed_at":"2026-08-07T19:46:00.567985Z","submitted_at":"2025-08-14T17:31:18Z","title":"From Black Box to Transparency: Enhancing Automated Interpreting Assessment with Explainable AI in College Classrooms","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T20:17:50.734115Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2508.10860"},"observation_digest":"sha256:54af7a80e7bdbc07b20f0a25aa953d4c13b266c8384d12fc33325fd0a4230851","observation_id":"f1fe35c4-46c6-4983-9916-c3608a9d0417","resolution":{"observed_at":"2026-08-05T20:17:50.734115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-05T23:32:18.105472Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:18.105472Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:a9fe56e0b6f20f35884fdc22316ff7fdaad812601e5b9bcab90912842d917107","observation_id":"3bf63ee5-3352-4211-a8ea-1e88f6c7b3f0","resolution":{"observed_at":"2026-08-05T23:32:18.105472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-05T05:01:37.063914Z","title":"InternVid: A Large-scale Video-Text Dataset for Multi- modal Understanding and Generation.ArXiv, 2307.06942, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-10T04:42:02.831696Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:37.063914Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:2042c7ebd48b1b19caf6c9227f6eb3be3ff627e6a50f5079771a6a05f08fa9eb","observation_id":"9a89c0a1-e112-4afe-8afb-42f563ea1a3a","resolution":{"observed_at":"2026-08-05T05:01:37.063914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-04T19:37:42.065033Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-09T17:50:11.271087Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":176,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:42.065033Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:7bf61771fb3a0e29993c17365417e3270f9d8b3537baed1e09b7fdb12e111898","observation_id":"91e45fc0-417d-4d4c-96fd-6edd7b3dcf78","resolution":{"observed_at":"2026-08-04T19:37:42.065033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-04T18:58:11.018159Z","title":"arXiv preprint arXiv:2307.06942","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-08T21:36:02.523510Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:11.018159Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:06215be38c6160fd50af000841823e8f4e4e474560095f451addfd3e2be7f767","observation_id":"4474b6c3-8f6c-4003-add1-d6376784c4be","resolution":{"observed_at":"2026-08-04T18:58:11.018159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2509.16538","last_updated":"2026-04-19T03:58:34Z","snapshot_observed_at":"2026-08-02T22:52:02.153891Z","submitted_at":"2025-09-20T05:04:41Z","title":"VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T15:30:29.933558Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2509.16538"},"observation_digest":"sha256:c59108599e2a4a818baebfb8ae0ac0af95c9b9f385502938102cef57556181f4","observation_id":"e939595a-26c5-4c43-b8ed-3a0572510185","resolution":{"observed_at":"2026-05-18T15:31:33.344470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-08-11T04:59:34.986282Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:393016e46afee079ce1aef0b5c10d50f2e3e3eeffaf79a44f1467828e866ff87","observation_id":"aee86242-127c-4615-a89d-8336e02dae48","resolution":{"observed_at":"2026-05-17T03:48:58.512894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-08-11T08:03:14.324114Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T00:03:45.576961Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2512.09299"},"observation_digest":"sha256:324e36cf5524b9db5d6ddafc4b28bceb024fc943f0f1d9723758a6e72d623e18","observation_id":"4d45bc8b-0946-43aa-a9d9-501499f26280","resolution":{"observed_at":"2026-05-17T00:08:43.896369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2512.13511","last_updated":"2026-05-01T11:23:38Z","snapshot_observed_at":"2026-07-06T22:39:04.164003Z","submitted_at":"2025-12-15T16:38:59Z","title":"Adapting MLLMs for Nuanced Video Retrieval","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:09.051957Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2512.13511"},"observation_digest":"sha256:8d92c1cb13151b75e2cf4a5886ce0f7534c8e3050cc5cc7085a3382916339b0b","observation_id":"da4facba-bf19-4448-a034-e86ebbe38fb5","resolution":{"observed_at":"2026-05-16T22:21:18.875720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-03T16:25:59.060875Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-08T08:34:03.360784Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:59.060875Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:4bfc3a871b7f05396562f62d539c7980a537344b955cc55ea206ee3c9742c47b","observation_id":"7ffc17f1-87cf-46b9-890f-4755ca5b67c0","resolution":{"observed_at":"2026-08-03T16:25:59.060875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-02T20:59:25.698578Z","title":"Wang, Y ., Wang, S., Zhu, S., Fu, F., Liu, X., Xiao, X., Li, H., Li, J., Wu, F., and Cui, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21788","last_updated":"2026-06-08T12:37:51Z","snapshot_observed_at":"2026-08-10T09:51:23.383735Z","submitted_at":"2026-02-25T11:11:53Z","title":"Efficient Scaling of LLM Training with Flexible Context Parallelism","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T20:59:25.698578Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2602.21788"},"observation_digest":"sha256:1eff43611d2660edb6c6f50c8e0e4f5f4cc965e3d136e2dcdffd63b7e9541f90","observation_id":"865c0116-97e4-4f43-95e6-330b4bc095c6","resolution":{"observed_at":"2026-08-02T20:59:25.698578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2602.22779","last_updated":"2026-06-03T09:11:47Z","snapshot_observed_at":"2026-08-11T02:30:31.429201Z","submitted_at":"2026-02-26T09:15:34Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T19:11:52.694778Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2602.22779"},"observation_digest":"sha256:f981305a330a4673ba8c27712dfd0bf0962f9a42f3822812ba28c5b5ba392cac","observation_id":"8244475b-1246-4855-a1dd-e3fa90962bbc","resolution":{"observed_at":"2026-05-15T19:16:31.775449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-02T20:38:44.081929Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.22779","last_updated":"2026-06-03T09:11:47Z","snapshot_observed_at":"2026-08-11T02:30:31.429201Z","submitted_at":"2026-02-26T09:15:34Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T20:38:44.081929Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2602.22779"},"observation_digest":"sha256:56da33a2c74c91cd9768b45647f56d32f2dfd04a9d8d60cebc52addf904131c9","observation_id":"e60ffcc2-33f3-4934-8738-43266ad76682","resolution":{"observed_at":"2026-08-02T20:38:44.081929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.06783","last_updated":"2026-04-08T07:52:28Z","snapshot_observed_at":"2026-07-06T22:55:11.560398Z","submitted_at":"2026-04-08T07:52:28Z","title":"Insights from Visual Cognition: Understanding Human Action Dynamics with Overall Glance and Refined Gaze Transformer","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T18:07:41.426142Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.06783"},"observation_digest":"sha256:44fcfc564d741ac9adbac20189f44fcf0bcb389246596c4d532694771f591b7b","observation_id":"e0ff4ce5-78ba-4e71-b9a6-eff494c887c4","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.07991","last_updated":"2026-04-09T08:59:40Z","snapshot_observed_at":"2026-08-11T04:17:12.366150Z","submitted_at":"2026-04-09T08:59:40Z","title":"MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T17:11:14.242522Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.07991"},"observation_digest":"sha256:3308c2488b3a908a4c003c4bed64ffec138a1b88b9b788262304081cd7e6a1d5","observation_id":"b849b742-36a3-4513-883f-3057e2185568","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.08337","last_updated":"2026-04-09T15:10:25Z","snapshot_observed_at":"2026-08-03T10:29:21.842229Z","submitted_at":"2026-04-09T15:10:25Z","title":"InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:33.139310Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.08337"},"observation_digest":"sha256:d1549f01094d059022f47ee295369e3158b0d90479e6d1b19ee5615efbd44dd7","observation_id":"0c625605-0c7a-4735-af4e-b9ec9d873b1f","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.08762","last_updated":"2026-04-09T20:51:13Z","snapshot_observed_at":"2026-07-06T22:57:50.266735Z","submitted_at":"2026-04-09T20:51:13Z","title":"InstrAct: Towards Action-Centric Understanding in Instructional Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T17:07:49.334104Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.08762"},"observation_digest":"sha256:645b282a760631b31d6a595b7087ac1d2709941b813356851295ca1a749c01b6","observation_id":"0f891e84-a2a2-42fb-a7b7-fb9efba14814","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.08966","last_updated":"2026-04-10T05:10:15Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T05:10:15Z","title":"How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:50:48.559703Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.08966"},"observation_digest":"sha256:0875581ef9771e711b1d1dadf8d2d6c81fa9f83297193a0c63a03adb8aeff0b8","observation_id":"5b7f40ef-af3c-4425-bdb8-671a05b9ca51","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-08-09T05:10:13.009841Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:600c31bfc8f6a3338b3bd87180b530b04b1a0d68ff658d5380d7707745450b92","observation_id":"2c0d6f8c-470e-411d-9c68-42a0f99148c6","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.17472","last_updated":"2026-04-19T14:53:38Z","snapshot_observed_at":"2026-08-10T22:51:55.045199Z","submitted_at":"2026-04-19T14:53:38Z","title":"UniMesh: Unifying 3D Mesh Understanding and Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:42.679323Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.17472"},"observation_digest":"sha256:140a57bac26c41b01b8afcfb5519c4f688c9e2a949af9187e12fb28fe8c89167","observation_id":"742815fa-753f-4906-89a3-f07e4c404c68","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.21931","last_updated":"2026-04-23T17:59:57Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:59:57Z","title":"Seeing Fast and Slow: Learning the Flow of Time in Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-09T21:55:17.377887Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.21931"},"observation_digest":"sha256:ce3b472e63a74345c4efdb4e4b5ca684fae65d1338d96d61e1f3aaa2470a9783","observation_id":"7dcbb625-6023-46af-a3da-cc78a202cc6d","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.23789","last_updated":"2026-05-09T04:03:59Z","snapshot_observed_at":"2026-08-10T21:42:30.051332Z","submitted_at":"2026-04-26T16:28:46Z","title":"MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T06:28:42.129881Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.23789"},"observation_digest":"sha256:31421da2d62660dab94b4912358ea9ac1def31731c5753884b2f663df609f8cc","observation_id":"447ca9d5-c470-4332-a75a-34cd3b686a02","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.23789","last_updated":"2026-05-09T04:03:59Z","snapshot_observed_at":"2026-08-10T21:42:30.051332Z","submitted_at":"2026-04-26T16:28:46Z","title":"MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:10.509727Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.23789"},"observation_digest":"sha256:1174086117b45b7718bf834fc45553e5c90655c103a3664372ae55abbbafc760","observation_id":"c2bdacff-4003-4031-b5e5-0c12abde9be9","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-08-10T12:29:16.529286Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:e1f9502e190f0779d27320e75f6fcedec369c6dfbb706e1f51ef9218ca325a14","observation_id":"3f6d8964-8e9a-444a-af15-d1d4f59abbff","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2604.26565","last_updated":"2026-04-29T11:51:35Z","snapshot_observed_at":"2026-08-10T21:10:06.962801Z","submitted_at":"2026-04-29T11:51:35Z","title":"DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-07T13:50:23.835653Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2604.26565"},"observation_digest":"sha256:798c9ec3b75cf2cb5a2ff21caf48bee6596f6ef33d248b4273b174a18993b07e","observation_id":"dc920f33-c18d-4b0c-9ff0-e691a0cafe1e","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.01809","last_updated":"2026-05-03T10:25:47Z","snapshot_observed_at":"2026-08-11T03:05:55.994228Z","submitted_at":"2026-05-03T10:25:47Z","title":"TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T16:11:16.551910Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.01809"},"observation_digest":"sha256:9c67cfc7112877e651d342196488f5370d6faa912badfcc2c2eb31c2e2cb947f","observation_id":"7f9d89da-9e81-46ff-81cc-d196e3df9427","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.09976","last_updated":"2026-05-11T04:34:32Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:34:32Z","title":"OZ-TAL: Online Zero-Shot Temporal Action Localization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T02:48:20.005281Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.09976"},"observation_digest":"sha256:118b4928574f19d0c425b44ee64cb8a36b4c9ed7061a0da1cc18d0b8ffba0ab4","observation_id":"8ff7a753-c4b2-42bf-8bb2-7175ff015597","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:ea64cb286d64e4c73f2a5d5eca08f2d09111c2de785f5c9ec45988f9c5ffafce","observation_id":"0994a83c-63ec-4923-a22f-f68a8437b17c","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.12957","last_updated":"2026-05-13T03:43:02Z","snapshot_observed_at":"2026-08-03T12:02:35.607321Z","submitted_at":"2026-05-13T03:43:02Z","title":"GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.410139Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.12957"},"observation_digest":"sha256:24c2affec925cb9fe721ad462e290677a2b87d078ef044a14f5336808c929dbb","observation_id":"8dc8fe02-ae02-4b84-9d97-9f945aa585c6","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.14136","last_updated":"2026-05-13T21:39:50Z","snapshot_observed_at":"2026-07-06T23:25:34.835136Z","submitted_at":"2026-05-13T21:39:50Z","title":"TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T04:59:34.046044Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.14136"},"observation_digest":"sha256:fade6ac0f2a6ff9dd782712bd00a67baac02e8867581930bac81245e7afb080b","observation_id":"724a98c9-12e5-45fb-8535-f0d10359438c","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.14569","last_updated":"2026-05-14T08:39:42Z","snapshot_observed_at":"2026-08-05T11:27:50.353545Z","submitted_at":"2026-05-14T08:39:42Z","title":"Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-15T01:51:57.018809Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.14569"},"observation_digest":"sha256:57abfd53e6c2643c744a3fe6b05a91c1b6a412bff4c92391406e547b8096586d","observation_id":"31da3f52-8af4-4f63-8e02-7696c037be8f","resolution":{"observed_at":"2026-05-15T06:30:22.925421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.19223","last_updated":"2026-05-19T00:48:14Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-19T00:48:14Z","title":"HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T07:38:08.819186Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.19223"},"observation_digest":"sha256:498d866f9f3036bd0e347a1d734df221c3dcbf207fc147725f9276a96b30ef5e","observation_id":"e3c78d92-5a10-434d-986d-f9a4f6fce380","resolution":{"observed_at":"2026-05-20T07:43:08.500431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.19728","last_updated":"2026-05-19T12:02:17Z","snapshot_observed_at":"2026-08-03T06:16:41.678547Z","submitted_at":"2026-05-19T12:02:17Z","title":"Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T05:42:59.996351Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.19728"},"observation_digest":"sha256:ae14daab545185f8bf675ce8d99d452e8cfbcbe622d08be9f03e0a2980d4cdbb","observation_id":"8fcd00f2-b360-4a31-8a50-1836b20ec72d","resolution":{"observed_at":"2026-05-20T05:43:05.344245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.23610","last_updated":"2026-05-22T13:20:29Z","snapshot_observed_at":"2026-08-08T10:04:13.494103Z","submitted_at":"2026-05-22T13:20:29Z","title":"EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T04:57:13.479165Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.23610"},"observation_digest":"sha256:c5dfbabe3f59017bda5d0724ee0db5c974148c9f0b46c532b911941608fe7b13","observation_id":"983cb006-f158-4bb8-8bb6-e9c1df261456","resolution":{"observed_at":"2026-05-25T05:00:22.396412Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-09T04:08:48.023047Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:089824232167b1489c690703ca6005edd7c5243d1b55592234887438fd84185a","observation_id":"a34e84b6-6b7c-415e-a663-a463f083e867","resolution":{"observed_at":"2026-06-30T13:44:41.227663Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2605.30268","last_updated":"2026-05-28T17:29:19Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T17:29:19Z","title":"PhyGenHOI: Physically-Aware 4D Generation of Dynamic Human-Object Interactions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T08:17:14.536157Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2605.30268"},"observation_digest":"sha256:4c9f154e1460c4683c338d176ddf8410576e7bb1e1e71ac4420554d952795324","observation_id":"b9a67c7d-e0c5-4340-b268-c14f00cfca16","resolution":{"observed_at":"2026-06-29T08:23:15.529824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2606.00658","last_updated":"2026-05-30T10:15:26Z","snapshot_observed_at":"2026-08-08T11:33:01.937288Z","submitted_at":"2026-05-30T10:15:26Z","title":"Collaborative Few-Step Distillation and Low-Bit Quantization for Wan2.2 Dual-Expert Video Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T18:58:13.799615Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.00658"},"observation_digest":"sha256:8e2ec8104a80054fbb5b4b74c6250c72ee7f29b4691655998321c87ca304e2f7","observation_id":"4b773ed1-f8c1-4eca-a18f-b0b2eb3177c3","resolution":{"observed_at":"2026-06-28T19:02:34.304002Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:891b58b6f9310c0c135153ee21f632806f68a7e6af2b9017272d797f45f75c12","observation_id":"d5cb3a71-66a6-4d92-be6d-bd5d0ad139e2","resolution":{"observed_at":"2026-07-02T12:46:56.822372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2606.07649","last_updated":"2026-07-21T08:36:41Z","snapshot_observed_at":"2026-08-08T15:10:26.132446Z","submitted_at":"2026-06-02T12:55:41Z","title":"ViMax: Agentic Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T10:37:21.944514Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.07649"},"observation_digest":"sha256:f77e02c2ca9d9556d6a7dd6898ec0cefac6d1721bf284a45255d48e21754828c","observation_id":"69aac290-bb62-4c8b-bb0b-55ea4a9876e1","resolution":{"observed_at":"2026-07-02T02:46:29.093730Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-02T12:30:53.634740Z","title":"Weijia Wu, Zeyu Zhu, and Mike Zheng Shou","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07649","last_updated":"2026-07-21T08:36:41Z","snapshot_observed_at":"2026-08-08T15:10:26.132446Z","submitted_at":"2026-06-02T12:55:41Z","title":"ViMax: Agentic Video Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T12:30:53.634740Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.07649"},"observation_digest":"sha256:5b7b6130d0498c1db5897953426884e25f94081351fb2da2f01968af1af679ae","observation_id":"47973b93-7910-4b31-8771-bccf6678b9ec","resolution":{"observed_at":"2026-08-02T12:30:53.634740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2606.09639","last_updated":"2026-06-11T05:58:22Z","snapshot_observed_at":"2026-08-02T02:07:05.154330Z","submitted_at":"2026-06-08T15:35:51Z","title":"CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T17:30:25.371658Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.09639"},"observation_digest":"sha256:4ae66454a8f7c974a865960fb63b5833e506debbd8f11b3129f545a1def67c2c","observation_id":"23b586ec-97ca-436d-a597-73fc5c754578","resolution":{"observed_at":"2026-07-03T00:07:28.115521Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2606.11969","last_updated":"2026-06-10T11:49:54Z","snapshot_observed_at":"2026-07-06T23:50:58.297354Z","submitted_at":"2026-06-10T11:49:54Z","title":"SpecLoR: Spectral Lookahead Rectification for Motion-Coherent Text-to-Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T10:00:35.608696Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.11969"},"observation_digest":"sha256:3f90a1266520fc48a748a4f7c4ae459a9ecd9f15f8fd6f8f095355173ed1d10c","observation_id":"f614416f-0818-47b8-8dae-1f0979eeb8a7","resolution":{"observed_at":"2026-07-03T10:27:56.744669Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2606.12215","last_updated":"2026-06-10T15:29:45Z","snapshot_observed_at":"2026-07-06T23:51:13.191639Z","submitted_at":"2026-06-10T15:29:45Z","title":"MLT-Dedup: Efficient Large-Scale Online Video Deduplication via Multi-Level Representations and Spatial-Temporal Matching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T09:43:22.054789Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.12215"},"observation_digest":"sha256:8298efc4755d6698c9cef84443e30fb0ceb9725122d6db1e74b5cb31c91f07bf","observation_id":"dd62c66e-c7f5-4afc-8aaf-da23ca716ddc","resolution":{"observed_at":"2026-07-03T10:58:03.533522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2606.20799","last_updated":"2026-07-15T15:45:17Z","snapshot_observed_at":"2026-08-02T10:48:03.144592Z","submitted_at":"2026-06-18T18:00:03Z","title":"GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T18:15:51.862192Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.20799"},"observation_digest":"sha256:de48bf27220d69f7d28bbca810c55eb23a659aff51d28d61c78c568dc0ef56fd","observation_id":"6c608ea4-a649-44f6-bf37-4a5cb9fbff96","resolution":{"observed_at":"2026-07-04T03:19:30.186003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-02T10:48:07.007337Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20799","last_updated":"2026-07-15T15:45:17Z","snapshot_observed_at":"2026-08-02T10:48:03.144592Z","submitted_at":"2026-06-18T18:00:03Z","title":"GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T10:48:07.007337Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.20799"},"observation_digest":"sha256:d04abdfd4b7b2e6fc86e4cbca83f9a9f3b47b535d1f39ad6bec4d08c2160fb4c","observation_id":"ffce0e3c-5d26-47a0-a99c-3e810f98f6c5","resolution":{"observed_at":"2026-08-02T10:48:07.007337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:d750b99dffbf5047d10fe3755d648fff854edf4a2eeffda1956a412c0e09f850","observation_id":"c94e94a9-48f4-4772-9768-39ac77418ff8","resolution":{"observed_at":"2026-07-04T06:39:37.514533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T07:18:20.501369Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:fc5a74d9fb4229713fcfc9e8379364213a9c607e5fbc9085cf2249a56522a1f6","observation_id":"13c6f3a5-74aa-4e65-b246-c1be83f2fecb","resolution":{"observed_at":"2026-06-30T07:24:21.589088Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-14T17:03:01.432145Z","title":"arXiv preprint arXiv:2307.06942 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29473","last_updated":"2026-07-13T12:28:13Z","snapshot_observed_at":"2026-07-16T23:19:38.740232Z","submitted_at":"2026-06-28T16:01:04Z","title":"MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T17:03:01.432145Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2606.29473"},"observation_digest":"sha256:2c335867b9bf0bc84fe88ade51c56291e5f1c3a2d1d9ad0691a4964154f50f7f","observation_id":"c611cf4c-bfe3-45e4-9a0a-522ce4031e0e","resolution":{"observed_at":"2026-07-14T17:03:01.432145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-12T05:50:16.895740Z","title":"arXiv preprint arXiv:2307.06942 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02959","last_updated":"2026-07-03T05:05:59Z","snapshot_observed_at":"2026-08-06T10:42:51.828740Z","submitted_at":"2026-07-03T05:05:59Z","title":"Incentivizing Vision Language Models to Search for Long Video Question Answering","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T05:50:16.895740Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.02959"},"observation_digest":"sha256:92229d6c5b17b6a3a1adc62de8dde8cdbc292f9cecfb921dad67a723bfc6763c","observation_id":"99b8ea70-9a6f-41fc-a2e7-9b7ae6699945","resolution":{"observed_at":"2026-07-12T05:50:16.895740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2307.06942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:8761485dd9e24d1097dc17a919d732a309c0098f1ed33bafc242bc5064e9c3c3","observation_id":"3b5a1d80-68c3-46b4-9643-65678c44f226","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-01T17:45:04.006638Z","title":"arXiv preprint arXiv:2307.06942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-05T13:38:45.921055Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:04.006638Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:45a6f84f0c2fa7e15eed89294e84592fe3e1b8f79f4c0f97b926924273aa514e","observation_id":"885445ab-eacf-483f-a953-47177b84ab8c","resolution":{"observed_at":"2026-08-01T17:45:04.006638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-01T17:22:32.633281Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17675","last_updated":"2026-07-20T08:27:18Z","snapshot_observed_at":"2026-08-06T20:46:21.533031Z","submitted_at":"2026-07-20T08:27:18Z","title":"ShotPlan: Cinematic Video Generation with Learnable Planning Token","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T17:22:32.633281Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.17675"},"observation_digest":"sha256:42c0dd6efc4362ffb5231466a22d4151098a867d9cb772719e9dc78bf345469a","observation_id":"03137473-91ef-4984-9fa1-c623d1cf536b","resolution":{"observed_at":"2026-08-01T17:22:32.633281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-01T14:24:46.109969Z","title":"InternVid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.109969Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:3f145074d4c0409fbde628059b27a05de6333cec51a49557fd2977917b4356f1","observation_id":"2c439224-b816-4c81-a181-933ffe2909de","resolution":{"observed_at":"2026-08-01T14:24:46.109969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-31T23:10:27.561730Z","title":"arXiv preprint arXiv:2307.06942 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:27.561730Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:daeecaa595526d272f9c1279dcfed149473c3c0cdb6876650fdacad0366b5ddd","observation_id":"b0f8e8f5-cf37-4d83-9e26-a66c6e860f4a","resolution":{"observed_at":"2026-07-31T23:10:27.561730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-31T11:46:42.233597Z","title":"arXiv preprint arXiv:2307.06942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24560","last_updated":"2026-07-27T15:31:23Z","snapshot_observed_at":"2026-08-06T10:48:22.930620Z","submitted_at":"2026-07-27T15:31:23Z","title":"EgoPlay: Event-Triggered Video Editing for Egocentric Streams","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-31T11:46:42.233597Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.24560"},"observation_digest":"sha256:03af5301643e4ca1d61c3b98660684dab0d69286aa72d15d78e17a285e3f8538","observation_id":"9450afd1-f176-4fce-86ea-0b9877e2b8d1","resolution":{"observed_at":"2026-07-31T11:46:42.233597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-02T09:17:00.664674Z","title":"arXiv preprint arXiv:2307.06942 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-09T18:48:05.949006Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.664674Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:1b1e244d554f5c47eb0f74a060bedfedd842a124ab105064d0fbacce07b1441d","observation_id":"90122d2e-2650-4361-8e45-90c25df1d96c","resolution":{"observed_at":"2026-08-02T09:17:00.664674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-01T13:56:37.009703Z","title":"arXiv preprint arXiv:2307.06942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26529","last_updated":"2026-07-29T06:48:11Z","snapshot_observed_at":"2026-08-10T00:44:15.777206Z","submitted_at":"2026-07-29T06:48:11Z","title":"CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T13:56:37.009703Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.26529"},"observation_digest":"sha256:5f17de6983706e10fe69ffdae44c718ea20bf2a463179a93954baf118f2507f5","observation_id":"bb1f23e9-3732-4a02-a01e-8c4497451a29","resolution":{"observed_at":"2026-08-01T13:56:37.009703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-30T23:47:57.752509Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-07-29T09:40:23Z","snapshot_observed_at":"2026-08-07T09:33:33.406786Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.752509Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:2e4799ed2a66af601f83871198dc46978723da15512510865d5576c05eaeda5e","observation_id":"2af81da1-5a35-4ec6-8f31-078701ba5f68","resolution":{"observed_at":"2026-07-30T23:47:57.752509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-01T04:24:27.351945Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27634","last_updated":"2026-07-30T03:45:34Z","snapshot_observed_at":"2026-08-09T13:20:35.345494Z","submitted_at":"2026-07-30T03:45:34Z","title":"4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-08-01T04:24:27.351945Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.27634"},"observation_digest":"sha256:50053f64c9666c28c252274fde3660a1008b604937607ca0392090ebd4d2912e","observation_id":"8a083e30-7eb0-436f-820f-6f0b30085e5d","resolution":{"observed_at":"2026-08-01T04:24:27.351945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2307.06942/citation-record","integrity":"/paper/2307.06942/integrity","json":"/paper/2307.06942/citation-record.json","paper":"/paper/2307.06942"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"b50c9b32-76fe-43d5-b25e-cb27d397e9fd","year":1901},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:662fdaeb49c9c34b74883c56898716f09927f85486543fe0aabc42992b768ff2","observation_id":"95d1c26f-548a-4136-8067-c6cfcd01561d","resolution":{"observed_at":"2026-05-15T06:30:22.847582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"4dbd9fea-5e22-428e-af10-fffaa570fb86","year":2019},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:397c33301c28cf1a914a985ea7d91931da9dcd8f4ece7c635648397b10e814c7","observation_id":"5bb18b84-cbd8-4449-be72-c518267fe6af","resolution":{"observed_at":"2026-05-15T06:30:22.767085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"555e923f-999c-40c6-858a-04eb595d89e2","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:f3c86253184244292a5fd78ddaf168d90f5005a4738d15de1e3a681489eb49b4","observation_id":"dac10ac8-654b-4bfb-9d5d-f3000bf2472d","resolution":{"observed_at":"2026-05-15T06:30:22.771097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Merlot: Multimodal neural script knowledge models","venue":null,"work_id":"cb6de4ab-804d-4ccc-af6b-0ccd5fcd09c9","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:520ec47521f02e64b79842151ed072151ee03f059fc9983331b8312bcdd6a3fc","observation_id":"e5cafb74-dfd6-4c80-9962-45d18d7e4bb0","resolution":{"observed_at":"2026-05-15T06:30:22.774776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Merlot reserve: Neural script knowledge through vision and language and sound","venue":null,"work_id":"6b00c0e3-0506-4e5c-a0fb-2a1e20c58aef","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:ae29535d9ee896e0634a14fcb86ac89073cd7ca63fa03b8b34a553bf6b75623a","observation_id":"cdaf469d-3f9c-43f5-8234-d16b7499359d","resolution":{"observed_at":"2026-05-15T06:30:22.779043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"afbc2835-30e9-41e3-986a-dbe9c4887c69","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:598a24fb2c8a599b109761c4837afbd8b736f3f868c0191ac4dda024d27e711a","observation_id":"e40856e8-dc68-43e7-9f66-700ad2458cd8","resolution":{"observed_at":"2026-05-15T06:30:22.783527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:45bb0c66aa2320cc531874ebb1162043ea79ae3df4c641e8c4f9ba1832bdba43","observation_id":"c1f02b5c-6bb4-47f6-9628-33cb6967eb42","resolution":{"observed_at":"2026-05-15T06:30:22.494018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openflamingo","venue":null,"work_id":"8f318ea8-ad3c-4346-90e6-758be1279df6","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:242e9d33914e3f905a4663c9e027323fe862c38b064c4c61f90a5a6544428436","observation_id":"88cba3f0-c804-4be0-8290-0d029175e7fe","resolution":{"observed_at":"2026-05-15T06:30:22.791306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:753b5b5d38f35f906d186ea768425b3e3123eaa5595448821e3056c1086f9b59","observation_id":"8af34b3e-4c11-4f9e-afe1-2eefefb5c0bc","resolution":{"observed_at":"2026-05-15T06:30:22.502036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":"2305.06355","doi":"10.48550/arxiv.2305.06355","metadata_source":"pith","pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoChat: Chat-Centric Video Understanding","venue":"cs.CV","work_id":"07461eec-156c-4054-a28e-b84bc53bf6e1","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:121f03635b774379e7d77ab25b010e96e5c36025c8426dde0e83935c869260e2","observation_id":"14ee9171-1cfa-45b2-95a4-f627cf2fd942","resolution":{"observed_at":"2026-05-15T06:30:22.509068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05662","last_updated":"2023-06-02T16:19:48Z","snapshot_observed_at":"2026-07-06T15:25:12.782361Z","submitted_at":"2023-05-09T17:58:34Z","title":"InternGPT: Solving Vision-Centric Tasks by Interacting with ChatGPT Beyond Language","version":4},"cited_work":{"arxiv_id":"2305.05662","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.05662","snapshot_observed_at":"2026-07-03T20:08:55.658612Z","title":"Interngpt: Solving vision-centric tasks by interacting with chatgpt beyond lan- guage","venue":null,"work_id":"456c399b-9545-4252-b591-33d7b091fbf0","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2305.05662","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:df1d451cb451d058255545c5666b99ed5a1e69612286f92f9bb5fe211607444e","observation_id":"feddb060-ac08-41fd-85b3-b92b79efb313","resolution":{"observed_at":"2026-05-15T06:30:22.516674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yfcc100m: The new data in multimedia research","venue":null,"work_id":"44f7b178-3de5-4dae-aed1-6d4abd06dfa4","year":2016},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:3edb5efff6d987af1e0e9260bc4010c3af526b83783e5911a1dc661e74bafc1e","observation_id":"0c548432-2503-4b28-aa4c-2660944622c1","resolution":{"observed_at":"2026-05-15T06:30:22.806807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"f1d0d1bc-bac9-454f-9473-e1a7791e781d","year":2018},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:4f4cef10d44daf00e7006aac6e036d4f908b82c249f0a85c96a0ea14432637ad","observation_id":"a8b754b8-ef3f-4433-a0f2-1bb520f06616","resolution":{"observed_at":"2026-05-15T06:30:22.811639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"6708e8b2-eff5-4da7-a1e4-839d43f9f0ee","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:874c5b1cb790ca975e8b400085ef245a3f092a67412f6da2aa53a640b10cb209","observation_id":"fd66b88d-e31f-4c93-a908-a2f9208d0830","resolution":{"observed_at":"2026-05-15T06:30:22.815798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up vision-language pre-training for image captioning","venue":null,"work_id":"2a406f28-0790-4e5f-8fe6-f6fae579c750","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:538047a22137b36d4a6a9728d859588f13968068a59cb53b2cfbc7b3c4285015","observation_id":"848c0e15-0457-42db-b585-9264930a2f00","resolution":{"observed_at":"2026-05-15T06:30:22.820372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11431","last_updated":"2021-11-22T18:59:34Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:34Z","title":"RedCaps: web-curated image-text data created by the people, for the people","version":1},"cited_work":{"arxiv_id":"2111.11431","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.11431","snapshot_observed_at":"2026-07-03T03:57:38.902956Z","title":"Redcaps: Web-curated image-text data created by the people, for the people","venue":null,"work_id":"567bf895-e7af-4229-97b8-94ff08ba8f5c","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2111.11431","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:26312f57c8225aeecec7cf74f60ca7a840d10994fae4eeb1c0252ab6451d8341","observation_id":"3febff2d-9d60-4b7d-80a6-5b27b63ba616","resolution":{"observed_at":"2026-05-15T06:30:22.525115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10755","last_updated":"2023-09-15T09:52:14Z","snapshot_observed_at":"2026-07-06T16:08:33.160103Z","submitted_at":"2023-08-21T14:40:48Z","title":"WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models","version":3},"cited_work":{"arxiv_id":"2308.10755","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.10755","snapshot_observed_at":"2026-07-02T22:17:25.674418Z","title":"Wan- juan: A comprehensive multimodal dataset for advancing english and chinese large models","venue":null,"work_id":"9ad40732-9366-4664-8ff4-660de173e5fd","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2308.10755","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:ee8656d0dbffb88a5e095deb85bdab233e2b191602bfb41a6eb2d26e3d64acba","observation_id":"11e2c600-e6e8-4053-bd5c-c219331e5efe","resolution":{"observed_at":"2026-05-15T06:30:22.533004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opendatalab: Empowering general artificial intelligence with open datasets","venue":null,"work_id":"9ab5da86-e950-4e89-b42f-18ad3243c3d0","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:63bc7025de5bba0b5434b345a75c52030c005cecdf9b63b31f74dbffa213b6c0","observation_id":"282f5ea3-eb52-430f-88ec-76a2c54de8b7","resolution":{"observed_at":"2026-05-15T06:30:22.833785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":"2210.08402","doi":"10.48550/arxiv.2210.08402","metadata_source":"pith","pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","venue":"cs.CV","work_id":"1d19deb4-3043-409d-b901-f047c51a323b","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:e37f358d141e2f1c94b2e963a148b0f3f138d133bb7111cabd6d3dee28fa77d0","observation_id":"fb00fe86-e1e5-4de8-baff-04656ad4b9e5","resolution":{"observed_at":"2026-05-15T06:30:22.539337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wit: Wikipedia- based image text dataset for multimodal multilingual machine learning","venue":null,"work_id":"0aef6461-982f-48a9-930d-9b0e1482b133","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:fd27929725323fbf692dce8a1fbf5caa1755f86bf20d754e8ef53851f37a5d17","observation_id":"940d0324-343e-4aa6-97eb-fc6be49eac82","resolution":{"observed_at":"2026-05-15T06:30:22.843535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16058","last_updated":"2024-03-11T09:21:50Z","snapshot_observed_at":"2026-07-06T15:09:01.194260Z","submitted_at":"2023-03-28T15:39:28Z","title":"Unmasked Teacher: Towards Training-Efficient Video Foundation Models","version":2},"cited_work":{"arxiv_id":"2303.16058","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.16058","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2303.16058 , year=","venue":null,"work_id":"28bed721-6c21-4176-b6fe-0a81b63f75e3","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2303.16058","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:62a95786b62ee3c3397bd4c707e855ec5e57d4b0b708dc050988cc7fae265c51","observation_id":"c0869013-6a87-41ef-a2fa-73804324fa1b","resolution":{"observed_at":"2026-05-15T06:30:22.486478Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning audio-video modalities from image captions","venue":null,"work_id":"45eef60e-7146-4ff0-b722-c76c593e3feb","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:7a4a273fa7f4f1f54a4cb255832ef6016bf01f41fb9b537d983664da7bea09a6","observation_id":"54d264cc-8c0c-47c5-aab0-0a567bbbf34b","resolution":{"observed_at":"2026-05-15T06:30:22.851443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end learning of visual representations from uncurated instructional videos","venue":null,"work_id":"baa1286d-3fc1-41f9-a3f8-c9a951999879","year":2020},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:242d56398a5c3f8b8ca26a6df38780dd2297964aa0491f249d75a31e37833651","observation_id":"eb79fada-a208-49ce-8d62-902b259f8fea","resolution":{"observed_at":"2026-05-15T06:30:22.856294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.05691","last_updated":"2021-01-28T01:43:34Z","snapshot_observed_at":"2026-08-10T17:29:43.107061Z","submitted_at":"2020-01-16T08:28:57Z","title":"Learning Spatiotemporal Features via Video and Text Pair Discrimination","version":3},"cited_work":{"arxiv_id":"2001.05691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2001.05691","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning spatiotemporal fea- tures via video and text pair discrimination","venue":null,"work_id":"f9fa1d6c-64f0-4b92-bdb7-a4a98296fd68","year":2001},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2001.05691","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:e6df326d1c61023731ca608a8e4b0e43c21b89f4e4278dc271e537f7a98cea28","observation_id":"48d86566-db18-4702-8d62-034dec52029b","resolution":{"observed_at":"2026-05-15T06:30:22.546904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":"2109.14084","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-07-04T06:39:37.380967Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":"509d3b12-48dd-4984-9d28-a28d917f0b1c","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:cec0e8cedc3a003bda22f03a924e0f8386ef8fb316ba80a9605f179ecad7163d","observation_id":"eed293b8-bc7f-4447-a1a7-672174934fd9","resolution":{"observed_at":"2026-05-15T06:30:22.554543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09552","last_updated":"2022-11-17T14:17:40Z","snapshot_observed_at":"2026-08-07T04:39:25.258902Z","submitted_at":"2022-11-17T14:17:40Z","title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","version":1},"cited_work":{"arxiv_id":"2211.09552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09552","snapshot_observed_at":"2026-07-03T19:08:49.809225Z","title":"Uniformerv2: Spatiotemporal learning by arming image vits with video uniformer","venue":null,"work_id":"cb4c2612-0c2a-4ab9-9dde-7031260274d1","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2211.09552","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:5b7c4a2714cd58e6b57d1441c290ea4ae81228cffae26c9ac356a7a43f66a926","observation_id":"82c9ad0b-52d7-4917-8e8f-d6e77fa45beb","resolution":{"observed_at":"2026-05-15T06:30:22.561008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empirical study of training end-to-end vision-and- language transformers","venue":null,"work_id":"e298ce0c-2367-4a7b-a894-9dd3c754981a","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:896e838b253338adc34ce6ca7d4ce80f4360313aa1a8ff38b3d9a706fa047b1c","observation_id":"b880b3eb-92b2-4175-a4e2-503d4694ffc4","resolution":{"observed_at":"2026-05-15T06:30:22.873275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:2a94f59ccfe17abd157ef60776d22a6568dd2c9462d171868ce9dc963d4070d1","observation_id":"c46e81a1-d775-4997-a9d0-c1b7f6d1e4f4","resolution":{"observed_at":"2026-05-15T06:30:22.567453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:fe04c87ee1984a0161cf2394830f1c8c91ab6a287cd4961f81f1026741b5b984","observation_id":"0674e91f-b242-4d8b-aa76-cbcaa4141965","resolution":{"observed_at":"2026-05-15T06:30:22.575279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Murphy, and Cordelia Schmid","venue":null,"work_id":"bd228181-4788-4533-a1ed-ee050e8ab84b","year":2019},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:8b88f0db59dbe701ad4917c37d9eab225607a6f4826a6992e01c42a6def34b73","observation_id":"a58f1f40-4620-4dae-b76e-87b7f3c29a00","resolution":{"observed_at":"2026-05-15T06:30:22.886345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Actbert: Learning global-local video-text representations","venue":null,"work_id":"d3004fc7-15c5-4a57-98f9-cce663656302","year":2020},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:b74b7fac160cbbc3f49be89b063aac57f02e101f76be1d5fa8eabe62b16e4ab0","observation_id":"eeeb16d2-56d4-4b15-815b-ea6df4f5bb95","resolution":{"observed_at":"2026-05-15T06:30:22.890487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:f46f2e7480578b1d1d1861df0b95aca8a553c3d157c309217fb951ef2f8e13f9","observation_id":"dbc082f8-2ef1-41da-babd-92fd7526efe7","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09529","last_updated":"2022-11-17T13:45:06Z","snapshot_observed_at":"2026-08-10T05:30:20.599642Z","submitted_at":"2022-11-17T13:45:06Z","title":"InternVideo-Ego4D: A Pack of Champion Solutions to Ego4D Challenges","version":1},"cited_work":{"arxiv_id":"2211.09529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09529","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvideo-ego4d: A pack of champion solutions to ego4d challenges","venue":null,"work_id":"54773a77-a0f2-43d2-9158-858d1d0652f9","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2211.09529","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:ca32e443bf3448768a3889c61e8d2f8febbfdd73566189a86361e7569e3d594e","observation_id":"e1b1d153-e310-46b5-bb3a-e651e945d2eb","resolution":{"observed_at":"2026-05-15T06:30:22.588303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable spatiotemporal representations from natural script knowledge","venue":null,"work_id":"05adb42d-51e2-402d-a929-10cd1bc84b93","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:f37d79feb37a43b76c840daa7f02be035d0a627f9aeb2adb609ce971b395123d","observation_id":"39c9893c-d8db-41f2-9ecb-70439aca86fe","resolution":{"observed_at":"2026-05-15T06:30:22.905098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14173","last_updated":"2023-05-23T15:44:56Z","snapshot_observed_at":"2026-07-06T15:31:36.425535Z","submitted_at":"2023-05-23T15:44:56Z","title":"TVTSv2: Learning Out-of-the-box Spatiotemporal Visual Representations at Scale","version":1},"cited_work":{"arxiv_id":"2305.14173","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14173","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2305.14173 , year=","venue":null,"work_id":"7e82492b-c85e-49a6-924e-fce29eb6293f","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2305.14173","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:87ec38f9e048ef01f45b608743d4409869e19592282ab8f29c2a0b158c523c1c","observation_id":"3d770f5c-d9a9-4c27-9943-6e07d6fa0a35","resolution":{"observed_at":"2026-05-15T06:30:22.594600Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-11T01:34:05.694973Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:bddc63964440f508ee7b8a6a7d932a40e5d604a7e9dab0e51d6cfa8089738fc9","observation_id":"c541cc23-02e0-4193-9ac5-4076649b7a59","resolution":{"observed_at":"2026-05-15T06:30:22.601941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"5afc4cc4-ef4c-4e1a-959c-080122e715f9","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:a8f2ca1ae73274baf986cb34495ab49802bb913814f6968ae173cfdc0ef1cf83","observation_id":"84278e2b-ac46-43a1-ad71-5666f994b8ae","resolution":{"observed_at":"2026-05-15T06:30:22.919086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"627e8b16-80e4-4c4c-ab5b-cd29beb3b88a","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:e8f393806b410081405c53e8dcaa5e203a5908164f2d2e32adf04ef887f4f54f","observation_id":"6b61d34b-dd18-43e6-8397-b55c889d3622","resolution":{"observed_at":"2026-05-15T06:30:22.923758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07160","last_updated":"2022-06-14T20:43:25Z","snapshot_observed_at":"2026-07-06T13:20:51.362304Z","submitted_at":"2022-06-14T20:43:25Z","title":"LAVENDER: Unifying Video-Language Understanding as Masked Language Modeling","version":1},"cited_work":{"arxiv_id":"2206.07160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.07160","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lavender: Unifying video-language understanding as masked language modeling","venue":null,"work_id":"a66881b8-36b2-40f7-94ff-15730443b004","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2206.07160","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:b021ff51c491959523997632ceaec531ef1af14d48b3e6c16606816dd86058f6","observation_id":"10fb84ee-7504-4aef-be19-cc3458e42a42","resolution":{"observed_at":"2026-05-15T06:30:22.608373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07303","last_updated":"2022-03-14T17:06:30Z","snapshot_observed_at":"2026-07-06T12:47:38.925428Z","submitted_at":"2022-03-14T17:06:30Z","title":"All in One: Exploring Unified Video-Language Pre-training","version":1},"cited_work":{"arxiv_id":"2203.07303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.07303","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All in one: Exploring uniﬁed video-language pre-training","venue":null,"work_id":"91bd00d9-4041-47ad-a58d-043b0c543c9c","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2203.07303","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:5ed316b7562c8c938e2f8dfe335caf24fdedc055bea04bb824f61009656e451e","observation_id":"44773781-818c-4857-ae18-e6dd84bce805","resolution":{"observed_at":"2026-05-15T06:30:22.616379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-04T04:22:15.975890Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":"2111.12681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-07-03T00:57:30.204945Z","title":"Violet: End-to-end video-language transformers with masked visual-token modeling","venue":null,"work_id":"c7602525-8155-4a61-bd4e-abf06c26e6e7","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:1cfb111f230aad2c1d4fc5a4ad9def9b2db80856d1ef2701a6295af773bc937d","observation_id":"62b232a8-918e-44f4-bd7a-45d429e693fb","resolution":{"observed_at":"2026-05-15T06:30:22.623094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08345","last_updated":"2025-01-06T09:10:55Z","snapshot_observed_at":"2026-08-07T02:26:34.656486Z","submitted_at":"2023-04-17T15:08:15Z","title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","version":2},"cited_work":{"arxiv_id":"2304.08345","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.08345","snapshot_observed_at":"2026-07-04T06:39:37.583391Z","title":"Valor: Vision-audio-language omni-perception pretraining model and dataset","venue":null,"work_id":"aa26e74d-18c2-48ab-a2b5-ea304afa8dcc","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2304.08345","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:71b4117bc2ecb03326ba63ee8f23fa449c70300e9632b4385feed95c24f827cc","observation_id":"875e6e67-3a47-4203-818f-5958c8b8cda0","resolution":{"observed_at":"2026-05-15T06:30:22.630119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00402","last_updated":"2023-02-01T12:40:03Z","snapshot_observed_at":"2026-07-06T14:47:00.945435Z","submitted_at":"2023-02-01T12:40:03Z","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","version":1},"cited_work":{"arxiv_id":"2302.00402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.00402","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mplug-2: A modularized multi-modal foundation model across text, image and video","venue":null,"work_id":"e48f6577-0181-4115-9570-ca671541d2a8","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2302.00402","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:a0d036e8a506afdfaac33b4424d9ce6b8e52d5bfdfd50f0732ff0971c3eacf9e","observation_id":"e8ea9a48-177e-4db5-a889-4efe78cf0f9f","resolution":{"observed_at":"2026-05-15T06:30:22.637374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13167","last_updated":"2023-05-22T15:54:22Z","snapshot_observed_at":"2026-08-05T23:33:04.454032Z","submitted_at":"2023-05-22T15:54:22Z","title":"VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending","version":1},"cited_work":{"arxiv_id":"2305.13167","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13167","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlab: Enhancing video language pre-training by feature adapting and blending","venue":null,"work_id":"832a7370-ef4d-4585-bce9-77ea1600fecd","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2305.13167","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:6766303cf8dd996e8601caabd3cd02fd977044af94b4b2d627cca40fb001e194","observation_id":"7e688be5-ca48-41f7-aeaf-ac5f652c5230","resolution":{"observed_at":"2026-05-15T06:30:22.643920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"acf3ada0-cb7f-4c45-ba3e-17498e65d52a","year":2016},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:b91a7e47d3ff8a3f7725ba445cc6867b0d47012cbaeb7b2b1000607da43e1eb6","observation_id":"099be21f-a0d2-4b88-af76-dc4d29561050","resolution":{"observed_at":"2026-05-15T06:30:22.763014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Localizing moments in video with natural language","venue":null,"work_id":"feccfaa4-539c-4270-abb7-271b60bed8fd","year":2017},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:d85a10a033c24aba4d0379a0638bef0cf85fa02a1029fe3bef3d6fa9e2d173f0","observation_id":"bc37413a-8254-47bf-8784-37cdede5650c","resolution":{"observed_at":"2026-05-15T06:30:22.787448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Movie description","venue":null,"work_id":"4e7936ea-3d8b-4719-85a2-0a14f731c239","year":2017},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:552b39182a148c2294540a1483246bbad10e4d68b6b13ce10383e512fd2a109d","observation_id":"61bc369c-f8b8-4d8b-9123-506988804bf2","resolution":{"observed_at":"2026-05-15T06:30:22.795340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"462f8804-3328-48b7-8ec4-12c2d14ea0fb","year":2018},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:9cd4df60361b6ab5e17d5e14464a8f2cfc1a255901a7d1d928f12f5312040630","observation_id":"92ea5ba5-243d-4604-9f6e-dd9bf7afb8ce","resolution":{"observed_at":"2026-05-15T06:30:22.799298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00347","last_updated":"2018-12-07T07:03:52Z","snapshot_observed_at":"2026-08-04T13:33:48.224677Z","submitted_at":"2018-11-01T12:47:11Z","title":"How2: A Large-scale Dataset for Multimodal Language Understanding","version":2},"cited_work":{"arxiv_id":"1811.00347","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.00347","snapshot_observed_at":"2026-07-04T16:49:57.270995Z","title":"How2: A Large-scale Dataset for Multimodal Language Understanding","venue":"cs.CL","work_id":"62673cc1-e85d-4c0f-93e5-b4b329842f9f","year":2018},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/1811.00347","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:b4f4ae004c67674dc4fc883c66acf620cf81e87204183b36bd005b1d7d2e262b","observation_id":"f9f03ebb-e0fe-41b3-9073-342c21be33aa","resolution":{"observed_at":"2026-05-15T06:30:22.650019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense-captioning events in videos","venue":null,"work_id":"e4f8e85b-7b69-4156-a7d1-98c309526a69","year":2017},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:654f0bb629fda17bcd84b5e4dd752bc09e115799a7ce78848b2a7dc10e1aaa87","observation_id":"1ae40008-4d4d-4eb7-a171-4dc497b4871d","resolution":{"observed_at":"2026-05-15T06:30:22.824583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.14937","last_updated":"2021-08-27T18:03:37Z","snapshot_observed_at":"2026-08-08T04:19:05.063098Z","submitted_at":"2020-07-29T16:19:50Z","title":"Learning Video Representations from Textual Web Supervision","version":2},"cited_work":{"arxiv_id":"2007.14937","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.14937","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning video representations from textual web supervision","venue":null,"work_id":"a7681afd-d28e-4239-b3df-294ee949469f","year":2007},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2007.14937","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:a1f391521fb9138622f1735628317adc845f49f63901bdb82ab89da178381e0e","observation_id":"38a704ec-a40f-4f74-a192-1bc11d1d17ec","resolution":{"observed_at":"2026-05-15T06:30:22.656697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet: A large- scale video benchmark for human activity understanding","venue":null,"work_id":"806d4d5a-7235-4ca9-adfb-248509ef2602","year":2015},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:8a9e880640f95de06dbee55235762e169713542b97ebefe02e5e7805fb722ea6","observation_id":"29d284a9-ffaa-4af5-8fc1-59f24e8d5a05","resolution":{"observed_at":"2026-05-15T06:30:22.839338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"0801f460-46ab-4c3a-9d8e-8e26430587da","year":2017},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:c0be920b1679bc993cf16812932e4b4d235f45944304e78a6d7399308d68e925","observation_id":"75e68bc9-c824-4e4c-a217-b95e102d6610","resolution":{"observed_at":"2026-05-15T06:30:22.861011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"something something","venue":null,"work_id":"941d979c-418e-4ca2-9029-46353ea1ba36","year":2017},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:1e68a6b792017eca2f76355e1f4a2b9bdcc3704d6a836c816ffb5b07633527a5","observation_id":"0ca669ae-6ce7-4b9d-8604-772cf490f5a9","resolution":{"observed_at":"2026-05-15T06:30:22.864884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09235","last_updated":"2018-11-29T03:59:19Z","snapshot_observed_at":"2026-08-10T08:08:15.684785Z","submitted_at":"2018-04-24T20:06:55Z","title":"On the effectiveness of task granularity for transfer learning","version":2},"cited_work":{"arxiv_id":"1804.09235","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.09235","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the effectiveness of task granularity for transfer learning","venue":"cs.CV","work_id":"69505ed8-bc81-45d7-8bc6-6fbdc2cadc0a","year":2018},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/1804.09235","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:6e43b6d5f3a7802ef6f2991cce3e86b9c2375db1d9cf8242d8dbaa7c3b13cef8","observation_id":"d960859f-8771-43df-95e7-9f5cbc1efae0","resolution":{"observed_at":"2026-05-15T06:30:22.662786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":"1212.0402","doi":"10.48550/arxiv.1212.0402","metadata_source":"pith","pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","venue":"cs.CV","work_id":"5dfb46e7-e952-409d-a3c7-ba7f20aebad6","year":2012},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:b2f72031fe6e2a553b71370b9255096d6543ed3baeb3ff642a0e9680f54a8397","observation_id":"08f9679f-6c53-41b8-a7b7-83a71c8920e7","resolution":{"observed_at":"2026-05-15T06:30:22.669014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Co-grounding networks with semantic attention for referring expression comprehension in videos","venue":null,"work_id":"3cc1dc9d-6cdd-4983-ab63-0ee75652793a","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:b269735be8db3b1c3049eccdce9e405815ae0669d40c2d26e444bab528a32515","observation_id":"d907cba7-fb7b-4aaf-bdfe-ebb1a6ffc708","resolution":{"observed_at":"2026-05-15T06:30:22.882252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tubedetr: Spatio-temporal video grounding with transformers","venue":null,"work_id":"b91c46b2-3f93-47ec-828a-8ae53f25b47d","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:ecc6940587e09f227da888ff873d9d2badcb973aea289118e456672c99f33cbe","observation_id":"242784b2-d58d-40a1-a6b8-dcf40b6c91d0","resolution":{"observed_at":"2026-05-15T06:30:22.894940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fb07f03d-12b0-4ebb-ab9c-9fdaeea4cc00","year":2017},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:1bbe79d963e01e56471d1180b746d6c588a7c6b6ce40a14654cdc4a19d38d138","observation_id":"aa9cd3df-61c6-42f3-8196-26777eaa1f70","resolution":{"observed_at":"2026-05-15T06:30:22.899592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03428","last_updated":"2022-06-07T16:28:30Z","snapshot_observed_at":"2026-07-06T13:18:24.036661Z","submitted_at":"2022-06-07T16:28:30Z","title":"Revealing Single Frame Bias for Video-and-Language Learning","version":1},"cited_work":{"arxiv_id":"2206.03428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03428","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reveal- ing single frame bias for video-and-language learning","venue":null,"work_id":"cf7493e5-56d4-4c50-ae1a-bc18b314f586","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2206.03428","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:51c670e18f9122b8c65afd74bd713e02e07baf892e1aee7f4ab79ec041bc0a2a","observation_id":"3b609533-6cb3-4a1a-95c7-23944a314510","resolution":{"observed_at":"2026-05-15T06:30:22.675262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05657","last_updated":"2024-03-18T12:34:30Z","snapshot_observed_at":"2026-07-06T15:01:06.236331Z","submitted_at":"2023-03-10T02:16:35Z","title":"Tag2Text: Guiding Vision-Language Model via Image Tagging","version":3},"cited_work":{"arxiv_id":"2303.05657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.05657","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tag2text: Guiding vision-language model via image tagging","venue":null,"work_id":"9f16058a-f12c-4bbc-878c-6650d9acc38c","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2303.05657","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:1cadac515276e80165936d965a583ad797aedcd32ca162579fcaeb16c137d438","observation_id":"7b59a083-4cb4-41c2-a172-3ac2e76c5913","resolution":{"observed_at":"2026-05-15T06:30:22.682037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"06cdb84d-04bb-4c26-a08c-6bc923499668","year":2020},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:e9da4420c2a398942320f1b7e196a5bb154c338d9ba73887263a98226d47f0e2","observation_id":"c01a9896-eef6-4f6c-87f9-d29f73179f02","resolution":{"observed_at":"2026-05-15T06:30:22.740346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"6e5e2a66-cdab-4f78-b8aa-4a697085ff04","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:f109146f7b5713af14a8b7d8900fe044dea8554499085dc57059c4b90b4a710c","observation_id":"74c720e5-13bc-458e-a066-05815af0ca20","resolution":{"observed_at":"2026-05-15T06:30:22.744175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:c90b0a37fc7f5e0f090bd3d39008acfbacd8eb425403bbbda1e91efda2d024fc","observation_id":"b2cfd191-bb24-47c8-acd9-cf79f305d177","resolution":{"observed_at":"2026-05-15T06:30:22.687587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-08T05:52:17.343895Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"cited_work":{"arxiv_id":"2302.14045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.14045","snapshot_observed_at":"2026-07-04T19:20:06.296460Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","venue":"cs.CL","work_id":"2a1e0563-79f5-4521-8293-b8b1aebf7cee","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2302.14045","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:abe0ca889b2f803443b8c0d5baf0965194ccaeca09d5fd50e4cf2450c5d9e243","observation_id":"1cf8049d-d493-42f7-992f-bc9383f4ce99","resolution":{"observed_at":"2026-05-15T18:32:23.026112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06939","last_updated":"2023-10-28T04:19:41Z","snapshot_observed_at":"2026-07-06T15:15:39.104303Z","submitted_at":"2023-04-14T06:17:46Z","title":"Multimodal C4: An Open, Billion-scale Corpus of Images Interleaved with Text","version":3},"cited_work":{"arxiv_id":"2304.06939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.06939","snapshot_observed_at":"2026-07-01T22:26:17.900939Z","title":"Multimodal c4: An open, billion-scale corpus of images interleaved with text","venue":null,"work_id":"fc67e4a1-354a-4784-ac5b-f4d2f4f815d4","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2304.06939","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:fead1d816e1c596fb964f540ecb3debe18ff73c8e084bcbf5a2925391d31fe07","observation_id":"83655539-7804-4fc7-a7dd-c87582ab9c46","resolution":{"observed_at":"2026-05-15T06:30:22.700766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"01b71c9b-4d32-4343-9478-48b53147831f","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:2649a2819d00cfd9685b7a33c2f69be7c9718d31c5bf656ef975273fb9376af4","observation_id":"82431a86-ef52-4e7c-8c81-b99a31413f23","resolution":{"observed_at":"2026-05-15T06:30:22.759289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"fc7ffbcc-c7fc-4012-8e04-2610cc5a51f7","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:c2f0d366ce7fd122dbd9d7d87ffb9f97a7efea26e3ae43b1c51eb48f1871cac9","observation_id":"78b9f14c-977b-4333-9ef4-b4c9ba44604c","resolution":{"observed_at":"2026-05-15T06:30:22.803274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:f9bb0b94de26bd8978171024f2bfd3938b14cebc59bc2a93538916299eca09d6","observation_id":"332a12fc-907a-4aaa-b2a8-aeb1f0a7b9d8","resolution":{"observed_at":"2026-05-15T06:30:22.706671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention: Fast and memory- efficient exact attention with io-awareness","venue":null,"work_id":"7468bba5-e91f-4936-93e0-07d14d374f8d","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:c0c8b45df1a599a82d5f1745f3c56c219b3c523c9ef135a7348f1f60901865d5","observation_id":"f1159579-42ed-42a8-bc45-88216509d28e","resolution":{"observed_at":"2026-05-15T06:30:22.868754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14108","last_updated":"2023-10-20T17:01:44Z","snapshot_observed_at":"2026-07-06T15:20:41.322682Z","submitted_at":"2023-04-27T11:37:18Z","title":"DataComp: In search of the next generation of multimodal datasets","version":5},"cited_work":{"arxiv_id":"2304.14108","doi":"10.48550/arxiv.2304.14108","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14108","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":"arXiv (Cornell University)","work_id":"a309097d-9350-42a1-9232-7b765166f2da","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2304.14108","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:f803c85f784e93875cc97ef365686bf60de5b4fc6dfefe7c00ac9fc434fdeb12","observation_id":"5b0763c5-fe42-473d-ae4b-031e297c053a","resolution":{"observed_at":"2026-05-15T06:30:22.712246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:beecbba72c6a73d535a4826d463f8d2e23f54d74c3fb2c8278998c057f847d2f","observation_id":"d75a59a5-7492-4341-8443-e0ed414b8f02","resolution":{"observed_at":"2026-05-15T06:30:22.717922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning","venue":null,"work_id":"239190df-6cd6-47e2-8f6d-63d10ff888fc","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:c8f32071839eb5dee3096a3e07092726a0bce30e32b9a417d682070b6a94d59c","observation_id":"c1537e4c-6d45-4028-9d4f-637e32f8178c","resolution":{"observed_at":"2026-05-15T06:30:22.914480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A dataset for movie description","venue":null,"work_id":"a8b7e830-54f8-4d37-b0a7-47fd475fad65","year":2015},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:4601b5493b1d0e9d7a5b74aad5ae59d177eef7c0283de5ee5b551c94e68d3c45","observation_id":"4bef6936-55f5-457b-97e4-cc6a42a8ea06","resolution":{"observed_at":"2026-05-15T06:30:22.747968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":"0593be0e-0977-4c95-b0d0-60f00ac5f3e3","year":2011},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:928f0c4653a332f97a0d77be99efd4204a3bd75b594a2de8ed684c8efd3efbe8","observation_id":"709b1691-9f44-4736-b18e-c5a8a860039c","resolution":{"observed_at":"2026-05-15T06:30:22.751671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"96d43d77-d9cf-478f-a3ef-8e0d0a0f2d10","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:4544df71261ed1f5bd9a4d6f729fdfbb0abcd406116965209ac2f6426766d8c6","observation_id":"2731fb06-4ed2-4576-a267-d91340cf1486","resolution":{"observed_at":"2026-05-15T06:30:22.755378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":"ca7d014d-9bfa-4634-9202-135fd7ed6b44","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:a2455abb17331f7e4c4d15f8d11919c6534db58c0be7f9fc01b479b8f6459bba","observation_id":"178147fe-575a-4c32-ab64-1d9112c9e7fe","resolution":{"observed_at":"2026-05-15T06:30:22.828792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":"2306.05424","doi":"10.48550/arxiv.2306.05424","metadata_source":"pith","pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","venue":"cs.CV","work_id":"51f627f4-8fae-4882-a3e9-abdf932ef27b","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:cf1443c16df7015dc8ceab0f07b1e53e30bf2ad6303d2830f715aae466e362c1","observation_id":"84576d2a-14ed-4846-b78e-e9537e428f95","resolution":{"observed_at":"2026-05-15T06:30:22.723823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2306.05425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-07-04T19:20:06.537902Z","title":"Mimic-it: Multi-modal in-context instruction tuning","venue":null,"work_id":"17b44aec-3833-47e1-8d2e-e1080a403019","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:213edc82dba61fcea2eb5f5a728335941f817c4d79f0b0b93f9f3afbc0e9cc6c","observation_id":"3703360c-de3f-477f-a19a-db1a914ff5e0","resolution":{"observed_at":"2026-05-15T06:30:22.729805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11565","last_updated":"2023-03-17T17:28:04Z","snapshot_observed_at":"2026-08-06T21:10:44.877323Z","submitted_at":"2022-12-22T09:43:36Z","title":"Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2212.11565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.11565","snapshot_observed_at":"2026-07-02T12:16:56.715496Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"71927ab4-2a47-4921-8939-c0fe6715790b","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2212.11565","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:0ac20b4053d406237ba6ae566c7936099fc96bc672b4310d4fd3a12d0af37a1c","observation_id":"e4eabf86-1565-4c35-b383-74844550e4c2","resolution":{"observed_at":"2026-05-15T06:30:22.735873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation","venue":null,"work_id":"839c626c-5433-4e84-a358-11f59a7a1946","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:2320afb04d33a5d352f6bac22260e15da4ee2b4d55fffa647678184d7688e21f","observation_id":"6b5ba0e3-75ec-414d-9f00-f2c22bd3c324","resolution":{"observed_at":"2026-05-15T06:30:22.910163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long video generation with time-agnostic vqgan and time-sensitive transformer","venue":null,"work_id":"832b42b5-463f-4577-883b-959ce0f28262","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:8729116e7f92ce6f136b69198e3a815029075b67289fae6a51d873d876e5fff4","observation_id":"9491e551-bfef-487e-a4b7-907886e0de7c","resolution":{"observed_at":"2026-05-15T06:30:22.877562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":36,"verified_fuzzy":43},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 100 inbound Pith citation observations for arXiv:2307.06942."}