{"as_of":"2026-08-11T10:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b745070c2e11b454c3ff7230adeb9d58839578446cf692eacf72caa36856c059","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:11:43.604791Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:55:47.952638Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:53:16.138644Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05884","snapshot_observed_at":"2026-08-06T21:55:47.952638Z","title":"Text-to-edit: Controllable end-to-end video ad creation via multimodal llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23102","last_updated":"2026-07-06T06:04:13Z","snapshot_observed_at":"2026-08-08T21:05:19.837782Z","submitted_at":"2025-06-29T06:08:55Z","title":"Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:55:47.952638Z"},"links":{"cited_paper":"/paper/2501.05884","citing_paper":"/paper/2506.23102"},"observation_digest":"sha256:6cef97c410a6afaff11a5ec79fda59304fcb24390334e184406f5bbd4d6e35ec","observation_id":"918d5ffd-be6e-4cff-b8e5-889155676255","resolution":{"observed_at":"2026-08-06T21:55:47.952638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"cited_work":{"arxiv_id":"2501.05884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05884","snapshot_observed_at":"2026-06-29T08:53:16.138644Z","title":"Text-to-edit: Controllable end-to-end video ad creation via multimodal llms,","venue":null,"work_id":"a0eeb06e-1e98-4dd4-bf8b-74b85f3fc06f","year":2025},"citing_paper":{"arxiv_id":"2604.15127","last_updated":"2026-04-17T03:24:29Z","snapshot_observed_at":"2026-08-10T22:12:25.767988Z","submitted_at":"2026-04-16T15:13:41Z","title":"MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T09:10:31.245928Z"},"links":{"cited_paper":"/paper/2501.05884","citing_paper":"/paper/2604.15127"},"observation_digest":"sha256:2ba32ae761747320e561253ead705578b368a12b0b4915feb372ad0f1d2b3b5a","observation_id":"3bf8dae2-f173-4cda-a356-df17af850545","resolution":{"observed_at":"2026-05-10T09:13:29.970104Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"cited_work":{"arxiv_id":"2501.05884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05884","snapshot_observed_at":"2026-06-29T08:53:16.138644Z","title":"Text-to-edit: Controllable end-to-end video ad creation via multimodal llms,","venue":null,"work_id":"a0eeb06e-1e98-4dd4-bf8b-74b85f3fc06f","year":2025},"citing_paper":{"arxiv_id":"2605.29509","last_updated":"2026-05-28T07:31:22Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:31:22Z","title":"KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T08:46:56.390567Z"},"links":{"cited_paper":"/paper/2501.05884","citing_paper":"/paper/2605.29509"},"observation_digest":"sha256:bddfb8dfeb8f2c9b5ceeb2276b8d941a64dbd9257bf29e1a7cc6eee712c4b56e","observation_id":"9e84cef2-21f2-4502-9311-cbef42c81319","resolution":{"observed_at":"2026-06-29T08:53:16.140099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.05884/citation-record","integrity":"/paper/2501.05884/integrity","json":"/paper/2501.05884/citation-record.json","paper":"/paper/2501.05884"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T21:11:41.564124Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:41.564124Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:8c49958e65d3b56c941e179e7f512f2b7eab854d41ca8653e7f09940daa25d36","observation_id":"1ef59cbb-19cf-4fa8-8a33-afce7dd858ff","resolution":{"observed_at":"2026-08-10T21:11:41.564124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:50.894908Z","title":"Automatic compo- sition techniques for video production","venue":null,"work_id":"48f22acb-f9ec-4c0d-81b9-fbd8df1471d7","year":1998},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:41.604460Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:113afd7f2a4888ba19c74874c9c8c16271df0f163128aebfd4b26440e1d6acfb","observation_id":"e8d9590f-a5dc-4eb1-b9ab-db618f84aee6","resolution":{"observed_at":"2026-08-10T21:11:50.944837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:41.644751Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:41.644751Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:89e79b72892034e9848bc136b656e9ca32b85d16a39b1cf68889287d8dc02b99","observation_id":"7bafc4f3-2248-4f1c-bf2d-0422e962dbd6","resolution":{"observed_at":"2026-08-10T21:11:41.644751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:50.654756Z","title":"Automatic editing of footage from multi- ple social cameras","venue":null,"work_id":"6a7dbd1a-dc4f-4dbc-8bff-0e1b52d09d4b","year":2014},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:41.685512Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:db20b785c1c167d48d065fd101389e3be47aa1aa4fa41e884dde8c3622d3153f","observation_id":"da08f5a4-d4f5-4e88-a3bb-450529e29c6a","resolution":{"observed_at":"2026-08-10T21:11:50.705147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:50.504463Z","title":"The anatomy of video editing: A dataset and benchmark suite for ai-assisted video editing","venue":null,"work_id":"f3151a7b-74ab-41c8-b7f7-2c9c0bfc3d2e","year":2022},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:41.734983Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:5a40f616d833cd336626ed15302a55569371bda3f115bb5ba3bed65a027bba3a","observation_id":"c599bf2b-25a6-4bb0-8ae0-d1d5527a9d3b","resolution":{"observed_at":"2026-08-10T21:11:50.555100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T21:11:41.784756Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:41.784756Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:e714b2bddd5db421a3c19aad6c58c641c6f1d1b80e938326819839bd3e50cbaa","observation_id":"c255b114-0ebe-4de1-9032-4414eeee0ead","resolution":{"observed_at":"2026-08-10T21:11:41.784756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:41.820830Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:41.820830Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:ec46c235db47650e15c591546fa4398d7a20a72dc1eda0df97355a6cd23e091d","observation_id":"d759664b-1851-4df2-8d40-987f3a4e7c5d","resolution":{"observed_at":"2026-08-10T21:11:41.820830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-10T21:11:41.874830Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:41.874830Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:47312a48070debeddd18c0a82842debcfc67cf081c6e808c46f08bb2739c482f","observation_id":"5f443ae9-1d0c-4250-9b85-1b1b3bf6ce4b","resolution":{"observed_at":"2026-08-10T21:11:41.874830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:50.267381Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"be201bba-f800-458b-ac7a-c30ede0fdf77","year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:41.924754Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:351d505e320f96d8149c65bbea83b1945b9a9c6daf45d43950c579f37b1cd833","observation_id":"089054f9-eded-455b-b4cb-89d509ba8427","resolution":{"observed_at":"2026-08-10T21:11:50.314749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:41.974749Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:41.974749Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:de27caa77c4da9c524f5bfca5c894a9f2bb1a52f7fd7a7cd0a2ef203af75e318","observation_id":"208d3cbf-e6d5-468c-9f20-451b2971b825","resolution":{"observed_at":"2026-08-10T21:11:41.974749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:49.984831Z","title":"A video retrieval and se- quencing system","venue":null,"work_id":"ccfb56d8-54de-4ade-bc06-4ac28fe97b5a","year":1995},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.019886Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:bb44950fff29178566d921d3c14f747df8f423442a42a9e97326d47660529c38","observation_id":"853e0aa9-3949-4a08-8d69-08c27e9260e6","resolution":{"observed_at":"2026-08-10T21:11:50.031370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-10T21:11:42.064391Z","title":"Internlm-xcomposer2: Mastering free-form text- image composition and comprehension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.064391Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:92f963a7c996d8c2758544e72518c168782e5152d61b294e90ca6f5141a657da","observation_id":"06a03372-1428-46c4-b7c5-4d2a7b54d5bb","resolution":{"observed_at":"2026-08-10T21:11:42.064391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:42.118283Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.118283Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:35f8d8dee202fd03783f1c5bc78dbc796b985050140d9589f4a5347e388ae44d","observation_id":"5746b209-7f32-421f-994d-b229879251c0","resolution":{"observed_at":"2026-08-10T21:11:42.118283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10300","last_updated":"2025-02-05T09:57:59Z","snapshot_observed_at":"2026-08-10T13:04:48.734344Z","submitted_at":"2023-12-16T03:17:30Z","title":"Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10300","snapshot_observed_at":"2026-08-10T21:11:42.144841Z","title":"Shot2story20k: A new benchmark for comprehen- sive understanding of multi-shot videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.144841Z"},"links":{"cited_paper":"/paper/2312.10300","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:cd3fd6726dcbd695dfb525e6a10bde6cadd6c594710a9e69cdb34175dcd9b6ec","observation_id":"4c9ee0e4-a239-41b4-8a4d-371a50d25083","resolution":{"observed_at":"2026-08-10T21:11:42.144841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19046","last_updated":"2024-03-27T22:50:48Z","snapshot_observed_at":"2026-07-06T17:52:18.041492Z","submitted_at":"2024-03-27T22:50:48Z","title":"LITA: Language Instructed Temporal-Localization Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19046","snapshot_observed_at":"2026-08-10T21:11:42.184866Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.184866Z"},"links":{"cited_paper":"/paper/2403.19046","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:4b809e579859869de4d0f24da6f6c8bd3c8a881569c1b7dfa6e8c33c79594f74","observation_id":"4a44f93b-4ac3-4fb0-a08d-52468befb4f3","resolution":{"observed_at":"2026-08-10T21:11:42.184866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:49.704760Z","title":"B-script: Transcript-based b- roll video editing with recommendations","venue":null,"work_id":"dac19918-9c0d-4f01-8f7d-c7d216fd4f48","year":2019},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.224757Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:1125f8e9686bb0a1b6ef14e256f279573fc084fa001e7c5eb7aa861de98a307a","observation_id":"7d94592c-7175-4fa4-801d-a5db8850843c","resolution":{"observed_at":"2026-08-10T21:11:49.764759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T21:11:42.266610Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.266610Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:454a072dfe16a2e0c6b798672b38350d5a71768ca7d317a261253c7c732ab5d3","observation_id":"d890f49d-2825-480d-b7c6-70095f624f50","resolution":{"observed_at":"2026-08-10T21:11:42.266610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:49.535375Z","title":"Chunkyedit: Text-first video interview editing via chunking","venue":null,"work_id":"b85374b4-f912-4544-a449-e94a26f3c06c","year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.312566Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:e05e5710f8ee886deeb3ce87b3a41ea6b62fd03aaa1edfe67227f3664559e85b","observation_id":"059148e2-6031-4b0c-bc83-244e0f7e2fcd","resolution":{"observed_at":"2026-08-10T21:11:49.576364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:49.390812Z","title":"Computational video editing for dialogue-driven scenes","venue":null,"work_id":"8d6f53eb-30b9-4d00-8be8-7d01d8ee379f","year":2017},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.335237Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:6d8cc1d0340d3870e6ec9f6ffea1f1a7ea311d9e762eb1d6ac5ba5b282753522","observation_id":"8cd4bcc0-63d0-40eb-bad9-8cac88c9a874","resolution":{"observed_at":"2026-08-10T21:11:49.424839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:49.248422Z","title":"Llava-next: Tack- ling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":"fdcfdc10-11cd-4c2e-9967-a7eecb48b466","year":null},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.375405Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:da44e9b375fb258136b0a2f072c4d2bfd34e4a52653fa2b9fd478b7cfe9609e3","observation_id":"6eeb1c1e-3b03-41d6-9be3-71d31f15a380","resolution":{"observed_at":"2026-08-10T21:11:49.294759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:42.433458Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.433458Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:c5e494d8ccd95fd63bed8243a9c5caad6c2d7dc00bcce0f064468b91b7ea75f8","observation_id":"498b4893-3921-4e28-880d-c47ec4f430be","resolution":{"observed_at":"2026-08-10T21:11:42.433458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-10T21:11:42.474493Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.474493Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:4ea53985684c8ec8dabdf011f2fadf3d18b99cecd0596f6ed53189ff99affddc","observation_id":"1b58b57d-cdaa-47b7-969d-fcfee4a0f4d9","resolution":{"observed_at":"2026-08-10T21:11:42.474493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:42.524855Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.524855Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:61f104954e260328d830e6509e140f8aaa21afde915f46bd841194b58c8ac02e","observation_id":"727e52ea-efb0-4812-98a9-6999c0d20fdc","resolution":{"observed_at":"2026-08-10T21:11:42.524855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:48.844757Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"d623c963-7670-49e8-ae35-025b06321be6","year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.537068Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:9c1a733aeab2250c1d9e7c7f11ce623ed73161f50f9c3920072fea22bab6b34f","observation_id":"b898a39e-13c7-4cec-abab-0f50348c5fa9","resolution":{"observed_at":"2026-08-10T21:11:48.895633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:48.694732Z","title":"Visual instruction tuning","venue":null,"work_id":"ae8138ea-3a91-443c-94ca-fde68fb670d7","year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.541051Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:badb270bdd7dcd5097c490529e910b415c0b4e1ad00eae80ad0a0875fb80b6b8","observation_id":"96de7618-1e4f-4548-9661-cf37a7f3cb4a","resolution":{"observed_at":"2026-08-10T21:11:48.734740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T21:11:42.554764Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.554764Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:e44e025808a9f355c6537c39a59d5153ff3a8fb30613ee9bed75e2970f18d605","observation_id":"15d7e393-627f-4ddb-a0f1-1164b426fc0d","resolution":{"observed_at":"2026-08-10T21:11:42.554764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-10T21:11:42.604754Z","title":"Sgdr: Stochas- tic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.604754Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:70a4ccc7f29fdcc61e432b1dc777871bec60d8594a4ba5eeb7b25498742187f1","observation_id":"d96706d9-c741-4f5f-8162-e5c890f6e44f","resolution":{"observed_at":"2026-08-10T21:11:42.604754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T19:40:57.491981Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-10T21:11:42.647673Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.647673Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:66d9a837e62310401027c4b9f49043f15fdc78e32727a0698b32734540eb6059","observation_id":"8893fbe4-de43-400e-b3e2-bd7511f87085","resolution":{"observed_at":"2026-08-10T21:11:42.647673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-10T21:11:42.674840Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.674840Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:38409f5f52cd30e6ca0ff8a61fc5aee4d3b45f028498c9e3e762ea7fb773eccd","observation_id":"89758d2e-baae-449b-bb4b-b99d2ff77202","resolution":{"observed_at":"2026-08-10T21:11:42.674840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-09T01:53:18.568676Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-10T21:11:42.724755Z","title":"Videogpt+: Integrating image and video en- coders for enhanced video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.724755Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:42147c329bc97fb69edb5832146c8f62eab30c07fbc06132aad2ed6760e78f83","observation_id":"677cd09f-62e4-4d93-86f2-881f51f640b7","resolution":{"observed_at":"2026-08-10T21:11:42.724755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:42.774756Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.774756Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:c24eb73154d9503e73b3b2b210fad5eefabf34059ac15a3b7d60fea09ff78ba6","observation_id":"6c28810d-18a2-40b6-8324-33d8461d93ff","resolution":{"observed_at":"2026-08-10T21:11:42.774756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:42.834757Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.834757Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:ecd4ea7cfffa1878a65a99cc23b16c2443ff9e4ba684a63d209ac963e2b139d4","observation_id":"46364018-9714-48f9-bb8a-28214a1ccd92","resolution":{"observed_at":"2026-08-10T21:11:42.834757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:48.354756Z","title":"Emscore: Evaluating video captioning via coarse-grained and fine-grained embed- ding matching","venue":null,"work_id":"b65424e6-211a-4a6b-97d2-a89c1c97532a","year":2022},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.884757Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:3f26140330375a24a605148ca96d9be42a1a5a71d68ff2688ae129350973dd7b","observation_id":"e64acbcb-4953-4405-8109-4ffaea00db0a","resolution":{"observed_at":"2026-08-10T21:11:48.384744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:42.934760Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.934760Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:24effc36f468a66460f7acceaf2c0b5649c2eec132d645e80a7bbbea7cc27187","observation_id":"6b269b59-b155-4c60-94a6-5c7bfa6043ee","resolution":{"observed_at":"2026-08-10T21:11:42.934760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:48.114755Z","title":"Transnet v2: An effective deep network architecture for fast shot transition detection","venue":null,"work_id":"0da7a32c-ca67-4f9c-9092-bc11a661c5b5","year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:42.984864Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:50685b1555717c110322632e1a085c02512015faa57b0bdb4b0954aa8ac1fc67","observation_id":"0cb35494-cb89-4e33-8cc0-c2d8dee9ebf0","resolution":{"observed_at":"2026-08-10T21:11:48.164757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-10T21:11:43.034832Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.034832Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:2f0c71263bd14926e4c490bfd8daf6bc0493481426f06516865e0871f372892f","observation_id":"3617100a-a5dd-4470-8bd8-4e514af46c5f","resolution":{"observed_at":"2026-08-10T21:11:43.034832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:47.954816Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities, 2023","venue":null,"work_id":"a6975c2e-e68f-43c7-ad99-be19e013b3fd","year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.079982Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:cb2ec1688df7b022d492e6fc4d70c5e8f31a9b526502f06aa498f404485ac9d9","observation_id":"843fe2f6-4de6-4808-9930-896b05c6cfa4","resolution":{"observed_at":"2026-08-10T21:11:48.004750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:47.794828Z","title":"Quickcut: An interactive tool for editing nar- rated video","venue":null,"work_id":"0cab99c8-947e-4379-81bd-c33cd3cc7fcc","year":null},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.124835Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:4d0cac878361d1cd644478abec2b00f16f21771659c8f24afec90a8e26af4907","observation_id":"bd0a5bbe-5dd6-47b6-ade7-a4c6a767b80e","resolution":{"observed_at":"2026-08-10T21:11:47.834754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:43.154751Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.154751Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:a38071c912199b44217cb2bdc512d319f32a514a95cb02bec553b024579a8c0f","observation_id":"7995648b-aca2-4542-98fa-09e1d9eb5c0e","resolution":{"observed_at":"2026-08-10T21:11:43.154751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:47.504749Z","title":"Write-a-video: computational video montage from themed text","venue":null,"work_id":"2b3584c0-5955-42e0-8b23-a8fc3a4a9641","year":2019},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.198033Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:48baa5843886026082fb00558f32cc4cc5d76add9cca7d7386318ee71a790b9d","observation_id":"64cf7ca5-e0cb-4965-8221-1f69004aba3c","resolution":{"observed_at":"2026-08-10T21:11:47.544830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-10T11:36:03.411225Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-10T21:11:43.248927Z","title":"Internvideo2: Scaling video foundation mod- els for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.248927Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:16e41d3c5b3db310b53a7315661d00dcb367e27ccaa62b28272a7cadd4dd0a8c","observation_id":"237f9a83-513c-4f34-8631-9ee49d10f275","resolution":{"observed_at":"2026-08-10T21:11:43.248927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:47.344753Z","title":"Transcript to video: Efficient clip sequencing from texts","venue":null,"work_id":"713833ea-b950-4a33-8e4c-3cc1905a40ba","year":2022},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.274760Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:4919962b1c6b54b13ef80098c73f247537b9d14db0799b9a00a5afe8f4055c51","observation_id":"37b00b6f-ed4b-4f12-a71b-0bd0db4171f7","resolution":{"observed_at":"2026-08-10T21:11:47.394754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T21:11:43.310157Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.310157Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:1602af4a70899f8b8d375849d5f53ae40a81c213362c01cb5e23b0598d4817fa","observation_id":"eed9aaa0-a14e-4ab8-910a-49e95b0dda84","resolution":{"observed_at":"2026-08-10T21:11:43.310157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14040","last_updated":"2024-12-30T09:02:53Z","snapshot_observed_at":"2026-08-07T02:09:13.726828Z","submitted_at":"2024-05-22T22:22:26Z","title":"Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14040","snapshot_observed_at":"2026-08-10T21:11:43.330137Z","title":"Synchronized video storytelling: Generating video narrations with structured sto- ryline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.330137Z"},"links":{"cited_paper":"/paper/2405.14040","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:b11432bbf3fbf57d05a033be189785269daddc8c12beb766cb45457c5b636feb","observation_id":"dee47068-bf73-4a73-9bd7-7a65d99457a6","resolution":{"observed_at":"2026-08-10T21:11:43.330137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T21:11:43.373939Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.373939Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:ae8682c451dccd98eb72159512198f527e4ade36ea8a6ba2735bdfea9bf19694","observation_id":"45a1ae2e-43c5-431f-93d3-48045b7b4696","resolution":{"observed_at":"2026-08-10T21:11:43.373939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:47.194831Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"22d9a585-6bac-4bdc-bbbe-b87e228b84ad","year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.417003Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:3a2df971759e8555e547d0e428eff091d477f3f6985211db3ba2feb048663b44","observation_id":"45bb5982-8e7d-4c9b-a061-3bc67d406622","resolution":{"observed_at":"2026-08-10T21:11:47.234754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-10T21:11:43.461799Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.461799Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:fd6b6150e3ca27913006cba668c5880b085877faa9da28fd7c53a82369c3c7e7","observation_id":"ba32da1a-03e9-47a8-ade7-c1f6c7f396d5","resolution":{"observed_at":"2026-08-10T21:11:43.461799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-10T21:11:43.509358Z","title":"Internlm- xcomposer: A vision-language large model for advanced text-image comprehension and composition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.509358Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:cc51a4e48142aa8e22e38b8adee3974aae5618825ecf57d9351e687cfb3493bd","observation_id":"e4b8ac7c-b76f-4cd1-aaea-ca08e083fe13","resolution":{"observed_at":"2026-08-10T21:11:43.509358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:47.054764Z","title":"Llava- next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":"771911c2-1e40-472f-aa13-35ab0c651bf1","year":2024},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.544792Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:3ab761a22c3ade5dc5dbb51c4cdbe2379ac1239ce2823fe2c00d31ee7230a347","observation_id":"c46444b1-690a-4b9e-b4e8-d731a12a85a8","resolution":{"observed_at":"2026-08-10T21:11:47.094857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T21:11:43.570791Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.570791Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:277996dadffbd0f8833333f5e7adc79bd5a0a08575dcca703420b4d2146f8831","observation_id":"26b32438-c7da-4ca9-99ad-25ce653d2e15","resolution":{"observed_at":"2026-08-10T21:11:43.570791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:11:46.886644Z","title":"voice_over_track","venue":null,"work_id":"022ac54a-5d1c-4243-bc94-f5f93de0c9f6","year":null},"citing_paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:11:43.604791Z"},"links":{"citing_paper":"/paper/2501.05884"},"observation_digest":"sha256:d873710420ce9aaccb5a38a8aead428d7edc69b5b5597207df8f9f093a164f05","observation_id":"96c5407a-953f-4924-8b49-ea07a4cc202f","resolution":{"observed_at":"2026-08-10T21:11:46.934921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.05884","last_updated":"2025-01-10T11:35:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:04:01.467877Z","submitted_at":"2025-01-10T11:35:43Z","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 3 inbound Pith citation observations for arXiv:2501.05884."}