{"as_of":"2026-08-22T04:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ba837fba71b28ccf6d214ce8cb0e8b165547698efc6e2eafa696831b14dfd43","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:49:50.259288Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:08:56.520608Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:29:44.530433Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-08-04T06:47:09.213780Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-17T20:56:12.941886Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:09.213780Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:fdcc4e8c6d6df70ae2f0cae94b04ec25313a02cd33ef80526436a968a80d4c0d","observation_id":"5b95dbdd-b7d7-40cd-8b07-15eb457e9171","resolution":{"observed_at":"2026-08-04T06:47:09.213780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-15T23:00:07.168571Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:4fd1f7730be678c2a1ccc0cf501c020de28104230de6cc623f9a0f4f8685358c","observation_id":"aa5d514e-1975-4f61-8e4c-313360402fc6","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2602.12370","last_updated":"2026-04-16T20:43:03Z","snapshot_observed_at":"2026-08-14T11:55:14.305551Z","submitted_at":"2026-02-12T20:02:21Z","title":"LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T05:01:11.880003Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2602.12370"},"observation_digest":"sha256:21ee0e12465901a48339ff0a0e4b0b261902fda147040061d15e1c5ed0c38110","observation_id":"5b021933-8d1e-435d-9505-8fe570e0155a","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-13T22:08:47.493022Z","title":"Univideo: Unified understanding, generation, and editing for videos.arXiv preprint arXiv:2510.08377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.19226","last_updated":"2026-07-02T17:59:52Z","snapshot_observed_at":"2026-08-19T06:13:11.826254Z","submitted_at":"2026-03-19T17:59:45Z","title":"Under One Sun: Multi-Object Generative Perception of Materials and Illumination","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T22:08:47.493022Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2603.19226"},"observation_digest":"sha256:3c21b4a7135787b8ba3e209f48f171208867e4304ca5d744ee67f9c5f005c199","observation_id":"6f86792b-2400-422e-adda-9970a75c8ed7","resolution":{"observed_at":"2026-07-13T22:08:47.493022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2604.05898","last_updated":"2026-04-07T14:02:53Z","snapshot_observed_at":"2026-08-14T17:24:46.631419Z","submitted_at":"2026-04-07T14:02:53Z","title":"Physics-Aware Video Instance Removal Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:33.716719Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2604.05898"},"observation_digest":"sha256:5e376287d4246f32888f06a4728679cd9a494f4fde71b664cef34cb6656e67b8","observation_id":"3efc82ee-462b-4a27-9657-cc0fc8864b4a","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2604.07958","last_updated":"2026-04-23T12:58:42Z","snapshot_observed_at":"2026-08-11T08:20:50.957496Z","submitted_at":"2026-04-09T08:22:09Z","title":"ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:33.822264Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2604.07958"},"observation_digest":"sha256:259b3dde6e97fb314f5ea5b52785981e7c24bd2e3f760c0415fc2974d4df6ddb","observation_id":"4bc9f2fb-742e-4e37-b893-0f5b9d27a9de","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2604.08646","last_updated":"2026-04-09T17:59:02Z","snapshot_observed_at":"2026-08-12T20:44:49.937459Z","submitted_at":"2026-04-09T17:59:02Z","title":"InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T17:39:59.791758Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2604.08646"},"observation_digest":"sha256:f513173b12e78a942313efc58e0403ed5d0e951dbbf771bcca0ae62045df9eff","observation_id":"e9852fea-77fb-450e-b677-8fe93699ea63","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2604.14556","last_updated":"2026-08-08T03:32:53Z","snapshot_observed_at":"2026-08-15T10:58:25.094741Z","submitted_at":"2026-04-16T02:39:15Z","title":"Controllable Video Object Insertion via Multi-View Priors","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T11:44:17.033051Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2604.14556"},"observation_digest":"sha256:72aa9660a8143f5f640bbea2f03dbc56948abb2b9580f501a9bc52dade294dc1","observation_id":"bb785f1a-bfac-4540-9be7-897b51354570","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2604.16272","last_updated":"2026-04-20T15:50:04Z","snapshot_observed_at":"2026-08-14T01:26:45.409974Z","submitted_at":"2026-04-17T17:28:24Z","title":"VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T08:24:41.925800Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2604.16272"},"observation_digest":"sha256:a2d41aa65b47e5d7a1c46a6bfabec2030488f51cb139fe46078270b99972ba90","observation_id":"e2699323-abc0-4aa2-9de6-774b28e2d6e7","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-11T08:26:21.610628Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:0a1bebc75397ca17d7d8fcbcbc5c349f617e83c45870f9b2a73b0bef204ed1dd","observation_id":"f9122528-1e0e-48b7-b0d4-4eca101c9181","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-08-17T08:54:22.251874Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T04:31:26.325118Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:d0269323cf35bc444670f565a1d553eeec083165f5f4eb9e6899c74afd8f02f0","observation_id":"89729954-58f5-41a2-b937-434747ac3461","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-08-17T08:54:22.251874Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:7f7849b583e6b7305297055f4aa06553c24aac9567f2381cc4357f84d89b3ffb","observation_id":"334ecb48-2067-4346-91be-f1a6d78d489f","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.02641","last_updated":"2026-05-04T14:26:33Z","snapshot_observed_at":"2026-08-17T14:05:51.842327Z","submitted_at":"2026-05-04T14:26:33Z","title":"Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T18:26:58.696936Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.02641"},"observation_digest":"sha256:8910d24f421439a8c3373bbb1d6bfd625a2ee7dfbb69790faa2c0966e65c1a4b","observation_id":"384b0a38-4bef-4938-b650-a1f5be80ec0c","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-08-11T12:54:21.420559Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:be668ae8f8a7baaae6b79006b67089aedd9101b609740bd1efdb9cc5281b36d5","observation_id":"8b34f157-24f5-4478-a288-0f55552c113f","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.06535","last_updated":"2026-05-07T16:35:34Z","snapshot_observed_at":"2026-08-11T02:23:49.380990Z","submitted_at":"2026-05-07T16:35:34Z","title":"Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled Guidance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T12:34:34.315135Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.06535"},"observation_digest":"sha256:edd84f556f215316810214986950b0b8ac7f391787aa22a9aa51fc71598844da","observation_id":"71384b89-cd41-4808-8cb9-2dbaa7f9deb8","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":1},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-05-20T11:46:52.658984Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:a0f7b119f1f3e4c714aff27c030131fea3f76acc2571b6f6a833a4e8ec2c7b54","observation_id":"af13ddc4-6e8b-4a57-8904-a94ce9bbae4b","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-05-21T07:56:34.034047Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.18678"},"observation_digest":"sha256:0a2af6e622d22cc6de6a56293404b76543fb65b193e38234f0dae156422a5bfa","observation_id":"f0a9f1bd-47a0-4652-9d7d-90ddbe70b3be","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.18748","last_updated":"2026-05-18T17:59:03Z","snapshot_observed_at":"2026-08-15T15:10:36.944264Z","submitted_at":"2026-05-18T17:59:03Z","title":"Aurora: Unified Video Editing with a Tool-Using Agent","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T10:47:05.038308Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.18748"},"observation_digest":"sha256:1a5bce452cd7445e28f85461f420520a9c681a8195126a102c23eb4df8679322","observation_id":"df27bdd1-8ddb-4d15-951a-846dd2d2b781","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.20795","last_updated":"2026-06-10T03:18:28Z","snapshot_observed_at":"2026-08-16T07:57:09.555027Z","submitted_at":"2026-05-20T06:42:15Z","title":"What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T05:38:29.361039Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.20795"},"observation_digest":"sha256:19cd23f4d2a5cd2a2cd4ca699ec82eb86b555deb33e3958eeabeb56986bd2a31","observation_id":"24ee577e-95a1-4ce1-b1b3-10ef721208b6","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.20795","last_updated":"2026-06-10T03:18:28Z","snapshot_observed_at":"2026-08-16T07:57:09.555027Z","submitted_at":"2026-05-20T06:42:15Z","title":"What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T17:25:59.714252Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.20795"},"observation_digest":"sha256:9a1351f845952a41d507ff7120b0ef29234e9acea48ce794ac8f6fb4f72bcdb9","observation_id":"8220ccec-a832-42d0-b2ed-492ddddc7d86","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-08-16T15:52:17.416464Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-22T06:39:47.124605Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.22344"},"observation_digest":"sha256:be7a5fa3dffdb6191f5d4f706d1746c759e0eec8645d054bfd5c91bba6c6a4e1","observation_id":"31d6847a-ac4d-4a11-8254-548505d81543","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.22818","last_updated":"2026-05-21T17:59:36Z","snapshot_observed_at":"2026-08-16T20:12:11.401697Z","submitted_at":"2026-05-21T17:59:36Z","title":"MotiMotion: Motion-Controlled Video Generation with Visual Reasoning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-22T05:51:17.890788Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.22818"},"observation_digest":"sha256:065a0838fc04ea4c80aaf06574cdf13d51fab5a212fef8a0dd1e71ab8e978c1a","observation_id":"63d551c3-d4ae-49b3-a8ea-6d4d86cd5da0","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.23891","last_updated":"2026-05-22T17:54:54Z","snapshot_observed_at":"2026-08-19T07:11:10.348960Z","submitted_at":"2026-05-22T17:54:54Z","title":"Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T04:30:20.593882Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.23891"},"observation_digest":"sha256:2dd784aa9bdf998a2b4260c5f5fa9bcf6bad9301eb480cdd47211a9ccd9da5d1","observation_id":"66a067ea-f1a5-4b27-9f52-812908c993ee","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.31603","last_updated":"2026-05-29T17:59:50Z","snapshot_observed_at":"2026-08-12T21:07:03.038294Z","submitted_at":"2026-05-29T17:59:50Z","title":"Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T22:56:21.783415Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.31603"},"observation_digest":"sha256:90e74d0ac5b4f38c5da63a1ada0faad61c9cd95d03fa1bb05ffa577e76ad6d7e","observation_id":"c19fe86d-b4ad-4bc7-97d4-a6e86dc794dd","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2606.01362","last_updated":"2026-05-31T17:33:14Z","snapshot_observed_at":"2026-08-02T17:53:31.376798Z","submitted_at":"2026-05-31T17:33:14Z","title":"AlbedoEdit: Unified Instance-Level Video Editing with Albedo Guidance","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T15:55:23.583463Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2606.01362"},"observation_digest":"sha256:32807946c30b64e2eb4f131dcc6e6dac019786e2a65091b4ef5ffaf7d7b9ccde","observation_id":"7645f489-9dd0-4229-9cf7-9e4552c6986b","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2606.23254","last_updated":"2026-06-22T12:37:15Z","snapshot_observed_at":"2026-08-17T09:02:38.241428Z","submitted_at":"2026-06-22T12:37:15Z","title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T08:52:23.330736Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2606.23254"},"observation_digest":"sha256:094343a347e26a45cc245e13882825572cf00ddda280cab719100b6dfca7befc","observation_id":"6a1d2a9e-063f-4382-b861-e68e9b452ec6","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2606.31326","last_updated":"2026-06-30T08:29:29Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:29:29Z","title":"Bridging Video Understanding and Generation in a Unified Framework","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-01T05:57:54.653504Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2606.31326"},"observation_digest":"sha256:049a8db1c6df649744c55a11824163caaf2fd69eb67e54e8c1e78137d3025e90","observation_id":"30e503cf-3bfd-4b26-b6bb-7617b919afa7","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-08-02T01:27:23.605545Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14681","last_updated":"2026-07-16T07:43:27Z","snapshot_observed_at":"2026-08-10T00:05:33.584146Z","submitted_at":"2026-07-16T07:43:27Z","title":"ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:23.605545Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2607.14681"},"observation_digest":"sha256:5ce8dd441a114cc38f9949ed5bf8da57970e18efe5ca77d81f532974043654a1","observation_id":"d34f55a7-8b24-4822-8baf-0564b94102cd","resolution":{"observed_at":"2026-08-02T01:27:23.605545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-08-01T21:07:27.750672Z","title":"Univideo: Unified understanding, generation, and editing for videos, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16401","last_updated":"2026-07-17T18:00:05Z","snapshot_observed_at":"2026-08-15T18:24:27.929632Z","submitted_at":"2026-07-17T18:00:05Z","title":"Apple-$\\pi$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T21:07:27.750672Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2607.16401"},"observation_digest":"sha256:fd74f6ecd4f351390e847b6481eb336e40a037efcce1d570a8faf2d793642a1c","observation_id":"25bf3166-fb60-4963-99e1-95f6468e73dd","resolution":{"observed_at":"2026-08-01T21:07:27.750672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-30T21:29:22.037630Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23472","last_updated":"2026-07-26T05:55:49Z","snapshot_observed_at":"2026-08-20T07:49:15.490861Z","submitted_at":"2026-07-26T05:55:49Z","title":"VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-30T21:29:22.037630Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2607.23472"},"observation_digest":"sha256:3412851696c367e8241d92cbe3c9dea8114740add07bc6b8d0cd55c9a3708196","observation_id":"0efbaabf-c1b7-4f11-ac4b-db74755c689b","resolution":{"observed_at":"2026-07-30T21:29:22.037630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-08-03T03:17:58.854818Z","title":"arXiv preprint arXiv:2510.08377 (2025) 2 20 Songchun Zhang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29627","last_updated":"2026-07-31T16:59:46Z","snapshot_observed_at":"2026-08-14T21:03:43.319489Z","submitted_at":"2026-07-31T16:59:46Z","title":"FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T03:17:58.854818Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2607.29627"},"observation_digest":"sha256:f4c957e571926f23358e356cf6cf5cfab17b152abd6b775e83984ae9f34f55c6","observation_id":"2051de52-566c-451f-a9b9-cd78f1a01fc2","resolution":{"observed_at":"2026-08-03T03:17:58.854818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-08-05T04:52:48.552579Z","title":"Univideo: Unified understanding, generation, and editing for videos.arXiv preprint arXiv:2510.08377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03974","last_updated":"2026-08-04T17:40:48Z","snapshot_observed_at":"2026-08-20T17:52:18.296054Z","submitted_at":"2026-08-04T17:40:48Z","title":"JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T04:52:48.552579Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2608.03974"},"observation_digest":"sha256:0a50034c0b1d7f5b92abbe902d715ee5391932851eeddd7e2a034e523a0f84b4","observation_id":"712e81ca-a89f-4179-ab3c-039df3dce6cf","resolution":{"observed_at":"2026-08-05T04:52:48.552579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-08-06T11:55:28.155399Z","title":"Univideo: Unified understanding, generation, and editing for videos.arXiv preprint arXiv:2510.08377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.155399Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:fcb28c1679db919ad0666d5d315d8411333e30364355865080a34e22d5c6b18a","observation_id":"21b72b64-7767-4efb-8901-05e75f21e5a1","resolution":{"observed_at":"2026-08-06T11:55:28.155399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-08-08T17:08:56.520608Z","title":"Univideo: Unified understanding, generation, and editing for videos.arXiv preprint arXiv:2510.08377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-09T23:12:27.682802Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-08-08T17:08:56.520608Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:15f51668c37ea4fa0775004809a688709224beee2469a984b3287586de4e8d07","observation_id":"8113f314-ad63-4368-9e81-7c10a5e28a52","resolution":{"observed_at":"2026-08-08T17:08:56.520608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-08-06T10:34:42.397646Z","title":"Univideo: Unified understanding, generation, and editing for videos.arXiv preprint arXiv:2510.08377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05049","last_updated":"2026-08-05T16:58:48Z","snapshot_observed_at":"2026-08-16T16:56:57.792143Z","submitted_at":"2026-08-05T16:58:48Z","title":"OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:34:42.397646Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2608.05049"},"observation_digest":"sha256:c19f39caae5b26fdf01708843429efa718a2c10f6e630b662fa6485aa975aaa4","observation_id":"10f85d00-c887-4d7d-b835-3a774a43a6de","resolution":{"observed_at":"2026-08-06T10:34:42.397646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-08-08T12:16:44.816528Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05485","last_updated":"2026-08-06T00:28:38Z","snapshot_observed_at":"2026-08-19T17:53:06.511050Z","submitted_at":"2026-08-06T00:28:38Z","title":"VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T12:16:44.816528Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2608.05485"},"observation_digest":"sha256:60899ff9b4a9756b301cdfeb1630613d4d25421b9022cb3380966b167c3e992c","observation_id":"792a3c7b-e677-477f-9104-59b7fa1676d2","resolution":{"observed_at":"2026-08-08T12:16:44.816528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.08377/citation-record","integrity":"/paper/2510.08377/integrity","json":"/paper/2510.08377/citation-record.json","paper":"/paper/2510.08377"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T10:49:47.214037Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:47.214037Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:bff8e96cb7208d767208bccba7a5c10dcd65efa0439c9a0f77ee2962629d8f47","observation_id":"73f4a28d-5da8-46e6-90dc-209baa4763cc","resolution":{"observed_at":"2026-08-04T10:49:47.214037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-20T05:11:46.926766Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-04T10:49:47.633545Z","title":"Dreamllm: Synergistic multimodal comprehension and creation.arXiv preprint arXiv:2309.11499,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:47.633545Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:05a8dce528f22366221ef2f3ecc9f2162d375ffc268ccc57737695652e6d3d87","observation_id":"291f494f-cd31-4f1c-af3a-e10e1a0ffbf9","resolution":{"observed_at":"2026-08-04T10:49:47.633545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-04T10:49:47.713548Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:47.713548Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:839464849b088ab6ee838ddcfaac22b134cbc2151a7920fe0cb7b1b7e1c8dee2","observation_id":"f2594ed8-bc9d-4eef-85ea-42ed4a43db50","resolution":{"observed_at":"2026-08-04T10:49:47.713548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11931","last_updated":"2022-03-22T17:58:31Z","snapshot_observed_at":"2026-08-16T17:12:35.214699Z","submitted_at":"2022-03-22T17:58:31Z","title":"MetaMorph: Learning Universal Controllers with Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11931","snapshot_observed_at":"2026-08-04T10:49:47.817748Z","title":"Metamorph: Learning universal controllers with transformers.arXiv preprint arXiv:2203.11931,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:47.817748Z"},"links":{"cited_paper":"/paper/2203.11931","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:c77e24ddedd44d95109771422a0191b6c0b7d06c92c8e049896dc36de931db15","observation_id":"8fb516ce-e28f-4d8c-9908-fd9be1e60df7","resolution":{"observed_at":"2026-08-04T10:49:47.817748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-10T21:24:08.597398Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-08-04T10:49:47.891881Z","title":"Conceptmaster: Multi-concept video customization on diffusion transformer models without test-time tuning.arXiv preprint arXiv:2501.04698,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:47.891881Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:9a99e1c62406b77030231c6262be8624f98e3faea5fc5983d4a88e2a41f4a1bb","observation_id":"72a86b75-9ad0-468f-9b00-5473d56c1d02","resolution":{"observed_at":"2026-08-04T10:49:47.891881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-04T10:49:47.960559Z","title":"Vace: All-in-one video creation and editing.arXiv preprint arXiv:2503.07598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:47.960559Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:7738d2e19bada81fccae372e6e7685f7350e7878abd6193daf723ac5e7a5aa78","observation_id":"1bb0791c-c04b-43ee-a89f-c91a7479c3a2","resolution":{"observed_at":"2026-08-04T10:49:47.960559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19907","last_updated":"2025-03-25T17:59:06Z","snapshot_observed_at":"2026-08-17T07:40:15.098041Z","submitted_at":"2025-03-25T17:59:06Z","title":"FullDiT: Multi-Task Video Generative Foundation Model with Full Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19907","snapshot_observed_at":"2026-08-04T10:49:48.042362Z","title":"Fulldit: Multi-task video generative foundation model with full attention.arXiv preprint arXiv:2503.19907,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.042362Z"},"links":{"cited_paper":"/paper/2503.19907","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:53abbb1f09fb12d402bd5d7653d96cce94f3f1925f4021f80f6cab1b0e96f6ae","observation_id":"43531f67-cbdb-47f5-8b93-7649a5243a81","resolution":{"observed_at":"2026-08-04T10:49:48.042362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T10:49:48.115320Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.115320Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:c93d09aba02bbc1e926c02362c9d5fee6127986854fa2fd3e3b33e6e94bb6108","observation_id":"cbe1dc13-452b-4167-b290-dd39e60f4179","resolution":{"observed_at":"2026-08-04T10:49:48.115320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-08-20T10:54:54.725127Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-08-04T10:49:48.197996Z","title":"Anyv2v: A tuning-free frame- work for any video-to-video editing tasks.arXiv preprint arXiv:2403.14468,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.197996Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:b3017a3af378da0ecdf0a90dba872871ed6486083484dcadb8ef7128d9c50efb","observation_id":"f1cd6c3b-2e50-46d2-969e-99bfb4bbf384","resolution":{"observed_at":"2026-08-04T10:49:48.197996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-14T01:48:52.921086Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-04T10:49:48.293926Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.293926Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:a032d018c3db009f99bc6bbdcde6771b426021392237769d18d08aa0212346a6","observation_id":"5c5c57b3-eb6b-4eea-930f-77781188d7e9","resolution":{"observed_at":"2026-08-04T10:49:48.293926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-12T22:02:52.918587Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05472","snapshot_observed_at":"2026-08-04T10:49:48.370382Z","title":"Mogao: An omni foundation model for interleaved multi-modal generation.arXiv preprint arXiv:2505.05472,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.370382Z"},"links":{"cited_paper":"/paper/2505.05472","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:832da025166da7c205b9e8de8b02d9a2429bea91e6ba59934c8435dd16a2123a","observation_id":"e33603d9-f1d7-4fba-99cd-1d3502c90ba1","resolution":{"observed_at":"2026-08-04T10:49:48.370382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14749","last_updated":"2023-08-28T17:56:22Z","snapshot_observed_at":"2026-08-16T15:05:10.876982Z","submitted_at":"2023-08-28T17:56:22Z","title":"MagicEdit: High-Fidelity and Temporally Coherent Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14749","snapshot_observed_at":"2026-08-04T10:49:48.433935Z","title":"Magicedit: High- fidelity and temporally coherent video editing.arXiv preprint arXiv:2308.14749,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.433935Z"},"links":{"cited_paper":"/paper/2308.14749","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:fe906a9aef1c462e9d6ea405f50d67da35eef3c898c8e12c630453d67c318a44","observation_id":"22f64a6c-48c4-457a-96a0-ed4b53d86ad2","resolution":{"observed_at":"2026-08-04T10:49:48.433935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-04T10:49:48.516988Z","title":"Uniworld: High-resolution semantic encoders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.516988Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:cfee5b52a46e08745913d92cbd7cc0a74da5a428be51d4b61acb6458f2d9ae19","observation_id":"0361f6c6-13a6-45b9-be31-c9d621a5fcdb","resolution":{"observed_at":"2026-08-04T10:49:48.516988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-16T12:58:02.352853Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-04T10:49:48.589583Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.589583Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:91a65f84e77b86e2cebd0556fc89bcddc2fe7b057d552b760e30d1f406bf1e0f","observation_id":"91ed0832-9ef6-4f2a-a878-5ce4e3355301","resolution":{"observed_at":"2026-08-04T10:49:48.589583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-04T10:49:48.658757Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model.arXiv preprint arXiv:2502.10248, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.658757Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:be40bdec5a80046133fe1c917fd103276bad5d6d37c56deb918c07a3f2a7ceba","observation_id":"8a4bf5bb-9ddc-4ecb-9c1e-0b0b518987e1","resolution":{"observed_at":"2026-08-04T10:49:48.658757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-21T17:21:24.620300Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-04T10:49:48.716774Z","title":"Transfer between modalities with metaqueries.arXiv preprint arXiv:2504.06256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.716774Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:381cd0452bc5616c0e17e1824f38dd4bc14303c4e157dab1324dda8e5cf73969","observation_id":"8dd57aff-87dc-49d6-8422-088ada56070b","resolution":{"observed_at":"2026-08-04T10:49:48.716774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-04T10:49:48.799944Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.799944Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:1f2fca7773957db382bf0be72923215e6ea1691e69fd349ff12530adda574f26","observation_id":"224b0d5e-a92d-4b5c-ae89-95ef1590bc8b","resolution":{"observed_at":"2026-08-04T10:49:48.799944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-04T10:49:48.898580Z","title":"Movie gen: A cast of media founda- tion models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.898580Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:d5bfedc8ba6f6b252ac8185ade1cc11eac8caf6b1af8e9dcde8ec11a7d05cb7b","observation_id":"6f57bb97-5184-4f30-b402-53c3a92da22a","resolution":{"observed_at":"2026-08-04T10:49:48.898580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-21T23:00:31.074030Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-04T10:49:49.019944Z","title":"Lmfusion: Adapting pretrained language models for multimodal generation.arXiv preprint arXiv:2412.15188, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.019944Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:d7367bd1e680c0517d318690ad4bdfc618ec0fae0dedaea8b609d566f1208e18","observation_id":"ef364fbd-f8fd-4b0c-bf37-103f5d74a52b","resolution":{"observed_at":"2026-08-04T10:49:49.019944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15098","last_updated":"2025-07-07T17:33:23Z","snapshot_observed_at":"2026-08-12T17:19:10.028618Z","submitted_at":"2024-11-22T17:55:15Z","title":"OminiControl: Minimal and Universal Control for Diffusion Transformer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15098","snapshot_observed_at":"2026-08-04T10:49:49.107557Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.107557Z"},"links":{"cited_paper":"/paper/2411.15098","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:79c674d2a7fd7bf2c3971bf4b0a7c9c0dfb0c9bfe6ca4f1c2552701dfe5b66f3","observation_id":"87f1b4b7-2b07-45c9-9548-2fccc12e8e81","resolution":{"observed_at":"2026-08-04T10:49:49.107557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:49:49.208736Z","title":"Omni-video: Democ- ratizing unified video understanding and generation.arXiv preprint arXiv:2507.06119,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.208736Z"},"links":{"citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:9bc7f1aeda41bb8e16b8dec53714c65ab28c7adacc67e1be7c53d35db4a970be","observation_id":"c385d80f-a4ea-44aa-a241-00729ebadf3d","resolution":{"observed_at":"2026-08-04T10:49:49.208736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-04T10:49:49.292341Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.292341Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:a4045be7eebae0600e7207ee86d77a89114a395179684e8d9fe856a0fbd619f1","observation_id":"68e86199-c3d0-4dec-afdc-12e88f8d9689","resolution":{"observed_at":"2026-08-04T10:49:49.292341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-04T10:49:49.376070Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.376070Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:b8c352fd02503a3c06d2c6ff4f8f1d4236e7e65046da513bb4dcd5db5d1834c9","observation_id":"2b00b1bd-ecf1-4dbd-8086-f5a51e1eb447","resolution":{"observed_at":"2026-08-04T10:49:49.376070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-04T10:49:49.471148Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.471148Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:43fb98add9b41ca3205530c7428340d1478a81ae6e2270d94ca2a467a6d3d9c9","observation_id":"8e50bb36-f926-4665-9017-123eaa9d181f","resolution":{"observed_at":"2026-08-04T10:49:49.471148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T10:49:49.533691Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.533691Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:92b17c6c092e11963a7e99524e744ccc6fa86b529601d5664a2f02ce9f969e37","observation_id":"e19da07c-ce57-492d-ade3-cdc033495cb4","resolution":{"observed_at":"2026-08-04T10:49:49.533691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-04T10:49:49.621745Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.621745Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:93aaebe08d79b804aace1c315886c86e970a3645984a2e6bc2e8b6a8449b12c6","observation_id":"f9e00c27-378d-45e7-b361-a3fddda9c664","resolution":{"observed_at":"2026-08-04T10:49:49.621745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-04T10:49:49.687091Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.687091Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:f0e08b17fa194d89359f04f415b41d96bbb542e26d28935b9e81a2cf96fb430e","observation_id":"d5e5cbc3-690f-4ec3-a6df-8f03e30e3d25","resolution":{"observed_at":"2026-08-04T10:49:49.687091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-08-20T01:41:57.728123Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-04T10:49:49.772549Z","title":"Show-o2: Improved native unified multimodal models.arXiv preprint arXiv:2506.15564,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.772549Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:e7b35126798dc271410f1ef325561577210b8afb13a93ec8272826918e35a6e8","observation_id":"3636b190-470a-4ac6-a97b-fc1713b41f8d","resolution":{"observed_at":"2026-08-04T10:49:49.772549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-04T10:49:49.864956Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.864956Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:5cfa7483f87cf793458ae181f463e1fdb4e791b89a7df5a8068b6bca165e475c","observation_id":"04ae6fef-ce96-4ed5-af21-10ba586ce2df","resolution":{"observed_at":"2026-08-04T10:49:49.864956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-08-17T20:13:42.723617Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-08-04T10:49:49.960605Z","title":"Imgedit: A unified image editing dataset and benchmark.arXiv preprint arXiv:2505.20275, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:49.960605Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:1cf04668dc10f604201d0a5931d4235f5ddb5aacdb772e18cd94b97d50e1885c","observation_id":"e81c6731-857f-4f5e-a24b-85227af32ce8","resolution":{"observed_at":"2026-08-04T10:49:49.960605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-19T12:50:53.888784Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-04T10:49:50.038738Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:50.038738Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:9ef3069a8e50784e634a6202f072dc5e735f60da3b70797e004c9406ba5dd8ca","observation_id":"8b1fcd1d-cedf-4410-a845-cbedbab1ccf7","resolution":{"observed_at":"2026-08-04T10:49:50.038738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:49:50.096466Z","title":"While we do not observe task confusion, it sometimes fails to strictly follow editing instructions, occasionally over-editing unre- lated regions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:50.096466Z"},"links":{"citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:49e912889493c42d244227758d8ca95974d87a5af135697c119cdc98047c26bc","observation_id":"7da4950e-ded6-4e99-96ca-c6a2a9f1d7f7","resolution":{"observed_at":"2026-08-04T10:49:50.096466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:49:50.166756Z","title":"We also source open source data such as OmniEdit(Wei et al., 18 Table 8: Model capabilities across understanding, generation, editing, and in-context generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:50.166756Z"},"links":{"citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:0cf876363fbfe849dafc5835803620ed523a178ec48d7b4b1d0fb95c3ad33809","observation_id":"27333d34-02c2-48aa-bf54-a360629ce48a","resolution":{"observed_at":"2026-08-04T10:49:50.166756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:49:50.259288Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:50.259288Z"},"links":{"citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:6d7513c1afb3fde89e9143232a83b9a2e1a73c21f00830c720b37490c8da5b3c","observation_id":"bef9cec9-32b9-4f93-ae64-ad6939331c77","resolution":{"observed_at":"2026-08-04T10:49:50.259288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-04T10:49:48.965766Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.965766Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:c5bafc41fb9592ddfe1d948da48eec98bab9ca0f7294f84dcdddf540d8994bf7","observation_id":"cd706d27-0f10-46e7-a2ff-ee8f5b103b7a","resolution":{"observed_at":"2026-08-04T10:49:48.965766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-04T10:49:47.484727Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:47.484727Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:e2aa3052bd719fdd4f728ce38b0df553b1f0f3adf8111306f89a158a929fce4e","observation_id":"7622feaa-cad1-4b97-ad46-ebacadcfb9db","resolution":{"observed_at":"2026-08-04T10:49:47.484727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-19T21:14:32.076838Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-04T10:49:47.409544Z","title":"Videocrafter1: Open diffusion models for high- quality video generation.arXiv preprint arXiv:2310.19512,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:47.409544Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:2948a3566ca31aa902854f9dfb5c28336924a58496edb747523c1567a80fcebf","observation_id":"602babb6-035c-45da-8804-32abc1170651","resolution":{"observed_at":"2026-08-04T10:49:47.409544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-04T10:49:47.297010Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:47.297010Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:2cc0c7d230fd78e0eea872dd003399d30abf7885d2f67a4fc9ff989a9c657ab1","observation_id":"ad60875f-2bd0-459c-bbc6-78c5792f2242","resolution":{"observed_at":"2026-08-04T10:49:47.297010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T02:28:31.550595Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 36 inbound Pith citation observations for arXiv:2510.08377."}