{"as_of":"2026-08-07T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5771b131c950523683c2d7bc029d778ae4dbe83b48b5e59fcc634873e7bf13b","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:12.568377Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:01:36.599895Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:26:17.493582Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":"2506.18851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-07-01T22:26:17.493582Z","title":"Phantom-data: Towards a general subject-consistent video generation dataset","venue":null,"work_id":"1cac764a-1a21-4f0f-9064-4bbb73ddb529","year":2025},"citing_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T17:51:41.947939Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2504.17816"},"observation_digest":"sha256:938634162eb2129e776fb4e0a5f462433d8e22982969559ab0ce7626e36b0a20","observation_id":"d7942705-b27f-4f09-890e-891109501909","resolution":{"observed_at":"2026-05-22T17:51:54.300099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-08-05T05:01:36.599895Z","title":"Phantom-Data: Towards a General Subject-Consistent Video Generation Dataset.ArXiv, 2506.18851, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-07T16:55:54.177655Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.599895Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:ee5129b78c943a5c2fde526b895bb456239f0d9ce912314b5befb7fb78e9410d","observation_id":"a1f20d76-310a-4586-a321-85045de90fa4","resolution":{"observed_at":"2026-08-05T05:01:36.599895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-07-13T12:23:05.876881Z","title":"Phantom-data: Towards a general subject-consistent video generation dataset.arXiv preprint arXiv:2506.18851, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03738","last_updated":"2026-04-04T13:50:38Z","snapshot_observed_at":"2026-08-06T04:04:52.686841Z","submitted_at":"2026-04-04T13:50:38Z","title":"Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T12:23:05.876881Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2604.03738"},"observation_digest":"sha256:8632a3b7f2e69e35872faca0bc5baf2f5e5f69c92d5c62ed6cc5fc0607dd2d97","observation_id":"f8a3e20d-7692-4182-9507-4d1993b7f947","resolution":{"observed_at":"2026-07-13T12:23:05.876881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":"2506.18851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-07-01T22:26:17.493582Z","title":"Phantom-data: Towards a general subject-consistent video generation dataset","venue":null,"work_id":"1cac764a-1a21-4f0f-9064-4bbb73ddb529","year":2025},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-04T04:39:45.061732Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:d539ed169ec9f21083c3940ed8f4b682a645800efe02bf6bc4f2470d6e43be63","observation_id":"8fe950cd-cffc-4b16-a4ea-2cea998ba90f","resolution":{"observed_at":"2026-05-20T14:13:21.413127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":"2506.18851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-07-01T22:26:17.493582Z","title":"Phantom-data: Towards a general subject-consistent video generation dataset","venue":null,"work_id":"1cac764a-1a21-4f0f-9064-4bbb73ddb529","year":2025},"citing_paper":{"arxiv_id":"2606.02441","last_updated":"2026-06-01T16:12:18Z","snapshot_observed_at":"2026-08-02T19:01:32.149297Z","submitted_at":"2026-06-01T16:12:18Z","title":"Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:25:22.778550Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2606.02441"},"observation_digest":"sha256:7ed813712bfcef6bc137fcc37ff97a096ad0f7f1517e5155b13cf6fe20738778","observation_id":"6f242034-23f8-49cc-aae1-3121792460bf","resolution":{"observed_at":"2026-07-01T22:26:17.495216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18851","snapshot_observed_at":"2026-08-01T15:42:03.214892Z","title":"Phantom-data: Towards a general subject-consistent video generation dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18227","last_updated":"2026-07-20T17:58:03Z","snapshot_observed_at":"2026-08-06T02:11:59.758594Z","submitted_at":"2026-07-20T17:58:03Z","title":"FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T15:42:03.214892Z"},"links":{"cited_paper":"/paper/2506.18851","citing_paper":"/paper/2607.18227"},"observation_digest":"sha256:ec8c03c837adde26692f754cb94064c9b98481f78ef1b752989b7a203ca7b051","observation_id":"d0b5bbb2-e48a-4852-b2d2-ab7b4d43a9b4","resolution":{"observed_at":"2026-08-01T15:42:03.214892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18851/citation-record","integrity":"/paper/2506.18851/integrity","json":"/paper/2506.18851/citation-record.json","paper":"/paper/2506.18851"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.885049Z","title":"https://app.klingai.com/cn/image-to-video/frame-mode/new","venue":null,"work_id":"bf8f44d8-10d0-4b05-bb1b-a2d498462c8b","year":null},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.281280Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:d6852c405c65bbe94df4041b993266bd82c8f097e1b7a6a3bc53d25bdb34a1b5","observation_id":"e054ca19-271c-42b6-8a20-7e96b239d4f7","resolution":{"observed_at":"2026-08-06T23:20:14.987254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T23:20:07.412919Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.412919Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:9e0a41890418f0b9db50713bf913a50e82e4b9eb89e589bfaa59b6adf29c8269","observation_id":"936aa0b0-b79c-4a16-a8e4-7ed62334a08a","resolution":{"observed_at":"2026-08-06T23:20:07.412919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T23:20:07.559950Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.559950Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:9e2c4dc670e97b8d878ddaa6d2126cb602af568338deaeae7626a7216617dfe5","observation_id":"c5d73f85-b81a-4a94-99d3-fcf0bf3a9c45","resolution":{"observed_at":"2026-08-06T23:20:07.559950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.758710Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":"7cbbce8a-5dd6-42ae-b7fd-2f7e8c44b5ad","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.661980Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:91c3ab8456b53ac6bbe831c7ed7b3687292023e68d3a0d5dc230db2416cc59a9","observation_id":"242bf04c-e758-4187-b6d1-cf2130d6b3c4","resolution":{"observed_at":"2026-08-06T23:20:14.818122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-05T03:23:53.236854Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-06T23:20:07.782664Z","title":"Goku: Flow based video generative foundation models.arXiv preprint arXiv:2502.04896, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.782664Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:872edcdde78047fbce2c4d50488d2f1c1244dc335f95cf73f7aaed7bfaed8dd5","observation_id":"548c22ba-b600-4b5a-bf1d-30c42a03901e","resolution":{"observed_at":"2026-08-06T23:20:07.782664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06187","last_updated":"2025-03-20T17:59:56Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:54Z","title":"Multi-subject Open-set Personalization in Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06187","snapshot_observed_at":"2026-08-06T23:20:07.898058Z","title":"Multi-subject open-set personalization in video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:07.898058Z"},"links":{"cited_paper":"/paper/2501.06187","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:adb706e00d1c9ae9bdd2dba6760158e329c491461910240729a690b34e1b04d8","observation_id":"ccb1ac78-a014-4123-8381-65deac622c07","resolution":{"observed_at":"2026-08-06T23:20:07.898058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T23:20:08.003946Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.003946Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:076a433ac71e40cc5f5806befd01a75a402b49b734d837788889f0680466b464","observation_id":"d8217f7b-09bc-4179-971b-4fc5e54330c7","resolution":{"observed_at":"2026-08-06T23:20:08.003946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:08.123630Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.123630Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:7a7b7efc7e2178e621248d42ac52555420893422ae67ad988625fe11ae4af8f1","observation_id":"971e06cd-2ee5-4ab8-a7fa-a831ca7511a0","resolution":{"observed_at":"2026-08-06T23:20:08.123630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10391","last_updated":"2025-03-13T14:07:58Z","snapshot_observed_at":"2026-08-07T17:07:00.747879Z","submitted_at":"2025-03-13T14:07:58Z","title":"CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10391","snapshot_observed_at":"2026-08-06T23:20:08.256451Z","title":"Cinema: Coherent multi-subject video generation via mllm-based guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.256451Z"},"links":{"cited_paper":"/paper/2503.10391","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:422666a64cf8b086d045279eeadfb58c6e3915babf285a1d5ea0736a67237a0d","observation_id":"3e6fad62-7218-485c-ae16-187812f6a501","resolution":{"observed_at":"2026-08-06T23:20:08.256451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-06T23:20:08.358935Z","title":"Skyreels-a2: Compose anything in video diffusion transformers.arXiv preprint arXiv:2504.02436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.358935Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:260e8a78a69d24d050684f6da999d5c409e6127822d75d113ce22210783aa473","observation_id":"3578d72a-dae4-4e0f-9541-0faced2c218e","resolution":{"observed_at":"2026-08-06T23:20:08.358935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.571258Z","title":"I2vcontrol-camera: Precise video camera control with adjustable motion strength","venue":null,"work_id":"00a7beff-11d2-4272-839a-8b1d484724c9","year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.485574Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:917b1b4812221da413a6af09714598df7f57fd1a1b36c521a0936811577a4237","observation_id":"57719d53-065c-4e7b-b3a9-0bc249ad4b04","resolution":{"observed_at":"2026-08-06T23:20:14.649542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.411041Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"458cf6ba-111d-4eb3-8641-928065a3d051","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.625636Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:802324f9bb9c43a3c646ddd0c5200ae54b417c9d858ad3fdf70440c1e39079ff","observation_id":"227326dc-bb45-4984-981c-ad6bb01eef67","resolution":{"observed_at":"2026-08-06T23:20:14.474650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16022","last_updated":"2024-10-31T12:17:39Z","snapshot_observed_at":"2026-07-06T18:05:07.494681Z","submitted_at":"2024-04-24T17:55:33Z","title":"PuLID: Pure and Lightning ID Customization via Contrastive Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16022","snapshot_observed_at":"2026-08-06T23:20:08.734489Z","title":"Pulid: Pure and lightning id customization via contrastive alignment.arXiv preprint arXiv:2404.16022, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.734489Z"},"links":{"cited_paper":"/paper/2404.16022","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:83887d8f51c210d2f7529fdd62adf68ff2af0f9910f1ef33dcfcff2c7ca97972","observation_id":"ade09c8e-7940-458e-a4f2-31fbdbd37459","resolution":{"observed_at":"2026-08-06T23:20:08.734489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T23:20:08.795807Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.795807Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:91d50c589d4acf6ab0f1be27bfe43be00f9fb1d8eec269ce373d5e8973d033dc","observation_id":"11c68245-bd68-4e00-8edf-4e413d3f47ed","resolution":{"observed_at":"2026-08-06T23:20:08.795807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:08.907570Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.907570Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:4975fee491f36b8cd87f387d3807dbe57d94679052e1964da9e71cd8245f46d9","observation_id":"e5b62196-1ce5-4a5b-a4a0-0392792676e0","resolution":{"observed_at":"2026-08-06T23:20:08.907570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:08.983118Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:08.983118Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:615ed0f338275e5c74772d6f03d8ec4d84b1959e7cdb1878e0f1f1888cbff53d","observation_id":"58f7b177-7e25-4ffd-9e74-4d96c07dd3e0","resolution":{"observed_at":"2026-08-06T23:20:08.983118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-07T15:49:08.614735Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-06T23:20:09.055319Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.055319Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:31bc3edf604365b0872a97c5dd4886b03a9708e75a7bba91db5306084f23c2e0","observation_id":"4fe3aad9-1022-4d98-a760-24ab29b51e31","resolution":{"observed_at":"2026-08-06T23:20:09.055319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-07T17:10:22.188545Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-08-06T23:20:09.114978Z","title":"Conceptmaster: Multi-concept video customization on diffusion transformer models without test-time tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.114978Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:f6e12c6128b46cd6ee0973adeb7546f79b6eb9ad63c7a3988a9e27bd18747b6c","observation_id":"2f7e3dc0-1256-49f6-a739-3e6d4563e608","resolution":{"observed_at":"2026-08-06T23:20:09.114978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.232792Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"306e835f-1510-4afa-811e-43f5f46edca7","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.162659Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:91f6d84bf8cda9abc574e6d96beb06777a4cfa8f444ba23e529931dd4eaf2781","observation_id":"769b552b-9c95-4183-b04a-ada93d330dec","resolution":{"observed_at":"2026-08-06T23:20:14.336502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-06T23:20:09.206886Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.206886Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:76b5e4785433e040ce0b067cc6d403b640db1d147cda3021c71be10dc9872979","observation_id":"5f8fba00-c4c0-4fd9-98ff-0d666e4b8f59","resolution":{"observed_at":"2026-08-06T23:20:09.206886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19907","last_updated":"2025-03-25T17:59:06Z","snapshot_observed_at":"2026-08-07T16:37:34.121844Z","submitted_at":"2025-03-25T17:59:06Z","title":"FullDiT: Multi-Task Video Generative Foundation Model with Full Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19907","snapshot_observed_at":"2026-08-06T23:20:09.305048Z","title":"Fulldit: Multi-task video generative foundation model with full attention.arXiv preprint arXiv:2503.19907, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.305048Z"},"links":{"cited_paper":"/paper/2503.19907","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:e99fed05f438806e7071e403cc64253e3eba660d3016f5ad067c9fa60fb4ffca","observation_id":"6d30fc64-2077-4d5d-b3d9-fb1fae6e4570","resolution":{"observed_at":"2026-08-06T23:20:09.305048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:14.091805Z","title":"Videopoet: a large language model for zero-shot video generation","venue":null,"work_id":"8cca6fd8-97a1-4aa1-9c64-572aafd8ba4d","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.407365Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:642ac8f5fc2b707afb2bef88c533f04c463662f555421f1914c335102e365e38","observation_id":"ec7b89bf-d2d0-48a1-a74b-f7d73eb4e67c","resolution":{"observed_at":"2026-08-06T23:20:14.163161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T23:20:09.515493Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.515493Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:0e04c6d39c1e6acd2f0ebec18d89117e3b0bf82d5593051b72d344be099882a4","observation_id":"c129c7a5-e80e-46b0-b21e-6dd4e20cd887","resolution":{"observed_at":"2026-08-06T23:20:09.515493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07802","last_updated":"2025-02-04T22:03:26Z","snapshot_observed_at":"2026-08-05T03:24:24.469168Z","submitted_at":"2025-02-04T22:03:26Z","title":"Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07802","snapshot_observed_at":"2026-08-06T23:20:09.663233Z","title":"Movie weaver: Tuning-free multi-concept video personalization with anchored prompts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.663233Z"},"links":{"cited_paper":"/paper/2502.07802","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:9578d2e5071da3ba1614d3620b47bcdbd029d4bb0a3afbf85cf47225ae88bc3b","observation_id":"8f8ddeed-db8f-4a40-9ddb-f0c2b1ebc380","resolution":{"observed_at":"2026-08-06T23:20:09.663233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T23:20:09.789388Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.789388Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:843082f11db545ce60724c17d6a4b975b449e91b904aa4cfe3a5ce8cd3507b52","observation_id":"87b65c95-68b9-4163-86f1-1f87160406fe","resolution":{"observed_at":"2026-08-06T23:20:09.789388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-08-06T23:20:09.835019Z","title":"Improving video generation with human feedback.arXiv preprint arXiv:2501.13918, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.835019Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:66c73457bce9b526eab0f63d13c47fa44ef890f62d453d1853ad042fdeafb1c8","observation_id":"c8e34aed-e30e-4720-8208-b41d58262609","resolution":{"observed_at":"2026-08-06T23:20:09.835019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-07T18:14:57.828140Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-06T23:20:09.885970Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment.arXiv preprint arXiv:2502.11079, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.885970Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:a2ede7a27234a207fb23ce400e3290d6a682f9fccf368746aa3c9a6a13202c07","observation_id":"cde2f2fb-60aa-483a-8704-ee42bd252af6","resolution":{"observed_at":"2026-08-06T23:20:09.885970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.900379Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"57fc8e31-0dde-4dbf-8a3c-9c9658d1fb45","year":null},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:09.945008Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:edee1e30d4ce6ba619795b1d8cd6dc9edb045b30daf0a8b5de3b611b14d74f10","observation_id":"e32443b8-c6cc-45a4-b9b2-e08c609cd345","resolution":{"observed_at":"2026-08-06T23:20:13.994524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:10.014742Z","title":"Dreamo: A unified framework for image customization.arXiv preprint arXiv:2504.16915, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.014742Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:f2bd286b2768287f069978daae5a590b566f73c5f01edd56412a2826031ac977","observation_id":"6fc12ddd-5bd7-47c0-9aa3-6803ee8a27d2","resolution":{"observed_at":"2026-08-06T23:20:10.014742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T23:20:10.131887Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.131887Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:8f2926110355aba9a601c0261200d74c60ab82b30450e641205a46df419c989b","observation_id":"bb18a231-7d10-40bf-9495-4b25aa743b7b","resolution":{"observed_at":"2026-08-06T23:20:10.131887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.709603Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"80878de4-8a7e-4774-9d4d-7a76f34be0e1","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.226623Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:f78c4b61078dfeca91a173d5fffffc23244c877f4f621a01e334fd9dda085bbe","observation_id":"4d755b7a-55be-4e1e-b26e-43458ca8b5fa","resolution":{"observed_at":"2026-08-06T23:20:13.800703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16855","last_updated":"2025-03-09T02:57:28Z","snapshot_observed_at":"2026-08-07T22:08:49.929764Z","submitted_at":"2024-06-24T17:58:47Z","title":"DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16855","snapshot_observed_at":"2026-08-06T23:20:10.324650Z","title":"Dreambench++: A human-aligned benchmark for personalized image generation.arXiv preprint arXiv:2406.16855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.324650Z"},"links":{"cited_paper":"/paper/2406.16855","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:957f81f21cf44c58817dcf1685a3c3c4b63f7589c058ff632cad878ba99dd47d","observation_id":"c8554331-8089-4797-8ee1-b3731b9d9c15","resolution":{"observed_at":"2026-08-06T23:20:10.324650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T23:20:10.412598Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.412598Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:cdccc65d6bf6ad79543bcf1801f8032e0ffebf7b65bad987fd55fdca6b9a7f71","observation_id":"15c9c35d-d7e8-45c9-918e-6c3ee2b72c86","resolution":{"observed_at":"2026-08-06T23:20:10.412598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:10.519908Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.519908Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:aa3e1b02ff9e615f1b963c54b927b99880576881276c59e6815b5aa61e9ec937","observation_id":"34b8a0e4-285d-4c45-8c7c-6881a8c5a151","resolution":{"observed_at":"2026-08-06T23:20:10.519908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.557833Z","title":"Magi-1: Autoregressive video generation at scale, 2025","venue":null,"work_id":"6b59e358-da5d-4f9b-b01a-a395694b6787","year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.671514Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:0ff238ed1be7c03fa8c4893fb5fcfc54d73f1b999f80fc17b68a9fbfda9c489e","observation_id":"b461a489-b1b1-4cb4-b54f-bd9d57b55bff","resolution":{"observed_at":"2026-08-06T23:20:13.626322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.413098Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022","venue":null,"work_id":"653b2b48-bb0a-46ec-9d21-e460f881bfcf","year":2022},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.817178Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:068ef46b4e085619ee5dfb860285b5c6ba5f27f048a5befdb75726c2e14973e9","observation_id":"2acd82f9-768b-417d-9c3a-133d924b6aef","resolution":{"observed_at":"2026-08-06T23:20:13.475758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-08-07T16:06:27.835813Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-06T23:20:10.982218Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model.arXiv preprint arXiv:2504.08685, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.982218Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:43775e54f743a3f8898b282b2fcccde6fe28ce2ba91602e4d8d1cc1e4ba248e9","observation_id":"4ec1201b-19ef-4f14-b7b5-35fd9534eabf","resolution":{"observed_at":"2026-08-06T23:20:10.982218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.275649Z","title":"1st solution in google universal image embedding.https://www.kaggle.com/ datasets/louieshao/guieweights0732, april 2023","venue":null,"work_id":"9b6e8329-6dea-43ff-8560-587421edeefd","year":2023},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.107832Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:591784c6c1ec7543c54a50de86c21230febaab161e2c3cb1b5ab578a26fe4385","observation_id":"27480fe9-8169-42c9-91bd-d49daaab8682","resolution":{"observed_at":"2026-08-06T23:20:13.342298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T23:20:11.402590Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.402590Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:b5e62e98f6c82260112a5a1f37541712a7866901f637a546799ef3fb85f8f090","observation_id":"e02e20b3-e3c6-4622-a35b-ca2169098098","resolution":{"observed_at":"2026-08-06T23:20:11.402590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-01T11:16:30.883699Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-06T23:20:11.524559Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content.arXiv preprint arXiv:2410.08260, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.524559Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:2b2cdf97c2b13dc0128eb62e51ed5b3a6b0f665e44f26ee0b8e3987336b05129","observation_id":"295f7e3f-39f7-4945-aefd-4fdb20e9e6b0","resolution":{"observed_at":"2026-08-06T23:20:11.524559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04468","last_updated":"2024-01-09T10:12:52Z","snapshot_observed_at":"2026-08-04T07:28:33.714480Z","submitted_at":"2024-01-09T10:12:52Z","title":"MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04468","snapshot_observed_at":"2026-08-06T23:20:11.666371Z","title":"Magicvideo-v2: Multi-stage high-aesthetic video generation.arXiv preprint arXiv:2401.04468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.666371Z"},"links":{"cited_paper":"/paper/2401.04468","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:df33fbc55439e3dbc89af9dcba3a20bf284ef029e9ac42f878b986bbd50a0d0b","observation_id":"93a72d36-888b-4810-a952-d98bbb964178","resolution":{"observed_at":"2026-08-06T23:20:11.666371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08645","last_updated":"2024-12-11T18:59:53Z","snapshot_observed_at":"2026-08-05T05:04:08.112463Z","submitted_at":"2024-12-11T18:59:53Z","title":"ObjectMate: A Recurrence Prior for Object Insertion and Subject-Driven Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08645","snapshot_observed_at":"2026-08-06T23:20:11.805625Z","title":"Objectmate: Arecurrencepriorforobjectinsertionandsubject-drivengeneration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.805625Z"},"links":{"cited_paper":"/paper/2412.08645","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:3d1f7c3e447403927421b426e95e6fa094ab06b1c3f70e78a754652854cd840f","observation_id":"24ed82c9-4a1f-4a8c-8bf0-0df209fdbbdd","resolution":{"observed_at":"2026-08-06T23:20:11.805625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07314","last_updated":"2025-03-10T13:33:27Z","snapshot_observed_at":"2026-08-07T17:16:48.946119Z","submitted_at":"2025-03-10T13:33:27Z","title":"Automated Movie Generation via Multi-Agent CoT Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07314","snapshot_observed_at":"2026-08-06T23:20:11.903050Z","title":"Automated movie generation via multi-agent cot planning.arXiv preprint arXiv:2503.07314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:11.903050Z"},"links":{"cited_paper":"/paper/2503.07314","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:2521b663694187984cad2764119c3074b22420ac640e43d872b361f2d0b9a35e","observation_id":"fee5c2ec-4bfc-471b-9a24-5c858f01a338","resolution":{"observed_at":"2026-08-06T23:20:11.903050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.145437Z","title":"Demystifying clip data","venue":null,"work_id":"f8950612-1e1a-4e74-80c0-4e2f5c7b76ab","year":null},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.011700Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:88fce69da8cf6f34e20af85952872042f03f4e6a388b5b49953a5f202c2545dd","observation_id":"a5f0b523-a422-4d12-956f-003f6cb3b5d5","resolution":{"observed_at":"2026-08-06T23:20:13.201869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:12.136554Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.136554Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:245db107d892a0988e378158a4e05428b408222c1ac3eba3bb498b65d9df8c84","observation_id":"7a66a847-caf4-4edb-8a1f-4a23c9279113","resolution":{"observed_at":"2026-08-06T23:20:12.136554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T23:20:12.221510Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.221510Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:9d42d6dc9051ac9c056813673d38a29ae29209e66312228313e88a453890d1ff","observation_id":"13d8e36f-b585-41e5-b67b-88d083295212","resolution":{"observed_at":"2026-08-06T23:20:12.221510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T23:20:12.336672Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.336672Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:2c945904de0c5bd94d9ef02ebec44049317c53a39146846e6a924f16114f469a","observation_id":"a0d0ab4a-a491-4c73-8109-3edb5a25304c","resolution":{"observed_at":"2026-08-06T23:20:12.336672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:13.030085Z","title":"Make pixels dance: High-dynamic video generation","venue":null,"work_id":"c99f86dc-8f19-4250-906d-82d565ca8ddb","year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.457366Z"},"links":{"citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:51cba4f4320c7aca9822430e8d9ff3f9a66372d01c62998039a73969264364a1","observation_id":"e8f64890-f3de-4bc5-99b4-93aeaf419afe","resolution":{"observed_at":"2026-08-06T23:20:13.067847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14151","last_updated":"2025-07-02T11:55:35Z","snapshot_observed_at":"2026-08-07T16:55:11.462308Z","submitted_at":"2025-03-18T11:17:32Z","title":"Concat-ID: Towards Universal Identity-Preserving Video Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14151","snapshot_observed_at":"2026-08-06T23:20:12.568377Z","title":"Concat-id: Towards universal identity- preserving video synthesis.arXiv preprint arXiv:2503.14151, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:12.568377Z"},"links":{"cited_paper":"/paper/2503.14151","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:febcb7a95f611d639a698096245f5fd497fcb2fbe507a837f5a385fb0ca7db0e","observation_id":"76c4d674-998f-407b-bbb5-a3ba01a77a12","resolution":{"observed_at":"2026-08-06T23:20:12.568377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:13:14.170240Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 6 inbound Pith citation observations for arXiv:2506.18851."}