{"as_of":"2026-08-09T12:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23f44fb1679fa50c9e37ca742351e94f922e291a5753a93147362edfc81bcda9","coverage":[{"denominator":130,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:59:35.677086Z","state":"measured"},{"denominator":122,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":122,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:42:42.185508Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:10:09.694521Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-22T17:51:41.947939Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2504.17816"},"observation_digest":"sha256:ecd0a427a1451443487663d59bb4be06dfd8867537e290e8e5ce5af903c877c0","observation_id":"3aca3f54-c5c7-42cd-9089-7b36a2819a38","resolution":{"observed_at":"2026-05-22T17:51:54.359831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T17:34:26.951644Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2506.03147"},"observation_digest":"sha256:1a28534e58a99281fcbde55ced451a89dc54fe3672697cd13d000a1e237663b0","observation_id":"c203b860-2132-44a4-b42f-76f32dfc4acd","resolution":{"observed_at":"2026-05-12T17:34:27.064326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-08-05T12:42:42.185508Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01362","last_updated":"2025-09-01T11:03:13Z","snapshot_observed_at":"2026-08-09T00:52:28.062011Z","submitted_at":"2025-09-01T11:03:13Z","title":"Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:42:42.185508Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2509.01362"},"observation_digest":"sha256:ff76e5d96a66d8c3520072da0cc787f6320fb02205f88e15b29513798537309b","observation_id":"1f147232-5df2-4fc5-99ef-ccfb5336fef7","resolution":{"observed_at":"2026-08-05T12:42:42.185508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-13T12:23:05.876881Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation.arXiv preprint arXiv:2505.20292, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03738","last_updated":"2026-04-04T13:50:38Z","snapshot_observed_at":"2026-08-06T04:04:52.686841Z","submitted_at":"2026-04-04T13:50:38Z","title":"Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T12:23:05.876881Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2604.03738"},"observation_digest":"sha256:7f2b015e281fb8e3991e5eb56e1c9a41ae17914745a131698cf317a9b692b4c5","observation_id":"df606aab-91b1-478b-acf8-815f5d58b22b","resolution":{"observed_at":"2026-07-13T12:23:05.876881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:f5e3d20ed7733c226c001927e611f0d1e72cfa39ad999cf508dde5db0ef9984e","observation_id":"47eeac02-5dbc-4b30-b9c4-37208fa942b8","resolution":{"observed_at":"2026-05-11T11:11:00.839751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2604.17021","last_updated":"2026-04-18T15:09:01Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T15:09:01Z","title":"LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T07:21:41.483427Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2604.17021"},"observation_digest":"sha256:be5f2685708b7fa9b99cd45ff8e0083ba817caa0beb69604119a7a39ff1e573e","observation_id":"ca89bad4-82c4-42aa-8181-608e8e4bff9b","resolution":{"observed_at":"2026-05-10T07:21:55.095118Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2604.23789","last_updated":"2026-05-09T04:03:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-26T16:28:46Z","title":"MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T06:28:42.129881Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2604.23789"},"observation_digest":"sha256:ac4a54aa4c230407b780e20c33d944615aba1f4dce17fac7ebdac275308487a5","observation_id":"146ce315-82b4-4402-80e4-5c6faf90d9aa","resolution":{"observed_at":"2026-05-11T21:11:19.210744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2604.23789","last_updated":"2026-05-09T04:03:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-26T16:28:46Z","title":"MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:10.509727Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2604.23789"},"observation_digest":"sha256:766daa2e444d077bac71dd7a407b75fea612ecfd8515a1001c07149a0d1e1935","observation_id":"3c22f376-4c71-479b-ae69-5a2cacaa96a2","resolution":{"observed_at":"2026-05-12T00:51:15.130701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.15199","last_updated":"2026-05-14T17:59:55Z","snapshot_observed_at":"2026-08-07T16:11:51.735043Z","submitted_at":"2026-05-14T17:59:55Z","title":"EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T03:16:03.450742Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.15199"},"observation_digest":"sha256:9a09943f3aebd30ed504acc2e32bb71e6ceb258bfc0ac7eab12eb8ae2eba875c","observation_id":"3b2377c7-e313-49fd-a656-7d491fbca3fb","resolution":{"observed_at":"2026-05-15T03:19:44.040337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-03T19:41:20.540916Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T20:11:33.277349Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:b6408b51e617cadb5696f10e4d4857b6a1ae4219a3de867b16171f171e87274e","observation_id":"6884ece6-c3fc-4215-9ccc-eaebec221846","resolution":{"observed_at":"2026-05-20T20:13:43.506965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-03T19:41:20.540916Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T19:23:07.044659Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:69157ac4b8a064f5441d11aff8fe25e4225462363e2e86453e9cd02013df055c","observation_id":"d0708f02-1251-4c41-98d5-c8e04e91a0cc","resolution":{"observed_at":"2026-06-30T19:25:00.604747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-04T04:39:45.061732Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:20fde31898364964344cc94be47b53ffff0abf24c6998c792abade40660bf163","observation_id":"3f51a193-c34a-4d5e-9ebd-0abde07ca1f5","resolution":{"observed_at":"2026-05-20T14:13:21.404522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T05:17:11.690484Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:18224dc18dc0c8a2752bb88a2c33edb0b76cc90dfa856e39872b070f98a39567","observation_id":"ec6a5880-b1f9-4524-8903-030cab407046","resolution":{"observed_at":"2026-05-20T05:18:03.111547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:4af9b77adfc82b637bd5855a99cfead23ac8104138146bd45e0cbe6f22284b18","observation_id":"5717e354-4435-4328-84c4-ea7fe842b65e","resolution":{"observed_at":"2026-06-30T18:04:58.012646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.22344","last_updated":"2026-05-21T11:30:29Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:30:29Z","title":"Bernini: Latent Semantic Planning for Video Diffusion","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-22T06:39:47.124605Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.22344"},"observation_digest":"sha256:6fee5b6a85aec483b561358bbe885aea57d3f2eb8e1e6883cc0bd573feab5da5","observation_id":"cd359f9b-2198-495b-99ac-3411e362971e","resolution":{"observed_at":"2026-05-22T06:41:10.560161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2605.26628","last_updated":"2026-05-26T07:04:22Z","snapshot_observed_at":"2026-08-06T14:06:27.336290Z","submitted_at":"2026-05-26T07:04:22Z","title":"Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T18:20:47.823852Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2605.26628"},"observation_digest":"sha256:53302506a250256149ce1a3b724157eae59eceda66a01e534fc8ea40f196f7cf","observation_id":"4b4fd2de-3168-4ea7-a51a-7561b92f26d8","resolution":{"observed_at":"2026-06-29T18:23:50.628549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2606.00658","last_updated":"2026-05-30T10:15:26Z","snapshot_observed_at":"2026-08-08T11:33:01.937288Z","submitted_at":"2026-05-30T10:15:26Z","title":"Collaborative Few-Step Distillation and Low-Bit Quantization for Wan2.2 Dual-Expert Video Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T18:58:13.799615Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2606.00658"},"observation_digest":"sha256:60182a985ef20e7681538605ee0cc799670322116a27f7d5c91732ce20559b3a","observation_id":"e4cabb42-3932-46e4-9b28-ebaf7eacccd8","resolution":{"observed_at":"2026-06-28T19:02:34.320535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2606.10839","last_updated":"2026-06-22T14:44:53Z","snapshot_observed_at":"2026-08-08T03:14:09.273162Z","submitted_at":"2026-06-09T13:26:39Z","title":"HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T13:49:50.272650Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2606.10839"},"observation_digest":"sha256:fe88dfd8c4814667ce9532550672d073580818b606536431583c5b11a6875b93","observation_id":"a615470e-d2b6-4529-8694-59cd4b3071a9","resolution":{"observed_at":"2026-07-03T04:37:36.638712Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":"2505.20292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-04T21:10:09.694521Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject- to-video generation","venue":null,"work_id":"7fa68c33-70bd-475c-9329-2ac3075703bc","year":2025},"citing_paper":{"arxiv_id":"2606.26058","last_updated":"2026-06-24T17:33:13Z","snapshot_observed_at":"2026-08-07T10:26:25.230801Z","submitted_at":"2026-06-24T17:33:13Z","title":"DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-25T19:00:23.260939Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2606.26058"},"observation_digest":"sha256:f3d67a124616e27e9491474332ef87065569f5a3e618bb12b6839cf0351cefd2","observation_id":"90ac3907-af02-4025-9542-4cd1e31b21b3","resolution":{"observed_at":"2026-07-04T21:10:09.696509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-11T20:11:31.576642Z","title":"arXiv preprint arXiv:2505.20292 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04311","last_updated":"2026-07-07T14:30:21Z","snapshot_observed_at":"2026-08-04T12:36:41.280283Z","submitted_at":"2026-07-05T13:54:33Z","title":"Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-11T20:11:31.576642Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2607.04311"},"observation_digest":"sha256:21af8e7fa25f431c602b4f1163db492f00bdd696edfe4aba40204b1f2a5a5c89","observation_id":"415ecded-5571-409f-9c9f-beb34b30e50a","resolution":{"observed_at":"2026-07-11T20:11:31.576642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-08-01T10:24:52.920746Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.920746Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:8fce44bdeb5170cb6779b0e105bfe471fc80f0038e3e196e071fcaa8f37f8587","observation_id":"276855ba-c617-4634-a6d8-21ed7da399bb","resolution":{"observed_at":"2026-08-01T10:24:52.920746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-31T05:08:20.144127Z","title":"OpenS2V-Nexus: A detailed benchmark and million-scale dataset for subject- to-video generation.arXiv preprint arXiv:2505.20292, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-07T17:45:50.081609Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.144127Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:c927c918c1f7134d9107a0dbf0b183b06dcd76fab602410f2a14baaed88416a4","observation_id":"1fdba910-7052-43bc-a0ce-292612471ffe","resolution":{"observed_at":"2026-07-31T05:08:20.144127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20292/citation-record","integrity":"/paper/2505.20292/integrity","json":"/paper/2505.20292/citation-record.json","paper":"/paper/2505.20292"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:59:27.582566Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:27.582566Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:200e7d81f86819d70db017489e9f9dcc02976babf9e8d73d3066fc89d00e154d","observation_id":"f622355a-fc11-46d9-8882-071363473815","resolution":{"observed_at":"2026-08-07T13:59:27.582566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:27.677003Z","title":"Detecting ai-generated images using vision transformers: A robust approach for safeguarding visual media integrity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:27.677003Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:257efc0a5bdb1a48007a7a332384e5589f2c040187d91547305ae481d0396469","observation_id":"674e39e3-f51d-4ec1-b250-274525a49cf0","resolution":{"observed_at":"2026-08-07T13:59:27.677003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:59:27.789237Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:27.789237Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:fb2c5c3d0435cf9f7fd23620872631332f5693a06fa1207db6da2955a4113f09","observation_id":"b31a7f79-6b63-43d9-bd3b-b1ec684f5ca5","resolution":{"observed_at":"2026-08-07T13:59:27.789237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:27.939740Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:27.939740Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:8d053e29bb6aef713b13e3154ddd170e38836d3a2239d9ac33fc99843053547e","observation_id":"d4d2a682-d6fc-4019-872e-3d68462c74af","resolution":{"observed_at":"2026-08-07T13:59:27.939740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T13:59:28.048350Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.048350Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:5ad151ebb80bde3484211240d9cfc17b3781e336e6532e49521a3126373fa668","observation_id":"e211f830-c275-4c09-812e-117d517cad8a","resolution":{"observed_at":"2026-08-07T13:59:28.048350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:28.178541Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.178541Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:b8b22ed17c538be037799cefb2b2214dd3f7e457a9c03ce5460d19651f9472ee","observation_id":"c83fa217-46b4-4b85-a1b9-10cffa1791f9","resolution":{"observed_at":"2026-08-07T13:59:28.178541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18597","last_updated":"2025-03-26T09:05:41Z","snapshot_observed_at":"2026-08-05T17:03:47.891638Z","submitted_at":"2024-12-24T18:51:19Z","title":"DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18597","snapshot_observed_at":"2026-08-07T13:59:28.322361Z","title":"Ditctrl: Exploring attention control in multi-modal diffusion trans- former for tuning-free multi-prompt longer video generation.arXiv preprint arXiv:2412.18597, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.322361Z"},"links":{"cited_paper":"/paper/2412.18597","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:d272e8d03ddae357d89aa16cf6f17491fb43d2ea06f2a0641d1ed66cd2566398","observation_id":"eba92d87-f4a5-49c3-8088-45ad15c42153","resolution":{"observed_at":"2026-08-07T13:59:28.322361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-01T16:10:16.293275Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-07T13:59:28.549879Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.549879Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:91e635685aa8ea837e1892e567d4eb2bb6ca1c36d11033aef5422bb0b7b809eb","observation_id":"2b2e282a-64fc-4df7-8bcc-652b8e8d3538","resolution":{"observed_at":"2026-08-07T13:59:28.549879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05793","last_updated":"2023-09-11T19:59:43Z","snapshot_observed_at":"2026-08-03T16:16:19.476471Z","submitted_at":"2023-09-11T19:59:43Z","title":"PhotoVerse: Tuning-Free Image Customization with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05793","snapshot_observed_at":"2026-08-07T13:59:28.605625Z","title":"Photoverse: Tuning-free image customization with text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.605625Z"},"links":{"cited_paper":"/paper/2309.05793","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:980d6d7b9453d9bc907677f1f5d4613cac955cd18103b831358a64d987593eb6","observation_id":"5041d6bd-3208-4592-b253-afb119d6efc5","resolution":{"observed_at":"2026-08-07T13:59:28.605625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01199","last_updated":"2024-09-09T13:49:53Z","snapshot_observed_at":"2026-08-08T23:08:42.315906Z","submitted_at":"2024-09-02T12:20:42Z","title":"OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01199","snapshot_observed_at":"2026-08-07T13:59:28.683440Z","title":"Od-vae: An omni-dimensional video compressor for improving latent video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.683440Z"},"links":{"cited_paper":"/paper/2409.01199","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:5a97102585eaca9f9bee0293d6379ffe155d83454ceeee9de74475bf52b4ede9","observation_id":"a83ac1d4-5098-4588-8898-770acbd2eee6","resolution":{"observed_at":"2026-08-07T13:59:28.683440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19479","last_updated":"2024-02-29T18:59:50Z","snapshot_observed_at":"2026-08-08T15:16:15.308854Z","submitted_at":"2024-02-29T18:59:50Z","title":"Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19479","snapshot_observed_at":"2026-08-07T13:59:28.739467Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.739467Z"},"links":{"cited_paper":"/paper/2402.19479","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:6a9bc77e5efbb940e35ca6ceba776291885ae89c2bbc21640d303c52c52370d9","observation_id":"9a4bf5ea-8a1e-4037-9f18-93bd8d8d0591","resolution":{"observed_at":"2026-08-07T13:59:28.739467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06187","last_updated":"2025-03-20T17:59:56Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:54Z","title":"Multi-subject Open-set Personalization in Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06187","snapshot_observed_at":"2026-08-07T13:59:28.849584Z","title":"Multi- subject open-set personalization in video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.849584Z"},"links":{"cited_paper":"/paper/2501.06187","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:ead5b98040cf948538f1fa99056d3bc3bc302bae1495830bae140dd7e1204127","observation_id":"08a4a1b2-29ee-4e32-b9c5-a14526531a4f","resolution":{"observed_at":"2026-08-07T13:59:28.849584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07774","last_updated":"2024-12-11T22:51:08Z","snapshot_observed_at":"2026-08-08T03:21:39.147609Z","submitted_at":"2024-12-10T18:59:55Z","title":"UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07774","snapshot_observed_at":"2026-08-07T13:59:28.964637Z","title":"Unireal: Universal image generation and editing via learning real-world dynamics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:28.964637Z"},"links":{"cited_paper":"/paper/2412.07774","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:f39b1d7af9c339d81b8e639a1cb0e75f75f32c5c40b17271836934dce14fea19","observation_id":"32a1c487-0f0f-45d1-b6cb-035ad5f57224","resolution":{"observed_at":"2026-08-07T13:59:28.964637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:29.040098Z","title":"Yolo- world: Real-time open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.040098Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c33fcd129494a04b517ea88a841d3213f232f6b84246256c14f9ae5818ed4b20","observation_id":"9b8bc10a-163f-4858-ab5a-41425d925ea7","resolution":{"observed_at":"2026-08-07T13:59:29.040098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:29.159161Z","title":"improved-aesthetic-predictor","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.159161Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:1e15d4c802dab7363e56977f58c2fd8f4d56fd8ab0ca2021c385575941e41de0","observation_id":"a6948c17-7919-4f42-9b3a-095e838483d6","resolution":{"observed_at":"2026-08-07T13:59:29.159161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:29.222747Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.222747Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:f24197f95995a3b6a6619f086f45960d72fb5edc5a6fa92d77ea86ffadd031c7","observation_id":"8ea5b247-88ce-431e-86f4-3e07a6732a56","resolution":{"observed_at":"2026-08-07T13:59:29.222747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10391","last_updated":"2025-03-13T14:07:58Z","snapshot_observed_at":"2026-08-07T17:07:00.747879Z","submitted_at":"2025-03-13T14:07:58Z","title":"CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10391","snapshot_observed_at":"2026-08-07T13:59:29.343261Z","title":"Cinema: Coherent multi-subject video generation via mllm-based guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.343261Z"},"links":{"cited_paper":"/paper/2503.10391","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:faf790b2ea6948d1701d60901d5ebae52a5593095ddd8cf63938536a769189ef","observation_id":"7344fd96-2a37-4a56-9bff-dc864b12df8a","resolution":{"observed_at":"2026-08-07T13:59:29.343261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:29.388166Z","title":"Worldscore: A unified evaluation benchmark for world generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.388166Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:a123671816f1c0a1d044c6327bf913935a65f9025776ad5dbe09b80823a6d7f4","observation_id":"5f763547-6771-4408-af08-5709abd1f81d","resolution":{"observed_at":"2026-08-07T13:59:29.388166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08453","last_updated":"2025-01-14T21:53:11Z","snapshot_observed_at":"2026-07-06T20:21:09.148018Z","submitted_at":"2025-01-14T21:53:11Z","title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08453","snapshot_observed_at":"2026-08-07T13:59:29.452382Z","title":"Vchitect-2.0: Parallel transformer for scaling up video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.452382Z"},"links":{"cited_paper":"/paper/2501.08453","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:4543646199606f7393e66928c97cc964dc123946aebcee2ba50f1363735e6253","observation_id":"78244fcb-96a4-4777-9e21-b732843a7d56","resolution":{"observed_at":"2026-08-07T13:59:29.452382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-07T13:59:29.507056Z","title":"Skyreels-a2: Compose anything in video diffusion trans- formers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.507056Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:34b57f2733ec9047953884324a7eb0ef119a56a4a62a53d3748cb29f7ace2956","observation_id":"87b78b0f-fefc-47bf-a394-e5f5bcd6680b","resolution":{"observed_at":"2026-08-07T13:59:29.507056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-07-06T20:16:09.014564Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01790","snapshot_observed_at":"2026-08-07T13:59:29.585694Z","title":"Ingredients: Blending custom photos with video diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.585694Z"},"links":{"cited_paper":"/paper/2501.01790","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:cca3ff0effb4e2303438a3d990c62ed2f1bbb63e32be887e5137bd7f96c01239","observation_id":"4038376a-8f8a-411c-83bd-87e66b361c56","resolution":{"observed_at":"2026-08-07T13:59:29.585694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02807","last_updated":"2025-01-07T07:47:22Z","snapshot_observed_at":"2026-07-06T20:16:57.990245Z","submitted_at":"2025-01-06T07:00:22Z","title":"AE-NeRF: Augmenting Event-Based Neural Radiance Fields for Non-ideal Conditions and Larger Scene","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02807","snapshot_observed_at":"2026-08-07T13:59:29.672932Z","title":"Ae-nerf: Augmenting event-based neural radiance fields for non-ideal conditions and larger scene","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.672932Z"},"links":{"cited_paper":"/paper/2501.02807","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:1f71e3c7ea69a2c9472b2396aa76d9d4eaaf1b0f1bc309936f19502598558c7d","observation_id":"7e1227c4-7833-4794-8ce6-f823e278d27e","resolution":{"observed_at":"2026-08-07T13:59:29.672932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-07T13:59:29.775085Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.775085Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:8847526e31a8c8e58d6685d091e15631461e53484a0403b6a681408a75fa0e76","observation_id":"0bcb0d86-c873-465d-9046-9c71c1b4ca33","resolution":{"observed_at":"2026-08-07T13:59:29.775085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T13:59:29.829842Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.829842Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:b1bcf3fc0818cb21513303f7aa92cee07b81a1ff60a93776d878807a228e3923","observation_id":"c460b892-36fd-4c44-9c27-2e96a2b65ab3","resolution":{"observed_at":"2026-08-07T13:59:29.829842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16022","last_updated":"2024-10-31T12:17:39Z","snapshot_observed_at":"2026-08-09T09:39:50.494679Z","submitted_at":"2024-04-24T17:55:33Z","title":"PuLID: Pure and Lightning ID Customization via Contrastive Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16022","snapshot_observed_at":"2026-08-07T13:59:29.869968Z","title":"Pulid: Pure and lightning id customization via contrastive alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.869968Z"},"links":{"cited_paper":"/paper/2404.16022","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:9db8fc59118a81da09a7a4bc7533708bd9035d5af92300f58cdc0a8022b07d1a","observation_id":"cef193aa-9fac-4a73-9318-e231dbffa46f","resolution":{"observed_at":"2026-08-07T13:59:29.869968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05939","last_updated":"2024-09-06T14:44:12Z","snapshot_observed_at":"2026-07-06T18:59:29.568123Z","submitted_at":"2024-08-12T06:27:29Z","title":"UniPortrait: A Unified Framework for Identity-Preserving Single- and Multi-Human Image Personalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05939","snapshot_observed_at":"2026-08-07T13:59:29.959239Z","title":"Uniportrait: A unified framework for identity- preserving single-and multi-human image personalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:29.959239Z"},"links":{"cited_paper":"/paper/2408.05939","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:358ce7f9cbff3217ef131777bc159a01b760aba55742ab600d258b6c1d50e1e5","observation_id":"b9ca7979-c9c2-4e8a-8da3-5d1cf9e33c7f","resolution":{"observed_at":"2026-08-07T13:59:29.959239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15252","last_updated":"2024-10-14T04:08:53Z","snapshot_observed_at":"2026-07-06T18:34:56.008706Z","submitted_at":"2024-06-21T15:43:46Z","title":"VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15252","snapshot_observed_at":"2026-08-07T13:59:30.049247Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.049247Z"},"links":{"cited_paper":"/paper/2406.15252","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:1f289a145cb38e2e777a22341127dd3a80513215e930f28ddde5557acd075c10","observation_id":"2a96e897-15fa-4f12-9e15-faf72dbb4d0b","resolution":{"observed_at":"2026-08-07T13:59:30.049247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-07-06T18:04:33.726854Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-08-07T13:59:30.179985Z","title":"Id-animator: Zero-shot identity-preserving human video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.179985Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:0ec3b4cd429f6f52fe1f68f971b6e4e8f8dc555af1fa7b6abd0232d9435af58a","observation_id":"7b23639f-4312-4f64-a82f-555e6e29f70c","resolution":{"observed_at":"2026-08-07T13:59:30.179985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T13:59:30.262848Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.262848Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:a4d0d9f0d1c85370290b0da3c641dc66c852eb970e34c2b3c7b11ba621d333b0","observation_id":"79771ac8-067f-45f3-b446-1b6261545c69","resolution":{"observed_at":"2026-08-07T13:59:30.262848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:30.325203Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.325203Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:f4e1a4cfbd8de7d01b69418ce2f247ebd39dbf847af82883078a9c796684cf04","observation_id":"b14917ee-acdd-488e-a78f-8696687ca2b8","resolution":{"observed_at":"2026-08-07T13:59:30.325203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06145","last_updated":"2025-02-10T04:20:11Z","snapshot_observed_at":"2026-08-08T16:33:13.977887Z","submitted_at":"2025-02-10T04:20:11Z","title":"Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06145","snapshot_observed_at":"2026-08-07T13:59:30.416393Z","title":"Animate anyone 2: High-fidelity character image animation with environment affordance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.416393Z"},"links":{"cited_paper":"/paper/2502.06145","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:052a28ff51d2cce2133b68c4f9fde679b2a2c8aa1a5e935792c4ffae56e114e9","observation_id":"3f861033-8931-486c-b7df-ae3fe9cb8860","resolution":{"observed_at":"2026-08-07T13:59:30.416393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-08T15:15:48.227139Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-07T13:59:30.485928Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.485928Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:b7375dcd4d4e8054bec5c87fbe95a05921baf7ba45e3c65ca72980e0765811f6","observation_id":"63e9d5a2-120e-4bf2-8687-2cb8e04ecf70","resolution":{"observed_at":"2026-08-07T13:59:30.485928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:30.553705Z","title":"Curricularface: adaptive curriculum learning loss for deep face recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.553705Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:48f9c7f378586040104a3ce418a53681242d9d4b3967ed3000535f292a1d7df6","observation_id":"d2626035-6181-445e-b482-e4885d7f8b11","resolution":{"observed_at":"2026-08-07T13:59:30.553705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-08T15:16:50.023350Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-08-07T13:59:30.608834Z","title":"Conceptmaster: Multi-concept video customization on diffusion transformer models without test-time tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.608834Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c35e50772a55d595006ad10aad59abccfefa92000177f7d654e0d8c9b4a8cd05","observation_id":"ed245bbb-b229-4733-8b8c-c399a21ac318","resolution":{"observed_at":"2026-08-07T13:59:30.608834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17982","last_updated":"2023-11-29T18:39:01Z","snapshot_observed_at":"2026-07-06T16:54:37.940527Z","submitted_at":"2023-11-29T18:39:01Z","title":"VBench: Comprehensive Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17982","snapshot_observed_at":"2026-08-07T13:59:30.690138Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.690138Z"},"links":{"cited_paper":"/paper/2311.17982","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:a32421089a74c022c695e178387a079c2b60de1b8f5c12a0f46c450c4a4d6831","observation_id":"65e3c255-602b-4982-bb4b-57471c45dd2c","resolution":{"observed_at":"2026-08-07T13:59:30.690138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-07-06T19:53:17.024873Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-08-07T13:59:30.771224Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.771224Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:94f7eedc303eaeef6a9ac698d611eb2e80b4964e3f5cc14454ef24154dc5ec7b","observation_id":"288b44fb-26ab-4086-8dd5-595bdb0df7fe","resolution":{"observed_at":"2026-08-07T13:59:30.771224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16418","last_updated":"2025-07-29T01:42:34Z","snapshot_observed_at":"2026-08-07T16:48:21.587377Z","submitted_at":"2025-03-20T17:59:34Z","title":"InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16418","snapshot_observed_at":"2026-08-07T13:59:30.860050Z","title":"Infiniteyou: Flexible photo recrafting while preserving your identity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.860050Z"},"links":{"cited_paper":"/paper/2503.16418","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:180f0e96f1fa5b9087d571f8b2f56467d80090c9a9841db6db02450a4ac8ee33","observation_id":"0baf8290-2faa-4be9-bc22-e5438a041216","resolution":{"observed_at":"2026-08-07T13:59:30.860050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:30.937726Z","title":"Videobooth: Diffusion-based video generation with image prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.937726Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:6848e17f651e23b2e7e1088bd6497e4e8c85948aac5438351311d71494d83494","observation_id":"7d0df9c7-c0c8-473b-a301-0bf36b3a1813","resolution":{"observed_at":"2026-08-07T13:59:30.937726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-07T13:59:30.975711Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:30.975711Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:885a57417cbd69a3b34cb8459a5179bc153131cb4d708c9e55ee3237e379c1c1","observation_id":"94ca3e3a-605d-4741-ace1-aa094a4bcc71","resolution":{"observed_at":"2026-08-07T13:59:30.975711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T13:59:31.009125Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.009125Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:7853b8b491a9a38aba79682ae87efe3c34af23d52742b87c2a9e68054c8c37e5","observation_id":"d40dcba6-b12e-407f-8fee-4f445c5d4eda","resolution":{"observed_at":"2026-08-07T13:59:31.009125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11956","last_updated":"2024-08-07T17:02:00Z","snapshot_observed_at":"2026-07-06T17:46:25.142387Z","submitted_at":"2024-03-18T16:52:49Z","title":"Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11956","snapshot_observed_at":"2026-08-07T13:59:31.052527Z","title":"Subjective-aligned dateset and metric for text-to-video quality assessment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.052527Z"},"links":{"cited_paper":"/paper/2403.11956","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:37e1f22829404ab6cc714d48556207ec4473a5027a601aaf8def0e54d6345864","observation_id":"a9f50fd2-8410-4887-94a1-fddec84a7c47","resolution":{"observed_at":"2026-08-07T13:59:31.052527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:31.099118Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.099118Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:2a9a69ffdd89070be00cca88618657ee69668bd920f944e39fcbabde16961f71","observation_id":"32bfaf9c-8b5c-4e53-b2cc-80377defbc32","resolution":{"observed_at":"2026-08-07T13:59:31.099118Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:31.162597Z","title":"Pika-2.0 lab discord server","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.162597Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:2b6acb0cfdd8b8a9680447aad28ee459aedd84aea78d52448772ed52f4b8a718","observation_id":"75367925-d66c-4aca-915c-9a298cb79360","resolution":{"observed_at":"2026-08-07T13:59:31.162597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-08-08T10:49:13.982249Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00115","snapshot_observed_at":"2026-08-07T13:59:31.215680Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.215680Z"},"links":{"cited_paper":"/paper/2412.00115","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:33e2d442e85af902b49ce048d98d47475198e9a35669f194622f708f5c7cf4cb","observation_id":"6233e01f-9820-43fc-bfbf-9768baece134","resolution":{"observed_at":"2026-08-07T13:59:31.215680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06741","last_updated":"2025-01-04T06:17:20Z","snapshot_observed_at":"2026-08-06T16:33:04.894283Z","submitted_at":"2024-08-13T09:01:12Z","title":"Improving Synthetic Image Detection Towards Generalization: An Image Transformation Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06741","snapshot_observed_at":"2026-08-07T13:59:31.251492Z","title":"Improving synthetic image detection towards generalization: An image transformation perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.251492Z"},"links":{"cited_paper":"/paper/2408.06741","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:4e29bd84fd699732b8868e81d70f16496cfdb3f3cdd5929b37b105b819fb3f30","observation_id":"c8fa7d41-df9b-48aa-b5ff-6f05e963ecee","resolution":{"observed_at":"2026-08-07T13:59:31.251492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:31.325770Z","title":"Photomaker: Customizing realistic human photos via stacked id embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.325770Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:206c67cb12c02fc4adb70efedcd6a5e8dccfd2ed46a7ff12ac45ccac453f2323","observation_id":"a965af12-e251-4d03-a94f-103a3ec054b3","resolution":{"observed_at":"2026-08-07T13:59:31.325770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17459","last_updated":"2025-04-11T12:31:07Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:23:53Z","title":"WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17459","snapshot_observed_at":"2026-08-07T13:59:31.446588Z","title":"Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.446588Z"},"links":{"cited_paper":"/paper/2411.17459","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:5aec08393909e9d467b959c46ef001c66ea2eaebfd4b6828ecf26993d09722bb","observation_id":"f70ac60e-5534-4725-a8dd-f8827e1945cd","resolution":{"observed_at":"2026-08-07T13:59:31.446588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07802","last_updated":"2025-02-04T22:03:26Z","snapshot_observed_at":"2026-08-09T11:15:01.740750Z","submitted_at":"2025-02-04T22:03:26Z","title":"Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07802","snapshot_observed_at":"2026-08-07T13:59:31.555321Z","title":"Movie weaver: Tuning-free multi-concept video personalization with anchored prompts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.555321Z"},"links":{"cited_paper":"/paper/2502.07802","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:05af86401e1f984a9536cc713077bfd29f21b6921c4fd451b752a7d6141f6051","observation_id":"cd2fdf07-8d2a-4136-9e97-f530416fa399","resolution":{"observed_at":"2026-08-07T13:59:31.555321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-07T13:59:31.643439Z","title":"Open-sora plan: Open-source large video generation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.643439Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:535b594b32ab746cc903a19300fe27d9a8ec190a068226d0c578ce55bfd94728","observation_id":"afbf14cf-615b-453b-a715-eba9e447d2ff","resolution":{"observed_at":"2026-08-07T13:59:31.643439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:31.756572Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.756572Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:6c0275887e30bb2b78a7d227a3d5051ca5d1f4daf8ec17b43586421445862267","observation_id":"646f6a09-7bce-4ea8-92fc-7faecb7daab8","resolution":{"observed_at":"2026-08-07T13:59:31.756572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:31.827870Z","title":"Stiv: Scalable text and image condi- tioned video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.827870Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:e0a1437e5a66b8addf59afcb86a447dc31cce6ea7e5777137bbf6a798c1d7147","observation_id":"35763072-1ad3-4e7f-b05d-d4b2202915bb","resolution":{"observed_at":"2026-08-07T13:59:31.827870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T13:59:31.890570Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.890570Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:939d79c008945071edc8cc4c4bfb8cb27aaad3b5126db88f67fb29eaf22c126c","observation_id":"af6623f3-3f69-48f3-a4b0-9ef802ea327f","resolution":{"observed_at":"2026-08-07T13:59:31.890570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06782","last_updated":"2025-02-12T10:07:07Z","snapshot_observed_at":"2026-08-08T14:18:27.556352Z","submitted_at":"2025-02-10T18:58:11Z","title":"Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06782","snapshot_observed_at":"2026-08-07T13:59:31.958999Z","title":"Lumina-video: Efficient and flexible video generation with multi-scale next-dit","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:31.958999Z"},"links":{"cited_paper":"/paper/2502.06782","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:d7763d2738614c9313414d3cc04f7e8fe8de5504016d036d4fc9a710828455e6","observation_id":"0f02fd0d-b56c-4bce-8c2d-c8eaff2fd744","resolution":{"observed_at":"2026-08-07T13:59:31.958999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-08T15:16:17.586525Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T13:59:32.071589Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.071589Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c91e0af18095b26a97ab86cf32d833627270515562fa9effe32074a7a82b3a8a","observation_id":"8b4584ab-6c87-4bf6-a062-9600001f2d39","resolution":{"observed_at":"2026-08-07T13:59:32.071589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T13:59:32.143783Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.143783Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:6b8b2714663ad115cdf1e14b4fd8113044a686a1c8342a6084dec0ad51bb3192","observation_id":"22e8865e-7ae2-4d68-8efe-989ccfa59e3b","resolution":{"observed_at":"2026-08-07T13:59:32.143783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:32.195883Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.195883Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:35f562cc5f59d2b559f0072e248954f61392a0183fac72d6b8e152f6bfac44a5","observation_id":"13596194-ebe1-4953-8804-bda4c428597d","resolution":{"observed_at":"2026-08-07T13:59:32.195883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:32.278537Z","title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to-video genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.278537Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:d9f58e1b2d2d0f4eb24b212865f483d42ea632a148f58de708a19e75e27f6294","observation_id":"f69d7047-7c83-44c7-b1eb-3f415ea0b1a7","resolution":{"observed_at":"2026-08-07T13:59:32.278537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-07T13:59:32.327532Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.327532Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:379599914a6b125966d83acf88d071485ee0a6a3a64d72b4a83c518cf1f84bf2","observation_id":"e992ba3e-adde-423e-a52a-b972d2a2508f","resolution":{"observed_at":"2026-08-07T13:59:32.327532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-07T13:59:32.388980Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.388980Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:9c691c688e21ed4da16d09b458717acc01ed19c1e232af2be97351f157995592","observation_id":"985742aa-2d65-40e4-9bbc-f7c3a5bba31b","resolution":{"observed_at":"2026-08-07T13:59:32.388980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03140","last_updated":"2025-07-26T15:25:22Z","snapshot_observed_at":"2026-08-07T16:10:00.610612Z","submitted_at":"2025-04-04T03:30:15Z","title":"Model Reveals What to Cache: Profiling-Based Feature Reuse for Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03140","snapshot_observed_at":"2026-08-07T13:59:32.433119Z","title":"Model reveals what to cache: Profiling-based feature reuse for video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.433119Z"},"links":{"cited_paper":"/paper/2504.03140","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:ec9a9d1e22b586b08fa40800c376f1eda404c4586eaadcd3549895fcb3d1a373","observation_id":"79dc3038-4365-4037-a938-17f2ca0da233","resolution":{"observed_at":"2026-08-07T13:59:32.433119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:32.518451Z","title":"Follow your pose: Pose-guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.518451Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:6bde66d7511ff60dd33756a183082efbc5cfca2a09a874a41130e6496dfed548","observation_id":"ddf5a28d-2ff5-4c6f-b57f-cd36ecb9604c","resolution":{"observed_at":"2026-08-07T13:59:32.518451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08268","last_updated":"2024-03-13T05:44:37Z","snapshot_observed_at":"2026-07-06T17:43:44.153710Z","submitted_at":"2024-03-13T05:44:37Z","title":"Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08268","snapshot_observed_at":"2026-08-07T13:59:32.625729Z","title":"Follow-your-click: Open-domain regional image animation via short prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.625729Z"},"links":{"cited_paper":"/paper/2403.08268","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:07721e6f4878345967906e2a281824c1a03686431ebd89149ed751ce6e00fbda","observation_id":"59b261e3-a9e1-42ac-98d1-9da35f05c4fe","resolution":{"observed_at":"2026-08-07T13:59:32.625729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01900","last_updated":"2024-06-07T02:57:36Z","snapshot_observed_at":"2026-08-07T23:04:56.801786Z","submitted_at":"2024-06-04T02:05:57Z","title":"Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01900","snapshot_observed_at":"2026-08-07T13:59:32.721019Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.721019Z"},"links":{"cited_paper":"/paper/2406.01900","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:08245109050edd4a92038d9e433ad727931b97c4be01e457dfba223f31c14f00","observation_id":"085f1cfa-a5dc-4b84-9ce5-37a9cab5b220","resolution":{"observed_at":"2026-08-07T13:59:32.721019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09368","last_updated":"2024-03-20T17:36:35Z","snapshot_observed_at":"2026-07-06T17:30:08.206972Z","submitted_at":"2024-02-14T18:13:51Z","title":"Magic-Me: Identity-Specific Video Customized Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09368","snapshot_observed_at":"2026-08-07T13:59:32.790081Z","title":"Magic-me: Identity-specific video customized diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.790081Z"},"links":{"cited_paper":"/paper/2402.09368","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:5a60e11f379cf5e9a50ebc4903fd2cd63d49ad7cb9587f5d7de239b66895e70f","observation_id":"c40ac82b-7a53-4239-94a5-0a2437246661","resolution":{"observed_at":"2026-08-07T13:59:32.790081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:32.885473Z","title":"Multi-task image classifier","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.885473Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:2645fb82d3f84e8319df2dd89a524c26e306f639410b705d9aca7bed9ab85126","observation_id":"ac1eba25-0a75-4758-af1e-bdaaab115766","resolution":{"observed_at":"2026-08-07T13:59:32.885473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-07T13:59:32.952192Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:32.952192Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:39da0fb7d207461d8ef33aaf40b68fd8bede5124848a68731cf3727337a21f9d","observation_id":"37a1e504-5fc6-457a-8d8c-cc8d9be935db","resolution":{"observed_at":"2026-08-07T13:59:32.952192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.006913Z","title":"Nyuad ai generated images detector","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.006913Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:161cacd4622ac5656deca51f4eb34f244d7c188eca76b01d6afd7c44455fc5d7","observation_id":"0cedfbba-bee5-45cd-9865-a6bc31c75e8a","resolution":{"observed_at":"2026-08-07T13:59:33.006913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00397","last_updated":"2024-11-30T08:42:13Z","snapshot_observed_at":"2026-07-06T19:59:24.405557Z","submitted_at":"2024-11-30T08:42:13Z","title":"DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D Poses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00397","snapshot_observed_at":"2026-08-07T13:59:33.042872Z","title":"Dreamdance: Animating human images by enriching 3d geometry cues from 2d poses","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.042872Z"},"links":{"cited_paper":"/paper/2412.00397","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:48b3bf11e0fe1876b709d41f205e8a541f84a92852016f531866578c3fd7e829","observation_id":"1ff826d8-9563-40d7-af7f-753049c77cbf","resolution":{"observed_at":"2026-08-07T13:59:33.042872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-02T11:33:41.662779Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-07T13:59:33.158196Z","title":"Open-sora 2.0: Training a commercial-level video generation model in 200 k","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.158196Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:b93dde0f550641077e94b0c8111be623dd3217138c54b50a6aa64d4eaed3744f","observation_id":"9f51e9bb-64fb-4fe8-bbe2-17849e2b1c54","resolution":{"observed_at":"2026-08-07T13:59:33.158196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16855","last_updated":"2025-03-09T02:57:28Z","snapshot_observed_at":"2026-08-07T22:08:49.929764Z","submitted_at":"2024-06-24T17:58:47Z","title":"DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16855","snapshot_observed_at":"2026-08-07T13:59:33.247451Z","title":"Dreambench++: A human-aligned benchmark for personalized image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.247451Z"},"links":{"cited_paper":"/paper/2406.16855","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:b899ca92b7179a9d061336d01d64fea67757abd754922f304091e3a5d4348124","observation_id":"629342a2-e5a4-4261-bff7-42711df93a9c","resolution":{"observed_at":"2026-08-07T13:59:33.247451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T13:59:33.328258Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.328258Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:8352e62f3f6c13963c2c5e47850c45b7148d02cadef91b68fb7f52a5e49e6bfa","observation_id":"4ed2f581-5ca5-4541-af1a-e79b4c95c62f","resolution":{"observed_at":"2026-08-07T13:59:33.328258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.385897Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.385897Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:dc1c07603cb41ccf61b2c39cf51972f9ad808c79c93fcdc34c592257ce6e4a87","observation_id":"39695eb0-95dd-43df-a774-b98b2a9a1723","resolution":{"observed_at":"2026-08-07T13:59:33.385897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T13:59:33.449820Z","title":"Hierarchical text-conditional image generation with clip latents, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.449820Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:c1c13b4e0abeeab62106dc088d094dd5e5bbd08bf3180843e5cf4b6f857ab942","observation_id":"80e7fd13-6dc1-40d0-8d2f-1a716c9df315","resolution":{"observed_at":"2026-08-07T13:59:33.449820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.541902Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.541902Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:bdf4628098785b46df3be0c01e6650825f233a66e5a3603b134ef66f48a0e02e","observation_id":"33f3b505-4ad7-4a06-b3fd-bcf031b21a24","resolution":{"observed_at":"2026-08-07T13:59:33.541902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T13:59:33.625427Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.625427Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:f6fc221e9af884b4f2080195223ed2dcfa8780bafd777ae37550b0928d6fce4c","observation_id":"1281ad9c-c073-4665-95da-e2ca2f3f52e2","resolution":{"observed_at":"2026-08-07T13:59:33.625427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.744844Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.744844Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:79764bb97289e938aa9dcd2b746286efb131e7944798657e59be15311ddc8fcc","observation_id":"fc7c93b7-3ee7-48ad-8d46-69a0dcb28789","resolution":{"observed_at":"2026-08-07T13:59:33.744844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.801156Z","title":"Magi-1: Autoregressive video generation at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.801156Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:91fbefa82bc837608dd5dfaf2ba9e76397b359ebc1c520db3b747b023da4b9e5","observation_id":"a2501434-08d2-465e-b527-0a1c29caccfe","resolution":{"observed_at":"2026-08-07T13:59:33.801156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-08-09T05:24:50.195241Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-07T13:59:33.869824Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.869824Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:3ab21c4eac99c70d5dda11bfde6d1e21fd1ed24b2f1d4a4e886527df0ef58f93","observation_id":"88a9b364-495f-4981-a93e-fb0067626203","resolution":{"observed_at":"2026-08-07T13:59:33.869824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:33.939322Z","title":"Dragdiffusion: Harnessing diffusion models for interactive point-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:33.939322Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:458b5364cc11757e818495c0fb118187c338f988105ce5b0a7236de655cc5338","observation_id":"a22d91a2-71e3-43d3-a74f-9fde8ace6b8c","resolution":{"observed_at":"2026-08-07T13:59:33.939322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-07T13:59:34.017512Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.017512Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:d5e03a4b7c898732a1e5d478bf5651c33867340ef50e59d1afe97ffa57032db1","observation_id":"c6fdb347-8410-49d7-a3f4-87eebfbe09c0","resolution":{"observed_at":"2026-08-07T13:59:34.017512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T13:59:34.089977Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.089977Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:bd7237f58b68dc94d4cc91a5f8027b726f99e097c9c1921aa6688245b99f3085","observation_id":"d490f859-6ccc-4e52-afd1-bf1382323b92","resolution":{"observed_at":"2026-08-07T13:59:34.089977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10306","last_updated":"2024-12-11T02:55:31Z","snapshot_observed_at":"2026-08-07T06:22:46.243818Z","submitted_at":"2024-10-14T09:06:55Z","title":"Animate-X: Universal Character Image Animation with Enhanced Motion Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10306","snapshot_observed_at":"2026-08-07T13:59:34.211475Z","title":"Animate-x: Universal character image animation with enhanced motion representation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.211475Z"},"links":{"cited_paper":"/paper/2410.10306","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:600639330aaf2a8e72ab25b2919654dfbc816a24f01673e2356c4a233c24ac88","observation_id":"b35739bc-9d62-4f04-bc2a-0f1c5a8ea958","resolution":{"observed_at":"2026-08-07T13:59:34.211475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19548","last_updated":"2024-07-28T17:58:35Z","snapshot_observed_at":"2026-08-02T09:01:31.728313Z","submitted_at":"2024-07-28T17:58:35Z","title":"Cycle3D: High-quality and Consistent Image-to-3D Generation via Generation-Reconstruction Cycle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19548","snapshot_observed_at":"2026-08-07T13:59:34.324476Z","title":"Cycle3d: High-quality and consistent image-to-3d generation via generation- reconstruction cycle","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.324476Z"},"links":{"cited_paper":"/paper/2407.19548","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:93bdcf664e182d94085becb401cdaf2bbdb1c0bdeb070453826bde3d97261125","observation_id":"cc4fa633-46fd-49cd-8158-098ff232e83d","resolution":{"observed_at":"2026-08-07T13:59:34.324476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T13:59:34.446500Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.446500Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:3a05f110912b9a67445c98e55a4a5d600f6e2ca1d1d0c1b464a9000ce17e9468","observation_id":"71052253-bbdd-4a14-ae89-66771b695258","resolution":{"observed_at":"2026-08-07T13:59:34.446500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:34.550294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.550294Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:fe550f7f7f8493b146ccaf0fdd2381cc6304384338b28e90ba03f08e75914aba","observation_id":"c79d273d-30ad-4186-bafe-ebb6ac539c9f","resolution":{"observed_at":"2026-08-07T13:59:34.550294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:34.646831Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.646831Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:8140b3a18754b3e51afd4d301e8daa95524015f3daf7243f1cc4ad08b249eb0f","observation_id":"3e55a3bf-075d-4375-a7ec-717765318ab1","resolution":{"observed_at":"2026-08-07T13:59:34.646831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:34.766190Z","title":"Paddleocr","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.766190Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:3a362f6686c0ddb2281245ee9f3bac4999d1e44fe88e53c00a948c5551fc852d","observation_id":"6f59a7a3-5f8d-48b7-b9e1-e0984804100c","resolution":{"observed_at":"2026-08-07T13:59:34.766190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T13:59:34.883459Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.883459Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:2ae38ac611f1cabf3ea9b74dc133db2b46a6c68e8b4a80cad282b87b87e48907","observation_id":"fa802251-b8ba-4cdf-a54d-ce8af139e7e7","resolution":{"observed_at":"2026-08-07T13:59:34.883459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:59:34.953854Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:34.953854Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:ff3bc952c2581567f53a794618502067de690663318d2325c8154a2cc1164ced","observation_id":"6e3c765a-189b-4dfd-b82d-eaca53f409bd","resolution":{"observed_at":"2026-08-07T13:59:34.953854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-01T11:16:30.883699Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-07T13:59:35.043662Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.043662Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:a0b435f4ea70d5644a6a13ee8d6a4a53858fd615ad331f395faa648e39f174bb","observation_id":"42a426d6-43e7-472f-a8c0-8647655e4834","resolution":{"observed_at":"2026-08-07T13:59:35.043662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-07T13:59:35.115504Z","title":"Instantid: Zero-shot identity-preserving generation in seconds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.115504Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:b04fcd87f808726953f0a691d8fa2aaf08a1894ef8fb118af8afdbaa100e452d","observation_id":"956c6d0d-814c-4d06-b946-94e4a5fb6d59","resolution":{"observed_at":"2026-08-07T13:59:35.115504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06098","last_updated":"2024-09-30T06:51:55Z","snapshot_observed_at":"2026-07-06T17:42:08.056523Z","submitted_at":"2024-03-10T05:40:12Z","title":"VidProM: A Million-scale Real Prompt-Gallery Dataset for Text-to-Video Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06098","snapshot_observed_at":"2026-08-07T13:59:35.179016Z","title":"Vidprom: A million-scale real prompt-gallery dataset for text-to- video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.179016Z"},"links":{"cited_paper":"/paper/2403.06098","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:3ab401ea1da459e9c47f660b95ac4e713aca1ae6c40e4bf7ae7907c28413ac03","observation_id":"4fd5de33-cbb1-4744-9e07-f6a94bc67674","resolution":{"observed_at":"2026-08-07T13:59:35.179016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10874","last_updated":"2024-04-24T11:22:00Z","snapshot_observed_at":"2026-08-08T15:15:33.423007Z","submitted_at":"2023-05-18T11:06:15Z","title":"Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10874","snapshot_observed_at":"2026-08-07T13:59:35.266101Z","title":"Videofactory: Swap attention in spatiotemporal diffusions for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.266101Z"},"links":{"cited_paper":"/paper/2305.10874","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:40407b570fa3d915d8704952cd7bde0183e4693cb648e10bde7e4baf650d3bef","observation_id":"c5788791-343a-4a42-b610-91b72e515481","resolution":{"observed_at":"2026-08-07T13:59:35.266101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T13:59:35.298215Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.298215Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:d57f690d828f3f8bee5aa754014ce45090e8f2c610bc4ca38bc36f60ef18761b","observation_id":"8daffc84-86b1-4a83-8ec4-10a2186913ec","resolution":{"observed_at":"2026-08-07T13:59:35.298215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16211","last_updated":"2024-12-17T23:00:42Z","snapshot_observed_at":"2026-07-06T20:11:11.053567Z","submitted_at":"2024-12-17T23:00:42Z","title":"Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16211","snapshot_observed_at":"2026-08-07T13:59:35.359517Z","title":"Is your world simulator a good story presenter? a consecutive events-based benchmark for future long video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.359517Z"},"links":{"cited_paper":"/paper/2412.16211","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:0847667a30491b1c5aa502fc7ef1169252708f7d693549e5ab5d0ab09ab5f383","observation_id":"27bd54d9-7a9b-4961-a550-0366d6b1b154","resolution":{"observed_at":"2026-08-07T13:59:35.359517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13452","last_updated":"2025-02-27T06:55:41Z","snapshot_observed_at":"2026-07-06T20:24:50.262766Z","submitted_at":"2025-01-23T08:06:11Z","title":"EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13452","snapshot_observed_at":"2026-08-07T13:59:35.395109Z","title":"Echovideo: Identity-preserving human video generation by multimodal feature fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.395109Z"},"links":{"cited_paper":"/paper/2501.13452","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:1a5a41f2f61c8a436be5e99b3545944bd953dbe3076e41a0f7f9dcef5d40a980","observation_id":"2e7d5a2d-e248-40f9-abe4-65937c05c91b","resolution":{"observed_at":"2026-08-07T13:59:35.395109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:35.430457Z","title":"Dreamvideo: Composing your dream videos with customized subject and motion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.430457Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:f421a442479072a0d43720c04cee0e3a246ab8bc93d8dad6682ab447188e9f46","observation_id":"7119b8e0-fdfa-4aae-aab3-d8766f96a204","resolution":{"observed_at":"2026-08-07T13:59:35.430457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:59:35.489028Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.489028Z"},"links":{"citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:3ad5ec4c3f45e024a2e45ea65f8469409645621bc3a9272f5941f9a59e4635e1","observation_id":"e1b967fb-9f0c-44cd-b544-e8908a293dc7","resolution":{"observed_at":"2026-08-07T13:59:35.489028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-07-06T17:15:42.343063Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-07T13:59:35.615058Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.615058Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:e50952cd435bb5bf9a6fc4320447f7d77c8595d81da4884d777d535b1ba5450d","observation_id":"c48c9115-7c42-4700-92cb-3b8a15840695","resolution":{"observed_at":"2026-08-07T13:59:35.615058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-07T13:59:35.677086Z","title":"Motionbooth: Motion-aware customized text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:35.677086Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:7a2e0096e54afe80dd3cea45829280df849b4a182cbe5b43577a01baa4d51de3","observation_id":"0b5ae721-ba87-40ff-bab8-71e9c71c1738","resolution":{"observed_at":"2026-08-07T13:59:35.677086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":130},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 130 outbound references and 22 inbound Pith citation observations for arXiv:2505.20292."}