{"as_of":"2026-08-14T07:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bdbaa86e9e2e5fa77bd2a5dd26ce1edf6acf0da46db3f9b455415bb9941a262b","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:56:59.884771Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T07:59:49.398271Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T08:02:10.321954Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"cited_work":{"arxiv_id":"2412.10533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10533","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sugar: Subject-driven video customization in a zero-shot manner","venue":null,"work_id":"3ed6569e-1ce2-49ae-a8d4-247f85be8cc1","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2412.10533","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:1cf3a6fa10cc379cbb8c678481f0461cd390514c688cbf707ecaf8e5294d66e1","observation_id":"4fa29253-1ce0-4f96-9a5e-93e646f1a396","resolution":{"observed_at":"2026-05-19T08:02:10.325181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10533/citation-record","integrity":"/paper/2412.10533/integrity","json":"/paper/2412.10533/citation-record.json","paper":"/paper/2412.10533"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.708772Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.708772Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:267c79846ab3ce8a3d012cb7a3bafb41f639d97c07ac8c191f35378c183901de","observation_id":"59bbd1ae-a2aa-4e20-a7d3-d2373a329493","resolution":{"observed_at":"2026-08-11T15:56:59.708772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-13T00:13:12.479004Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-11T15:56:59.712836Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.712836Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:7940ee0a653d791d523c8057818e93f48e667cc23a6ab67959a9fe2af12d8ec9","observation_id":"2da0f429-201e-4bbc-b52f-3584b8011976","resolution":{"observed_at":"2026-08-11T15:56:59.712836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T15:56:59.716910Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.716910Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:7e28251c68a645ab7144dcefe9157a064a6d802d5ceadddef707aa544a5f9f38","observation_id":"47ccf589-3e8c-4a81-a250-70e485f63dcb","resolution":{"observed_at":"2026-08-11T15:56:59.716910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.383371Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"3a76d7cb-03e0-4a88-9cba-7e8e09613f0c","year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.721156Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:f2af2675143796aa6f73cb4c9b5cd79d8c7bcb32a2b7fd6a3b192deb3d41d95d","observation_id":"a36975d0-24fe-4705-82b5-f943b630e39b","resolution":{"observed_at":"2026-08-11T15:57:00.386952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.724691Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.724691Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:b4333dd29f37bb93add12f65ad47691ecafc3aa49c5c9e54f51098321ae749b9","observation_id":"39352f1e-6020-4f50-93e1-e8d983bde9e4","resolution":{"observed_at":"2026-08-11T15:56:59.724691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.728227Z","title":"Video generation models as world simulators,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.728227Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:3af8d666842bfbe4c5aa282fe8181559897848d5f5b3d2eba763876b260f5c1f","observation_id":"0c507006-2423-4db7-a323-9863727f7743","resolution":{"observed_at":"2026-08-11T15:56:59.728227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.360128Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"c79d848e-b7a6-419b-9708-126447f94dc0","year":2021},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.731701Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:69f4ed32a62ceceb2d12901e84c97ab492c8d7af83e1a9acdab60203aae14cd9","observation_id":"19a02f93-75f1-43c3-a073-e295672d3991","resolution":{"observed_at":"2026-08-11T15:57:00.363853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.348747Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers, 2024","venue":null,"work_id":"3856f44e-442c-42f5-8be9-e0ce81958a4e","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.735334Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:ce67c0d08c7cb8b2eb97141383640ee68bb2e4b86ed78bfc11d192aa76c43144","observation_id":"b90e1452-3a61-48ec-8aca-a7dcaaf71de6","resolution":{"observed_at":"2026-08-11T15:57:00.352581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00186","last_updated":"2023-10-02T08:08:45Z","snapshot_observed_at":"2026-08-13T12:11:58.184444Z","submitted_at":"2023-04-01T00:47:35Z","title":"Subject-driven Text-to-Image Generation via Apprenticeship Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00186","snapshot_observed_at":"2026-08-11T15:56:59.739929Z","title":"Subject-driven text-to-image generation via apprenticeship learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.739929Z"},"links":{"cited_paper":"/paper/2304.00186","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:6ebdc63ba5d48d62a965bdd5b86de07a5b2f9216b27ef227af74521ade9022ee","observation_id":"1ad3085a-95b8-41f1-b6ef-dbf825b5011b","resolution":{"observed_at":"2026-08-11T15:56:59.739929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-13T10:53:07.664749Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-11T15:56:59.743465Z","title":"Anydoor: Zero-shot object-level im- age customization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.743465Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:17cbac1c88553ac61745d589660333a1e319ea90965834e75464f049263f20a8","observation_id":"de93377e-56ca-4595-afec-b447c7392da1","resolution":{"observed_at":"2026-08-11T15:56:59.743465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.747211Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.747211Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:43984f732829830569247d1a906b34ea2e1c808cd176c813f81356645df8158e","observation_id":"98d16545-fab3-48ce-9904-a5a0de3c467c","resolution":{"observed_at":"2026-08-11T15:56:59.747211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.330184Z","title":"An image is worth one word: Personalizing text-to-image gener- ation using textual inversion","venue":null,"work_id":"04f8f67e-4ec5-4113-8cbe-69480e2bad61","year":2022},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.750662Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:188374c72364a091f426124c11261d35a6600558a8d589c8e2eb4b30c24f871c","observation_id":"b9daad35-7f56-459e-83d2-4af4696b8dda","resolution":{"observed_at":"2026-08-11T15:57:00.334812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.319699Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"a996abe7-5636-4681-90c4-b6fb6c4518e3","year":2025},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.753971Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:61d36198f4c8ca6229899862f30a619bed844f65f25b86ccd7a25f6c5280dd46","observation_id":"1c6d2022-1679-4b6c-ad95-00f8dd4db59d","resolution":{"observed_at":"2026-08-11T15:57:00.323368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.757231Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.757231Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:d1f5a5a4644f39648bc0705987f11be3a4c00363ed109240677e1a0e7184737e","observation_id":"1a2aa6c9-2160-4eae-9379-631fb3845d01","resolution":{"observed_at":"2026-08-11T15:56:59.757231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T15:56:59.760051Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.760051Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:896f6d12e0186caa24c3e7b06730e3e9c2f6cf5b21a2c79814878534e1df87f6","observation_id":"87563d6d-011a-4ccf-b66f-8fceb9f4dd53","resolution":{"observed_at":"2026-08-11T15:56:59.760051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.763446Z","title":"Vbench: Com- prehensive benchmark suite for video generative models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.763446Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:97296b63cff43fb4a6c80d3417a69427adf59b983b337ebcb95573121cff6626","observation_id":"c5225c12-bf47-4636-b644-ba3ba1acf683","resolution":{"observed_at":"2026-08-11T15:56:59.763446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.296614Z","title":"Videobooth: Diffusion-based video generation with image prompts","venue":null,"work_id":"7712953d-3a7b-497e-9c5e-0d0ec0c4b521","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.766888Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:cde13b0bb7b9fb6130aaf160887da99a1b6622101cb5da4e38061441e9451906","observation_id":"6448f32a-29d8-44cf-a834-14cb6e323c87","resolution":{"observed_at":"2026-08-11T15:57:00.300238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T15:56:59.769753Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.769753Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:91511a81918007e298733c8c11ff6a9837b2b455ec10109e9e43129b15cc7b43","observation_id":"9b7c4109-6273-4269-836a-ad3c8baaf761","resolution":{"observed_at":"2026-08-11T15:56:59.769753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-11T15:56:59.773238Z","title":"Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.773238Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:829f31bd5efdae825f97f49a716ea1bd6573bf0344a878eb788678c29697c624","observation_id":"50558660-b6e4-4882-ba4c-733cb2f67264","resolution":{"observed_at":"2026-08-11T15:56:59.773238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04488","last_updated":"2023-06-20T16:26:38Z","snapshot_observed_at":"2026-08-13T13:25:07.940727Z","submitted_at":"2022-12-08T18:57:02Z","title":"Multi-Concept Customization of Text-to-Image Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04488","snapshot_observed_at":"2026-08-11T15:56:59.776657Z","title":"Multi-concept customization of text-to-image diffusion.arXiv preprint arXiv:2212.04488,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.776657Z"},"links":{"cited_paper":"/paper/2212.04488","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:2ff9e78c29c76a83da11d7041de0f2ebc97802ef47e93e29f206ce76d85076cd","observation_id":"633e40d1-d54a-4ff4-9af5-814284aae0de","resolution":{"observed_at":"2026-08-11T15:56:59.776657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.286211Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":"a0141b76-8b64-4dd9-9954-e47bc7512867","year":1931},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.780665Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:5bb74df5a55f30cf6c28bf51f85bd0cd473846fa5023e8f0babfd351a8b9d1f1","observation_id":"6f922097-c920-4097-bf7d-78921a88ae39","resolution":{"observed_at":"2026-08-11T15:57:00.289833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.784156Z","title":"Flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.784156Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:a1c0993459b0493e84b5cb775f0641f3e61a6efc61ef73941d184498c1ee48da","observation_id":"d11d5300-00fa-4a67-be32-82579b415bdd","resolution":{"observed_at":"2026-08-11T15:56:59.784156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.268478Z","title":"Luma dream machine, 2024","venue":null,"work_id":"c1878f19-dcf4-4804-a822-72a459dfeafb","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.787688Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:be0c60a9c3c1d8c090fb4ce4b8ffe9b05bf9141da703d036825a50421b8df31f","observation_id":"d95009a3-d759-4854-8e37-0299f77eafaa","resolution":{"observed_at":"2026-08-11T15:57:00.272606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11410","last_updated":"2024-05-19T01:40:39Z","snapshot_observed_at":"2026-08-13T10:50:38.428912Z","submitted_at":"2023-07-21T08:09:47Z","title":"Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11410","snapshot_observed_at":"2026-08-11T15:56:59.791130Z","title":"Subject-diffusion: Open domain personalized text-to-image generation without test-time fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.791130Z"},"links":{"cited_paper":"/paper/2307.11410","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:a7d649ee7c62e8692e6761991e426acf6ed9f9585cab29864b80c1bd37a5654e","observation_id":"e1e03782-b62d-45ab-b5e6-2e7bb7fc09c9","resolution":{"observed_at":"2026-08-11T15:56:59.791130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.257843Z","title":"Dinov2: Learning robust visual features with- out supervision, 2024","venue":null,"work_id":"bb815dfe-ac96-4ae0-9fd9-c457900a72ff","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.794848Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:1f7ca41e3a258a2c839418f24337056d19bc9157db47982f2083dc807a9c7caf","observation_id":"d6e1cda3-4448-4b27-a6da-8eb19ecb3b51","resolution":{"observed_at":"2026-08-11T15:57:00.261606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-08-14T05:24:22.878604Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-11T15:56:59.798517Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.798517Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:912d587ec45a64fb54f17103bb69f42d8198fdcffa99d7ff39ff09db6a44839c","observation_id":"4b479e08-728f-4663-b945-eddc8005300b","resolution":{"observed_at":"2026-08-11T15:56:59.798517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.247147Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"77fffbf0-b4ff-4fb0-8de7-7efe75599635","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.802465Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:e975ef5bc93f911dc11d1bdc9e13767d41e51bf1a70667f87341276e8e5625cb","observation_id":"40c450c9-ddfe-44be-afe6-d3d52000a588","resolution":{"observed_at":"2026-08-11T15:57:00.250736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-13T11:35:08.107504Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-11T15:56:59.806149Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.806149Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:97b87d89aa01780e935a0583b049da9e2a6b137a69f95b4336f502bcae1d74dc","observation_id":"5e08c81f-3c88-4e61-860c-d37d401936bd","resolution":{"observed_at":"2026-08-11T15:56:59.806149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.236717Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"5095c2e7-3728-4c46-b965-95e350074557","year":2021},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.810182Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:1f31244df78ed6347765d0b1967dfefc8ce9f0f04d5a2d7571ee15dff5c7e414","observation_id":"158342f1-584f-4a33-843f-9cb45ecf18c3","resolution":{"observed_at":"2026-08-11T15:57:00.240382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.226811Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"02f7fe65-fbfa-4846-886b-d3cf13ed792c","year":2021},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.813440Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:fa965f973c29eeaf1f3e7b15e116c027d8965d0055bbf7a2a897593f963dfa5e","observation_id":"b73b69ad-680a-4ed4-9775-650c7037ff28","resolution":{"observed_at":"2026-08-11T15:57:00.230002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.816893Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.816893Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:ab7590826951cc4951f0cb97e481a73daad53097323c4b401550df3fe8b99ede","observation_id":"559d896d-e333-4552-ba5c-dea380914e72","resolution":{"observed_at":"2026-08-11T15:56:59.816893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.820341Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.820341Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:92769cdac85c6a87d9d51b5afa389599ec5557b4a418e2031b5ece7c0c986463","observation_id":"8a12b6b9-2fdc-411d-8db7-aa32eda2861e","resolution":{"observed_at":"2026-08-11T15:56:59.820341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.204591Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"4b676510-59ea-492e-8738-b7db09606779","year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.823699Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:df3581dfb4efbf029eb978bac330e072a0c2e04e56994691b020776b25662316","observation_id":"a8414ba3-8c42-49b0-b472-3d24bee5d2c6","resolution":{"observed_at":"2026-08-11T15:57:00.207888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.195405Z","title":"Gen-3 alpha, 2024","venue":null,"work_id":"d9f292d5-9f27-4167-bac2-2e2d8ab5eeb7","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.827139Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:52f37916a287fe38eb80fd4c215aa5bf2036d73545388c572c8608cefd97ee21","observation_id":"21ce158a-a063-4d99-b97b-da9aa34c843b","resolution":{"observed_at":"2026-08-11T15:57:00.198475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.830494Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.830494Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:72adb7694cbdc7f9c64009bc6e63e58290df3a8e14ce0430919c106db59f0a2a","observation_id":"5491f2eb-6d4a-4dbb-bd1b-04c6b0d53833","resolution":{"observed_at":"2026-08-11T15:56:59.830494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03411","last_updated":"2023-04-06T23:26:38Z","snapshot_observed_at":"2026-08-13T12:07:41.674782Z","submitted_at":"2023-04-06T23:26:38Z","title":"InstantBooth: Personalized Text-to-Image Generation without Test-Time Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03411","snapshot_observed_at":"2026-08-11T15:56:59.834021Z","title":"Instant- booth: Personalized text-to-image generation without test- time finetuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.834021Z"},"links":{"cited_paper":"/paper/2304.03411","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:428f9eb42953d6487a15c3ce7218abb19ccebc9d1f415ffd4d4480636beb4214","observation_id":"db47afd9-34be-4b37-9adb-275cf0cb64e5","resolution":{"observed_at":"2026-08-11T15:56:59.834021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.178484Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"62009d82-d930-4438-a4ac-14b7ea034e70","year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.837693Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:c102daa4a9ec8dfbbf4804f04c61b2399cfee68536ee7ee66dbfaeb61bc5d7c9","observation_id":"2571f636-ea87-4d93-a27c-5cc3282ffd47","resolution":{"observed_at":"2026-08-11T15:57:00.182057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.168543Z","title":"Vidu-1.5, 2024","venue":null,"work_id":"4baaa741-7921-4e09-92c6-82ac43cfcd48","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.841160Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:fa9e8dda82a0e0a014ce1f8760b39e19426212831b884f4637b2d6f0a780d0f8","observation_id":"140dc4fc-bdbf-4cee-8409-0842352a484e","resolution":{"observed_at":"2026-08-11T15:57:00.171942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.844534Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.844534Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:bae50275d046efc5386d841698b5b8b7e05216e9700311e13c000d8232a184a3","observation_id":"74d9c82e-6976-4601-90e8-36461d81ec3a","resolution":{"observed_at":"2026-08-11T15:56:59.844534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T15:56:59.847951Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.847951Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:fb01fcc69131b355bf57abcec0910881a156cf68caacf45ffd7298a0f1ad3f79","observation_id":"b31fab30-08df-4b24-a023-d72695fb7a04","resolution":{"observed_at":"2026-08-11T15:56:59.847951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-13T10:04:30.993324Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-11T15:56:59.851385Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.851385Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:af8a52209451fa5da4eabcafa08653a58080294d2a6c4e8bba50a357842f7ecd","observation_id":"8cbef5c0-658a-4364-9608-70e79551bd21","resolution":{"observed_at":"2026-08-11T15:56:59.851385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.151551Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"d185a7fc-cb47-432e-bdab-83f582a3e597","year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.854770Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:2b6456c912026838dbf6d5010e12a3020f5667804876ef70d2b363a4e593735f","observation_id":"2773f20a-be5a-40e7-b5f4-45f16055ae43","resolution":{"observed_at":"2026-08-11T15:57:00.155337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13848","last_updated":"2023-08-18T17:12:13Z","snapshot_observed_at":"2026-08-13T18:29:32.530761Z","submitted_at":"2023-02-27T14:49:53Z","title":"ELITE: Encoding Visual Concepts into Textual Embeddings for Customized Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13848","snapshot_observed_at":"2026-08-11T15:56:59.857766Z","title":"Elite: Encoding visual con- cepts into textual embeddings for customized text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.857766Z"},"links":{"cited_paper":"/paper/2302.13848","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:c19f3e227fea9248398e3417a987d430eb375d28ee8b87b3a77d25c969db8a1a","observation_id":"db47e8a1-1982-4929-bca5-aa81b5b3b573","resolution":{"observed_at":"2026-08-11T15:56:59.857766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.140568Z","title":"Dreamvideo: Composing your dream videos with customized subject and motion","venue":null,"work_id":"c12cc9bb-c658-40de-a5a0-7e6142908948","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.861277Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:197b9fb2052fd3ed44e154e39fadcbacba87b5d76da5c703919093cec8b9822c","observation_id":"aca6d5a6-5ab2-4d32-9675-11172a53646f","resolution":{"observed_at":"2026-08-11T15:57:00.144278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13830","last_updated":"2024-10-17T17:52:57Z","snapshot_observed_at":"2026-08-12T22:20:40.577542Z","submitted_at":"2024-10-17T17:52:57Z","title":"DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13830","snapshot_observed_at":"2026-08-11T15:56:59.864206Z","title":"Dreamvideo-2: Zero-shot subject- driven video customization with precise motion control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.864206Z"},"links":{"cited_paper":"/paper/2410.13830","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:f8fe5dd897f5806f11b75279d89b110e89e91f64c1c8b8d76a2179f917171f0e","observation_id":"c9b27005-25cd-49eb-8902-43ac6720a73d","resolution":{"observed_at":"2026-08-11T15:56:59.864206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:56:59.867818Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.867818Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:a245bd807b6f01942972e3521f11f6cab91adbc2fd2c275f066c5fbe02bdc4d7","observation_id":"5621611e-500a-407e-ae53-d9bc6eaf7c1a","resolution":{"observed_at":"2026-08-11T15:56:59.867818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-08-13T05:46:49.160520Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-08-11T15:56:59.870792Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.870792Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:901127a52b5b983f893473ea153c9f56fba75f9d2bd5ed45ab26e6e47fc1bbe6","observation_id":"e5ab495c-cb78-4a2b-9de3-372923b1b56c","resolution":{"observed_at":"2026-08-11T15:56:59.870792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T15:56:59.874312Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.874312Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:1b79635b4f5f94a1fe37153cffae32d82c63c381f552b88c48a3512e820b5f8d","observation_id":"4f4d8f0a-e63a-4cdb-ba46-260d45622ead","resolution":{"observed_at":"2026-08-11T15:56:59.874312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13579","last_updated":"2023-05-23T01:14:53Z","snapshot_observed_at":"2026-08-13T11:36:43.754155Z","submitted_at":"2023-05-23T01:14:53Z","title":"Enhancing Detail Preservation for Customized Text-to-Image Generation: A Regularization-Free Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13579","snapshot_observed_at":"2026-08-11T15:56:59.877924Z","title":"Enhanc- ing detail preservation for customized text-to-image gen- eration: A regularization-free approach","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.877924Z"},"links":{"cited_paper":"/paper/2305.13579","citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:a7397fe0513deee6592b8577d2450525054f7af3d8ba8628fb40088c6fe02195","observation_id":"1e2374a1-e3d0-4798-a079-795cecbda668","resolution":{"observed_at":"2026-08-11T15:56:59.877924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.123664Z","title":"Cus- tomization assistant for text-to-image generation","venue":null,"work_id":"4095336d-61b1-47bf-9004-c926364bb53a","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.881408Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:696b2174d1271398c1d9e56c060dec4ccaaa58e16ea2e20dc96655214c8edbeb","observation_id":"3a35599c-b16c-48cb-aa01-978009ec18a0","resolution":{"observed_at":"2026-08-11T15:57:00.127398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:57:00.110687Z","title":"pencil drawing drawn by a hand","venue":null,"work_id":"cfb024ad-8e8b-440a-aef1-01c4c29c5fa3","year":2024},"citing_paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:59.884771Z"},"links":{"citing_paper":"/paper/2412.10533"},"observation_digest":"sha256:997b8c0688f4bfe9339094beb9be097487b3430d79578b06d5e322e6e653113b","observation_id":"0690ad41-8ad0-4b17-a153-70a55b4b9120","resolution":{"observed_at":"2026-08-11T15:57:00.116346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.10533","last_updated":"2024-12-13T20:01:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T17:54:23.699558Z","submitted_at":"2024-12-13T20:01:51Z","title":"SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2412.10533."}