{"as_of":"2026-08-19T02:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4da4550bd6d8f68ed26c85daf79ebd598e0305c3609b82082d777db20d94de3b","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:34:11.937640Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:40:11.028853Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T04:50:21.420628Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01427","snapshot_observed_at":"2026-08-07T11:40:11.028853Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01801","last_updated":"2025-06-02T15:42:06Z","snapshot_observed_at":"2026-08-17T06:53:13.203522Z","submitted_at":"2025-06-02T15:42:06Z","title":"OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.028853Z"},"links":{"cited_paper":"/paper/2501.01427","citing_paper":"/paper/2506.01801"},"observation_digest":"sha256:b149bfeee14245c4f08955cfa59c318f9b569503bd460291205848e7492abf5d","observation_id":"34f7f8fc-495d-4c0e-811b-700ac56c281a","resolution":{"observed_at":"2026-08-07T11:40:11.028853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01427","snapshot_observed_at":"2026-08-07T10:51:42.902061Z","title":"Videoany- door: High-fidelity video object insertion with precise motion control.arXiv preprint arXiv:2501.01427, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04216","last_updated":"2025-06-04T17:57:43Z","snapshot_observed_at":"2026-08-17T15:59:48.747710Z","submitted_at":"2025-06-04T17:57:43Z","title":"UNIC: Unified In-Context Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:51:42.902061Z"},"links":{"cited_paper":"/paper/2501.01427","citing_paper":"/paper/2506.04216"},"observation_digest":"sha256:508ffdead6cd1f4e0b4b31b5e8a30187527e029263202805f7ebfbb13bc834f1","observation_id":"a4a43647-10bc-4046-bb08-15728a47768a","resolution":{"observed_at":"2026-08-07T10:51:42.902061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01427","snapshot_observed_at":"2026-08-05T12:27:35.467169Z","title":"Videoanydoor: High-fidelity video ob- ject insertion with precise motion control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01596","last_updated":"2025-09-01T16:29:39Z","snapshot_observed_at":"2026-08-08T15:15:29.549875Z","submitted_at":"2025-09-01T16:29:39Z","title":"O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:35.467169Z"},"links":{"cited_paper":"/paper/2501.01427","citing_paper":"/paper/2509.01596"},"observation_digest":"sha256:d799e74f1536cec9d7fbe28f6ce63f87f565cca15ec9a00a4e06604642f84196","observation_id":"09d6f6fb-0c56-41b0-aef6-97783641af11","resolution":{"observed_at":"2026-08-05T12:27:35.467169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"cited_work":{"arxiv_id":"2501.01427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01427","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","venue":null,"work_id":"e13382a8-331c-4a99-b569-1be21abcf124","year":2025},"citing_paper":{"arxiv_id":"2509.04434","last_updated":"2026-04-06T12:49:32Z","snapshot_observed_at":"2026-08-15T11:14:58.284840Z","submitted_at":"2025-09-04T17:53:03Z","title":"Durian: Dual Reference Image-Guided Portrait Animation with Attribute Transfer","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T18:36:03.018873Z"},"links":{"cited_paper":"/paper/2501.01427","citing_paper":"/paper/2509.04434"},"observation_digest":"sha256:b89d6105f29a9820f95b50c3bfc2a502265bf753801e895feebca72d09caa8aa","observation_id":"67791fdc-e535-4b24-872b-76b2d53c339e","resolution":{"observed_at":"2026-05-18T18:36:44.017328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"cited_work":{"arxiv_id":"2501.01427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01427","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","venue":null,"work_id":"e13382a8-331c-4a99-b569-1be21abcf124","year":2025},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-08-16T13:46:44.223453Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2501.01427","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:10f1d0fa5bb4291c217a0f00e14d345873fb72b7f9cb110f6979326080a8b5eb","observation_id":"3e82e298-36cc-4a5e-a4e4-dc517c089e21","resolution":{"observed_at":"2026-05-11T11:11:03.586351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"cited_work":{"arxiv_id":"2501.01427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01427","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","venue":null,"work_id":"e13382a8-331c-4a99-b569-1be21abcf124","year":2025},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-11T15:47:39.031148Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2501.01427","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:bce71a9fd17cffbf748233141674491282c77f6c540802f99f2861211e9f615c","observation_id":"d545aff9-9179-4a9a-936d-54882d989ab8","resolution":{"observed_at":"2026-05-12T11:01:31.496416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"cited_work":{"arxiv_id":"2501.01427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01427","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","venue":null,"work_id":"e13382a8-331c-4a99-b569-1be21abcf124","year":2025},"citing_paper":{"arxiv_id":"2605.23245","last_updated":"2026-05-22T05:28:56Z","snapshot_observed_at":"2026-08-18T17:22:42.074754Z","submitted_at":"2026-05-22T05:28:56Z","title":"SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T04:46:50.749223Z"},"links":{"cited_paper":"/paper/2501.01427","citing_paper":"/paper/2605.23245"},"observation_digest":"sha256:596999f2a58b664badc5e2884fbd2a49abaa3a0fe7da5912a422eb050ac4f2d2","observation_id":"6851de04-5895-498d-a226-4861879ea9cd","resolution":{"observed_at":"2026-05-25T04:50:21.424085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01427/citation-record","integrity":"/paper/2501.01427/integrity","json":"/paper/2501.01427/citation-record.json","paper":"/paper/2501.01427"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.738575Z","title":"Video generation models as world simulators","venue":null,"work_id":"5421f8db-3981-4850-a682-c4b96129e77d","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.568115Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:1e7c4ced3819a4136383ea079764a956c0552830d9aa462b65b99d9c8309b8ba","observation_id":"cda8aabf-5981-446b-b5eb-67244289d288","resolution":{"observed_at":"2026-08-10T22:34:12.743878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.725434Z","title":null,"venue":null,"work_id":"55c374e5-c543-4212-a64b-8d3470ca9384","year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.573560Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:ee25fbf91c8f66f098a501a526db9ceb8e84be1145f1660162d68e4762e4a1f0","observation_id":"60660e59-0083-4dfa-ad40-2ad2a13cb8f5","resolution":{"observed_at":"2026-08-10T22:34:12.729979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.710238Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"50c1bcf0-3313-4cfd-bb1c-aae1107bfae8","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.577667Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:55c33ddda4e9831ce4d82f3c409040265cc4800da3599f75ac6eace391bdcf1c","observation_id":"da1175b1-1e5f-4f81-b9cf-aad4ed7c6e9b","resolution":{"observed_at":"2026-08-10T22:34:12.715405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.694871Z","title":"Anydoor: Zero-shot object-level im- age customization","venue":null,"work_id":"b0eea750-efd4-4ba4-8931-e87e81bfc29d","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.582016Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:2f7d535df7609fa53c6dd712eb57bca74d92fda9b339441aa4035b0a40e8ccca","observation_id":"b6e6ad9e-9fdf-47b2-b52a-755e591cee1f","resolution":{"observed_at":"2026-08-10T22:34:12.699867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.678743Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"b20034d0-ad22-4617-bf9a-3022824df106","year":2021},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.586408Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:4b7406b46e4d4ae8d60865cfa8df87988fd3defba391675319c4bbfb6719b1aa","observation_id":"0a8dd8dd-8b05-44a4-b011-55188da4e1ed","resolution":{"observed_at":"2026-08-10T22:34:12.684985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.661827Z","title":"MOSE: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":"e94c584e-4087-4bb1-b16a-20448827cb4a","year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.591184Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:6c90b1fd82997fa6d446b950abee25cb2967f1e0e6140e050f44c6a1fe892e9b","observation_id":"195201ee-0812-4232-9dea-d777359f4dcc","resolution":{"observed_at":"2026-08-10T22:34:12.666628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11661","last_updated":"2021-11-01T20:29:42Z","snapshot_observed_at":"2026-08-18T10:48:19.240616Z","submitted_at":"2021-10-22T08:39:02Z","title":"UVO Challenge on Video-based Open-World Segmentation 2021: 1st Place Solution","version":2},"cited_work":{"arxiv_id":"2110.11661","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.11661","snapshot_observed_at":"2026-08-10T22:34:12.250701Z","title":"UVO Challenge on Video-based Open-World Segmentation 2021: 1st Place Solution","venue":"cs.CV","work_id":"db0bd22b-d61e-4d40-b69c-d7dbff0716a0","year":2021},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.595100Z"},"links":{"cited_paper":"/paper/2110.11661","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:61794fb83fbab270bf9c58855dfe7cb74471599a4300b9ecda3e7ce71dcfd3b8","observation_id":"9edd5551-1e7f-4aaf-a0b6-e05f06ff2304","resolution":{"observed_at":"2026-08-10T22:34:12.257287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11794","last_updated":"2024-05-28T04:08:09Z","snapshot_observed_at":"2026-08-16T13:51:25.943279Z","submitted_at":"2024-05-20T05:28:22Z","title":"ViViD: Video Virtual Try-on using Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11794","snapshot_observed_at":"2026-08-10T22:34:11.601738Z","title":"Vivid: Video virtual try-on using diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.601738Z"},"links":{"cited_paper":"/paper/2405.11794","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:c50865ce61bd7649713f93975452e1db0a5b349ebea13546f60042da1451d2e5","observation_id":"3bca78bf-d91a-48cb-be93-7878b435623e","resolution":{"observed_at":"2026-08-10T22:34:11.601738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.645891Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":"1d3486ad-39fb-4ebb-9569-ebed86d85585","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.606722Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:d386d96819c3674e701b3918e69ed982b741f98771639c29b9208b48c5f96538","observation_id":"da8eba32-caca-4e45-af01-1b099052641a","resolution":{"observed_at":"2026-08-10T22:34:12.651448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.630601Z","title":"Videoswap: Customized video subject swapping with interactive semantic point cor- respondence","venue":null,"work_id":"2968eaf2-fa2d-401f-be2e-e7a2fe611bee","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.610714Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:c73251bba8ea21e8449332bc87197b3de850fa1a3aafb968bdcffcc0224e41f8","observation_id":"ab1ee9c5-4983-450b-b84b-6e5c9522e0a6","resolution":{"observed_at":"2026-08-10T22:34:12.636531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:11.615433Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.615433Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:b321e8766dfb9fb5d1a0ee0dc36f80d2fbd8664fd6d0e896388835cb34a45abd","observation_id":"b6f112a3-5fa8-4cdf-84cf-59f9f63152a3","resolution":{"observed_at":"2026-08-10T22:34:11.615433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-10T22:34:11.620489Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.620489Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:7c237eb65b056e27e69e100aac88730d3714cd69cb5b49bb4fe912b0c613a58a","observation_id":"7ba576b8-7bea-4de3-809a-bfbedd9d2954","resolution":{"observed_at":"2026-08-10T22:34:11.620489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.608617Z","title":"Ground-a-video: Zero- shot grounded video editing using text-to-image diffusion models","venue":null,"work_id":"dcdd1db0-dd34-409a-8439-3f8cccbdab3d","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.625653Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:4c986f28ca8ec628b228cb96ec64fa5551f957d0e7d2f1a58e9c0b09e9e738ea","observation_id":"19e9a463-44ee-48c9-ba3f-55f9fa3f7353","resolution":{"observed_at":"2026-08-10T22:34:12.613287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06025","last_updated":"2023-10-30T21:44:52Z","snapshot_observed_at":"2026-08-16T15:40:54.760375Z","submitted_at":"2023-04-12T17:59:17Z","title":"DreamPose: Fashion Image-to-Video Synthesis via Stable Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06025","snapshot_observed_at":"2026-08-10T22:34:11.633226Z","title":"Dreampose: Fashion image- to-video synthesis via stable diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.633226Z"},"links":{"cited_paper":"/paper/2304.06025","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:f8442724f5ed9f40d40a34997309c4cb8c4b33463611bdf07f1786bbff70fc15","observation_id":"68fc0ddb-3724-412b-8010-b1776f68558c","resolution":{"observed_at":"2026-08-10T22:34:11.633226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07635","last_updated":"2024-10-01T13:15:53Z","snapshot_observed_at":"2026-08-18T10:45:12.778761Z","submitted_at":"2023-07-14T21:13:04Z","title":"CoTracker: It is Better to Track Together","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07635","snapshot_observed_at":"2026-08-10T22:34:11.638335Z","title":"Co- tracker: It is better to track together","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.638335Z"},"links":{"cited_paper":"/paper/2307.07635","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:3d6d6185a97836e1f3d7f76ac979924108be9d9db40018ae2d5315e22869ee23","observation_id":"3df1152d-043b-429b-a110-fb9d1c04e939","resolution":{"observed_at":"2026-08-10T22:34:11.638335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-10T22:34:11.642702Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.642702Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:93ae74a976a92125b81f2946e681d340f5173e8a518503403f979d3a5e83e7ec","observation_id":"7c2b03ef-21dc-4636-9e2f-55ada3f6166b","resolution":{"observed_at":"2026-08-10T22:34:11.642702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-08-16T14:07:39.359261Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-08-10T22:34:11.647567Z","title":"Anyv2v: A tuning-free framework for any video-to- video editing tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.647567Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:0c9634b98bb9a315fe5ae0e63ff92b8c41b4d47117d58dd78c4900c2236ceaf5","observation_id":"99e8d3e2-c664-4c39-9449-38233b4976fc","resolution":{"observed_at":"2026-08-10T22:34:11.647567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.594496Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":"25c3be29-44d3-4cfa-a02b-14b77a7a594f","year":2023},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.652483Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:b0ec467162c8ec6cfd48559dcb686ca5c75a5e8d5f42939e895be497df94055f","observation_id":"964e80d0-cafa-4f91-9fa8-83d1832451e3","resolution":{"observed_at":"2026-08-10T22:34:12.599109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:11.656783Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.656783Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:542e458c3279fde12ade3abefb7e756608bfca42fc730acceea186a22ade05f4","observation_id":"e0c78b4c-c02e-417f-8093-3bf78c38fe30","resolution":{"observed_at":"2026-08-10T22:34:11.656783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00330","last_updated":"2024-09-12T06:50:53Z","snapshot_observed_at":"2026-08-16T14:38:36.179170Z","submitted_at":"2023-12-01T03:53:21Z","title":"StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00330","snapshot_observed_at":"2026-08-10T22:34:11.661933Z","title":"Style- crafter: Enhancing stylized text-to-video generation with style adapter","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.661933Z"},"links":{"cited_paper":"/paper/2312.00330","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:9df07f185c093eefae67267fe9972c26d9b732decb7f18780c7ce430ebb7c549","observation_id":"264b61ef-b3e0-4bbc-81b4-74f5079fa6ad","resolution":{"observed_at":"2026-08-10T22:34:11.661933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.571003Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":"61563269-3522-4279-bb2c-4fef764f2319","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.666554Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:94e40f7a61464fdc76528586375b03275500e42ebe6fdea03bdc89c799182690","observation_id":"38da6899-f887-460e-ae70-f16fe26bff85","resolution":{"observed_at":"2026-08-10T22:34:12.577045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.554868Z","title":"Large-scale video panoptic segmen- tation in the wild: A benchmark","venue":null,"work_id":"46feeb2a-361a-491a-a69e-b6d63808ed71","year":2022},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.671448Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:0d76310c86007bfb6da4fcb0c98cf125bbd28d57456f5f0bef62b59242e13ece","observation_id":"eff90762-4f0e-48d1-92b2-c0ff321a49ae","resolution":{"observed_at":"2026-08-10T22:34:12.560220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.542461Z","title":"Vspw: A large-scale dataset for video scene parsing in the wild","venue":null,"work_id":"b6816f13-168f-4705-b036-b9b2c5144c22","year":2021},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.676161Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:d6f863cf9b6ebcc9fc4b577671f98a230c4ce10c95118081594d3f610e3b4115","observation_id":"eaacfcc7-079d-4408-9f0a-bd957747b3ce","resolution":{"observed_at":"2026-08-10T22:34:12.546705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13865","last_updated":"2024-05-22T17:46:08Z","snapshot_observed_at":"2026-08-16T13:50:31.799300Z","submitted_at":"2024-05-22T17:46:08Z","title":"ReVideo: Remake a Video with Motion and Content Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13865","snapshot_observed_at":"2026-08-10T22:34:11.680264Z","title":"Revideo: Remake a video with motion and content control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.680264Z"},"links":{"cited_paper":"/paper/2405.13865","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:e3bd459cc1c05ce457ccee5e9fe938ea458887bd21d0259298332999df876f72","observation_id":"b4ecb72a-b4b1-43aa-9d83-3fe779e4d95c","resolution":{"observed_at":"2026-08-10T22:34:11.680264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.530224Z","title":null,"venue":null,"work_id":"59a6c7eb-3c6f-4ee0-bb0f-3f84365ab24f","year":2023},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.683947Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:1c7035efc5db96727f2b8079b0d8628308bc7009381a31db7d24dea85844cacf","observation_id":"39cb9cca-f11b-4e97-b225-9d89c61640f7","resolution":{"observed_at":"2026-08-10T22:34:12.534248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.515022Z","title":"Codef: Content deformation fields for tempo- rally consistent video processing","venue":null,"work_id":"45935f73-c081-4785-929f-6795a629284a","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.688467Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:551c179c73ba79513080ae61104b46e0e4d64b495d32e89b0d5a0797da1e0dac","observation_id":"1a108ee5-d1b6-4be6-8121-a609b16ee816","resolution":{"observed_at":"2026-08-10T22:34:12.520030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.501620Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"de533a89-2f43-4bd0-b057-1f5ebecf1c42","year":2021},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.691689Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:503dbff65e2e614504ec5e45e49cd12a6fd1a7c29a9987f66ad780c320843fde","observation_id":"3b1d3ff6-4f27-4c1e-8a44-5d334d24f5d9","resolution":{"observed_at":"2026-08-10T22:34:12.505987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-10T22:34:11.696158Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.696158Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:9fef8672766f4a12d62e4b91c47ba3c5ced11e1c6a6d170edb6677beea22a880","observation_id":"af34985c-b868-466c-b4d5-c35007b2001b","resolution":{"observed_at":"2026-08-10T22:34:11.696158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.488821Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation.TMLR,","venue":null,"work_id":"09abe6ea-c4b5-4a7c-af5a-982d6cb6a9fb","year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.701219Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:1badd33042b81aacab3bb4c1efcbc1cf5f750f5248b7c4acaa08f6b3df270ab5","observation_id":"2c22a101-9b4d-44ac-ad53-f057aa8e1c90","resolution":{"observed_at":"2026-08-10T22:34:12.493034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.476416Z","title":"Denton, Seyed Kamyar Seyed Ghasemipour, Raphael Gontijo Lopes, Burcu Karagol Ayan, Tim Salimans, Jonathan Ho, David J","venue":null,"work_id":"ddcd70ed-cda2-4be6-9ba1-0913bd6346b2","year":2022},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.705116Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:478f0821d4e3d96c811f9e66c2b216b9063053bb6161ba25df39444281e7867a","observation_id":"51df3bdd-3716-4c22-be50-3cdefa6501c1","resolution":{"observed_at":"2026-08-10T22:34:12.480550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.463964Z","title":"High- fidelity guided image synthesis with latent diffusion models","venue":null,"work_id":"d1ec0e4b-6c95-4c9c-8af9-692fdeb56667","year":2023},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.709145Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:a0ea5ef0ae699708716cd7226055ee7dfaacc6fa87bf4c2f7660d085161c79b9","observation_id":"db0f8dd2-4523-4f11-a96b-627c0f5ecb72","resolution":{"observed_at":"2026-08-10T22:34:12.468441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00932","last_updated":"2022-12-05T05:11:31Z","snapshot_observed_at":"2026-08-16T16:11:34.747479Z","submitted_at":"2022-12-02T02:15:13Z","title":"ObjectStitch: Generative Object Compositing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00932","snapshot_observed_at":"2026-08-10T22:34:11.712961Z","title":"Price, Jianming Zhang, Soo Ye Kim, and Daniel G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.712961Z"},"links":{"cited_paper":"/paper/2212.00932","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:e9e04a256cb37d390e8d91fd2e0e62c50590934376c083544c9f83e40bcda038","observation_id":"7997fa17-c2f1-44e8-84af-d6fbe33bfb07","resolution":{"observed_at":"2026-08-10T22:34:11.712961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.449867Z","title":"Price, Jianming Zhang, Soo Ye Kim, He Zhang, Wei Xiong, and Daniel G","venue":null,"work_id":"ed7398cb-ac59-4d21-a18f-6c5547183f78","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.716886Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:baa6eef7ee5bc4941cef8d69a732bea60817af8c2a316ddf5075d09452b2464a","observation_id":"f8385fef-a939-4598-8794-803d2870c701","resolution":{"observed_at":"2026-08-10T22:34:12.454355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.431453Z","title":"Weighted-to-spherically- uniform quality evaluation for omnidirectional video","venue":null,"work_id":"7f4745d6-6d0f-4685-bd6b-d7eda459ade9","year":2017},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.721090Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:dd03ce2cfba8312b720f200786c4788afc7bba87df7aa1700f273f1c8ff0bd33","observation_id":"fa687aa1-769a-4813-a153-3bbdd6d3382a","resolution":{"observed_at":"2026-08-10T22:34:12.436068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:11.724998Z","title":"Kolors: Effective training of diffusion model for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.724998Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:da681da0ac4c6e0e6e9d9ccdfc5c1e78773fbdc91accdf68af04a1e5a54e161e","observation_id":"eb54f76d-9556-49e9-9c0c-13281cbe3674","resolution":{"observed_at":"2026-08-10T22:34:11.724998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.404040Z","title":"Motioneditor: Editing video motion via content-aware diffusion","venue":null,"work_id":"c7acc29f-6e2c-48c6-a03e-8ede75c85036","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.729248Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:25e1a8080de54e86281a1e985af602ce19af9d5378b6aebf1f59b99b4a299275","observation_id":"e1ef8393-4dc1-49ec-8980-60702d488b6c","resolution":{"observed_at":"2026-08-10T22:34:12.409157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.390574Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"bbaea52c-6318-4399-bdd9-23b0b69de092","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.733196Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:def90c6338287a1d00c0fa55c820c892703e66b67207e1f5a8f5048dfa6abcf5","observation_id":"396e9e9b-3a7a-49ea-8271-aaf8a2dd8dda","resolution":{"observed_at":"2026-08-10T22:34:12.395117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.376271Z","title":"Dreamvideo: Composing your dream videos with customized subject and motion","venue":null,"work_id":"74a25418-bffd-49c2-a300-c6a77c716934","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.737129Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:c8ca60b207438b5110c4bc8e6b27c7d66ece0627a214ff86844b96d65e10e1ac","observation_id":"d33022ad-a9c2-4b5f-b049-cc7f08d1a894","resolution":{"observed_at":"2026-08-10T22:34:12.381093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13830","last_updated":"2024-10-17T17:52:57Z","snapshot_observed_at":"2026-08-16T13:08:18.039945Z","submitted_at":"2024-10-17T17:52:57Z","title":"DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13830","snapshot_observed_at":"2026-08-10T22:34:11.740984Z","title":"Dreamvideo-2: Zero-shot subject-driven video customiza- tion with precise motion control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.740984Z"},"links":{"cited_paper":"/paper/2410.13830","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:403d0e0ce1ebd8e7bf8cf99714584785675241307ac974034d0c83b4735acba3","observation_id":"61f5e7a4-92cc-4eee-9b10-3c08f06338af","resolution":{"observed_at":"2026-08-10T22:34:11.740984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:11.745075Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.745075Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:dff2eda9a5cfa959215313a0158f551a3c3da19520e05fbb1ae2a6a8afbdc28d","observation_id":"dd6ad1b0-48fe-4d6a-8d7b-509c591472b0","resolution":{"observed_at":"2026-08-10T22:34:11.745075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13239","last_updated":"2024-12-27T13:58:39Z","snapshot_observed_at":"2026-08-16T13:51:56.014897Z","submitted_at":"2024-08-23T17:26:06Z","title":"CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13239","snapshot_observed_at":"2026-08-10T22:34:11.748709Z","title":"Custom- crafter: Customized video generation with preserving mo- tion and concept composition abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.748709Z"},"links":{"cited_paper":"/paper/2408.13239","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:a5150e615249a6ddd6b041a274239d447951c79cf60ff941e1ff74e07e593037","observation_id":"f041ef84-ea84-4496-8842-857360f9fe29","resolution":{"observed_at":"2026-08-10T22:34:11.748709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.354256Z","title":"I2v-adapter: A general image-to-video adapter for diffusion models","venue":null,"work_id":"2659fd0d-4d77-4c36-9602-a7ba3112420a","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.752779Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:a9f099b89953045c7897c20b949b592a962fc086299b7e0bfeed156ec3bb2c95","observation_id":"1a2f0180-c1ce-4388-9f1e-56f49ebc10c3","resolution":{"observed_at":"2026-08-10T22:34:12.358879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13227","last_updated":"2022-11-23T18:59:52Z","snapshot_observed_at":"2026-08-16T16:13:46.972104Z","submitted_at":"2022-11-23T18:59:52Z","title":"Paint by Example: Exemplar-based Image Editing with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13227","snapshot_observed_at":"2026-08-10T22:34:11.756265Z","title":"Paint by example: Exemplar-based image editing with diffusion mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.756265Z"},"links":{"cited_paper":"/paper/2211.13227","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:2c38be8b74cf8acc5fece2c0256e3ffd1b8651d2181e41b1feb28b277da399e8","observation_id":"51d3c264-fe00-44e2-9fa7-d301016e16c5","resolution":{"observed_at":"2026-08-10T22:34:11.756265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.341976Z","title":"X- pose: Detection any keypoints","venue":null,"work_id":"664a6ad7-233e-49e1-8e8b-400e978d75ce","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.886620Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:d257d76f26d35ce4c7c9560a291f3f97ac1d68d77856a1fa1eb7bafcce0e043c","observation_id":"40fd7eb1-d4a7-4065-893e-cc1db3d1a2f8","resolution":{"observed_at":"2026-08-10T22:34:12.345995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.326447Z","title":"Video instance seg- mentation","venue":null,"work_id":"a7424736-e8cf-4e41-921a-253705d768d2","year":2019},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.891368Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:e636bc6c7997874e28f8d16873ea9ae21e37c7af900d3f1e27eadeb051f39c28","observation_id":"6243cc6b-0349-45c9-a6b9-bb72d82b61c7","resolution":{"observed_at":"2026-08-10T22:34:12.332381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16111","last_updated":"2024-03-24T12:04:06Z","snapshot_observed_at":"2026-08-16T14:06:58.822077Z","submitted_at":"2024-03-24T12:04:06Z","title":"EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16111","snapshot_observed_at":"2026-08-10T22:34:11.895152Z","title":"EV A: zero-shot accurate attributes and multi-object video editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.895152Z"},"links":{"cited_paper":"/paper/2403.16111","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:33659a72b71d6600dfee6a6609a8a1f08bcfcfbd6d2d425983f300411fa33065","observation_id":"ff36d78d-270d-4ff1-9d26-a5f638f69c2f","resolution":{"observed_at":"2026-08-10T22:34:11.895152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-10T22:34:11.899864Z","title":"Cogvideox: Text-to-video diffu- sion models with an expert transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.899864Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:d43299212a90e59c62e87ad6d867772eb19428cdf0714227c0bcc2e7301d8e04","observation_id":"3409f0f5-5bc7-457b-a38c-385257913928","resolution":{"observed_at":"2026-08-10T22:34:11.899864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.312947Z","title":"Mvimgnet: A large-scale dataset of multi-view images","venue":null,"work_id":"6680d854-dca2-43bc-95ad-03d752074d54","year":2023},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.904144Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:462cb71c5444a9d59248fb94d4bb13fcab9114f93c8beed3418d6984234c43ba","observation_id":"5e117ba5-4c15-453a-a874-4bbfe2291ac7","resolution":{"observed_at":"2026-08-10T22:34:12.317263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.298031Z","title":"Customnet: Object cus- tomization with variable-viewpoints in text-to-image diffu- sion models","venue":null,"work_id":"c297d6bc-1c9a-4600-94a5-b0b3757eedfa","year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.908160Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:09a8957b40544ad7e734182233e3d3bca179404a04d68445fc35be55cd82d51b","observation_id":"9d16e947-c342-4165-aba8-618234d4dc4f","resolution":{"observed_at":"2026-08-10T22:34:12.303410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10040","last_updated":"2023-08-19T14:56:44Z","snapshot_observed_at":"2026-08-18T07:54:10.856061Z","submitted_at":"2023-08-19T14:56:44Z","title":"ControlCom: Controllable Image Composition using Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10040","snapshot_observed_at":"2026-08-10T22:34:11.913066Z","title":"Controlcom: Controllable im- age composition using diffusion model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.913066Z"},"links":{"cited_paper":"/paper/2308.10040","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:5557ea8b193fcf553693ca986c4dd75203514620bf32b5f2b874d7a28798ef89","observation_id":"ca9f5c05-06d8-4a4f-95fb-c0c02fbe9f64","resolution":{"observed_at":"2026-08-10T22:34:11.913066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:11.923470Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.923470Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:4e1e8cbe21afef2c9f68a61791934b8140fefe467290ad991fdcdb497908feec","observation_id":"c13494a9-88a4-40fb-89a1-ee3e923516e3","resolution":{"observed_at":"2026-08-10T22:34:11.923470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-16T13:38:51.127960Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-10T22:34:11.928216Z","title":"Mimicmo- tion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.928216Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:f50fe17db04c18684b06a92e1a4ce2b484e4bd958c4ac1085b1b841a830a1310","observation_id":"c59ab23e-f530-4770-80a6-d8227d1199c8","resolution":{"observed_at":"2026-08-10T22:34:11.928216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:12.275823Z","title":"Flow-guided one-shot talking face generation with a high- resolution audio-visual dataset","venue":null,"work_id":"78a89183-2130-4d3a-b78e-90e95d35ce87","year":2021},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.932824Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:03a4736a690f410bd5b36db9544553ab39cf2b779b3cde4ff8b4a1107212bbd7","observation_id":"19896ce2-b18b-4313-b8e2-5ffd239cd0f4","resolution":{"observed_at":"2026-08-10T22:34:12.280594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:34:11.937640Z","title":"CelebV- HQ: A large-scale video facial attributes dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:11.937640Z"},"links":{"citing_paper":"/paper/2501.01427"},"observation_digest":"sha256:8752cdece825993d0a195bb79362c9872172e466f3bb46fe085bb6bb3c4306d4","observation_id":"8cfe883d-fa0b-4cb2-ba43-0a8f01038dc1","resolution":{"observed_at":"2026-08-10T22:34:11.937640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.01427","last_updated":"2025-05-28T08:03:56Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T01:35:25.849328Z","submitted_at":"2025-01-02T18:59:54Z","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 7 inbound Pith citation observations for arXiv:2501.01427."}