{"as_of":"2026-08-06T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41ffe9d108d0fbc645ce6a10552b3fb8d9c4a4eddc0dafe38e0aa2d310b30246","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T07:59:49.398271Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:09:08.202397Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T19:07:47.089178Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23690","snapshot_observed_at":"2026-08-05T21:09:08.202397Z","title":"Synmotion: Semantic-visual adaptation for motion customized video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09454","last_updated":"2025-08-13T03:11:28Z","snapshot_observed_at":"2026-08-05T21:08:58.926678Z","submitted_at":"2025-08-13T03:11:28Z","title":"Animate-X++: Universal Character Image Animation with Dynamic Backgrounds","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T21:09:08.202397Z"},"links":{"cited_paper":"/paper/2506.23690","citing_paper":"/paper/2508.09454"},"observation_digest":"sha256:0734bddc627e2dbe5bef3b91880d25e68b3986df40cd760d737e5f6634e23ded","observation_id":"e24caf5b-8e41-49c7-b373-771650d6ec97","resolution":{"observed_at":"2026-08-05T21:09:08.202397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2506.23690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23690","snapshot_observed_at":"2026-08-05T19:07:47.089178Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","venue":"cs.CV","work_id":"1f240e95-7eea-43b4-a357-be1bd4367185","year":2025},"citing_paper":{"arxiv_id":"2508.13442","last_updated":"2025-08-19T01:55:25Z","snapshot_observed_at":"2026-08-05T19:07:24.374768Z","submitted_at":"2025-08-19T01:55:25Z","title":"EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T19:07:29.774246Z"},"links":{"cited_paper":"/paper/2506.23690","citing_paper":"/paper/2508.13442"},"observation_digest":"sha256:44886335f72c75048f0bdd6543a79f85f417abc57d8b71a18efeb03bb76bc6c6","observation_id":"791dd7d2-34da-4f6c-b209-966838430a83","resolution":{"observed_at":"2026-08-05T19:07:47.214751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23690/citation-record","integrity":"/paper/2506.23690/integrity","json":"/paper/2506.23690/citation-record.json","paper":"/paper/2506.23690"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:ad672bcc91702eb473a5c4ae00487da505f2c1dc31ea7b9c135f4699d9375883","observation_id":"a94140e8-6760-41f6-835c-48f83fdc7a18","resolution":{"observed_at":"2026-05-19T08:02:10.404835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":null,"work_id":"9edf8f28-1469-4dea-afa0-64b9a0c1b79f","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:ca45fc6bea9eac93ad052254666c7476ff44f49da0c28b623e152f0e6979b596","observation_id":"a0e35e96-20cf-4bdf-ad06-12ca4c2b03ec","resolution":{"observed_at":"2026-05-19T08:02:12.079448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ming-lite-uni: Advancements in unified architecture for natural multimodal interaction","venue":null,"work_id":"7e9b9398-4db8-4964-a2b9-c42f31ad1b6d","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:dfa5bf9858ec34b8f043b7e96af9dd15f20fe9f3aee14361a6a14640d3eeae65","observation_id":"81725d05-b060-459a-a681-145e79d42b15","resolution":{"observed_at":"2026-05-19T08:02:12.184376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A neural space-time representation for text-to-image personalization","venue":null,"work_id":"ad4fa170-0faf-472f-9acd-5bc800461fa9","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:b92b63ac25c52fa9b8ef9c7378c505521e031386f71621b8ff90ca6d289ee80e","observation_id":"0ad6f4f9-335d-446a-b642-03c9c9c22af3","resolution":{"observed_at":"2026-05-19T08:02:12.062200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08477","last_updated":"2023-04-18T03:27:52Z","snapshot_observed_at":"2026-07-06T15:16:38.500909Z","submitted_at":"2023-04-17T17:57:06Z","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2304.08477","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.08477","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent- shift: Latent diffusion with temporal shift for efficient text-to-video generation","venue":null,"work_id":"bedd3bfc-5b36-4f28-80c6-ccc058c0b411","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2304.08477","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:6a6ae39ad305aeae314d68398e2cfb907c276b4e8ab01b04aec246085c647796","observation_id":"09ff4885-2514-4d92-aeb1-7e69f9d182e7","resolution":{"observed_at":"2026-05-19T08:02:10.545938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06925","last_updated":"2023-07-13T17:46:42Z","snapshot_observed_at":"2026-08-05T21:39:03.261035Z","submitted_at":"2023-07-13T17:46:42Z","title":"Domain-Agnostic Tuning-Encoder for Fast Personalization of Text-To-Image Models","version":1},"cited_work":{"arxiv_id":"2307.06925","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.06925","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Domain-agnostic tuning-encoder for fast personalization of text-to-image models","venue":null,"work_id":"519d1d3b-b289-487d-a72b-cd6549decb8e","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2307.06925","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:c0bb2c4c22b7c1df8ca00fb4ab45e4f5d2de698abe69eca3d84addc2067ab214","observation_id":"1f21b890-b005-4675-b2d9-e07c29b5181d","resolution":{"observed_at":"2026-05-19T08:02:10.455195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:1db658ee0154ecd31d3f7732ace21b3e54d03b082ad0be70202092de379b2661","observation_id":"b3a3753c-8d66-46a7-b121-4b2d512dc643","resolution":{"observed_at":"2026-05-19T08:02:10.496192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:82f29881253f415c559630ebecb58efe3459a845596c1603955e43d166b0fb82","observation_id":"83437bc3-2f0e-4ab8-9c63-bed3f1adeca1","resolution":{"observed_at":"2026-05-19T08:02:10.290498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15646","last_updated":"2024-12-23T06:52:45Z","snapshot_observed_at":"2026-07-06T20:10:41.978020Z","submitted_at":"2024-12-20T08:05:13Z","title":"CustomTTT: Motion and Appearance Customized Video Generation via Test-Time Training","version":2},"cited_work":{"arxiv_id":"2412.15646","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15646","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Customttt: Motion and appearance customized video generation via test-time training","venue":null,"work_id":"f5bb2eda-9936-4540-a88b-bcfbff384438","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2412.15646","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:161bf5616690d5cca13c43131e74ce6ee72105933d1a90803215e59a1c9d2978","observation_id":"fda19313-3569-4aa4-944e-d05cd6894c04","resolution":{"observed_at":"2026-05-19T08:02:10.538700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pix2video: Video editing using image diffusion","venue":null,"work_id":"6d914369-3986-427d-822f-49d0f6a690f1","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:e6ab8b7ad669fdcb263c4b36b333f1d18f01d643c93698d6a55ece0205f2a66d","observation_id":"50251f76-738f-4eba-a82a-a3d65e53c50c","resolution":{"observed_at":"2026-05-19T08:02:12.157826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stablevideo: Text-driven consistency-aware diffusion video editing","venue":null,"work_id":"c547eeec-49d5-48e2-b31c-b579286d6582","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:43ddfbf93417cb14903caf9012327d894cb58668d54a8921619e391b43c18401","observation_id":"72d810d4-43c3-4c03-bc9d-899b7f5961fb","resolution":{"observed_at":"2026-05-19T08:02:12.123081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-07-06T16:40:28.142296Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2310.19512","doi":"10.48550/arxiv.2310.19512","metadata_source":"pith","pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","venue":"cs.CV","work_id":"4d4486c5-6317-4d8d-bb5b-3b100d732a83","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:61202c3a30b2e5fd8fd23f1bc7ba10cafb570f54455c90f0cc66e29059350c37","observation_id":"91015f69-6c2f-45f0-8cdc-24e0dfb6cbd2","resolution":{"observed_at":"2026-05-19T08:02:10.311210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"da75efb7-f1dc-4125-917f-f89bef0cb9d8","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:f868516c78ea98a86d317aff9fffd223fd9169cb6d8d24f01e852939d42b0dd6","observation_id":"dceeddb2-9ac1-47af-8e46-7b6159fdd101","resolution":{"observed_at":"2026-05-19T08:02:12.036442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03374","last_updated":"2024-02-27T02:45:34Z","snapshot_observed_at":"2026-08-05T15:36:02.045738Z","submitted_at":"2023-05-05T09:08:25Z","title":"DisenBooth: Identity-Preserving Disentangled Tuning for Subject-Driven Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":"2305.03374","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.03374","snapshot_observed_at":"2026-07-04T08:49:42.391190Z","title":"Disenbooth: Disentangled parameter-efficient tuning for subject-driven text-to-image generation","venue":null,"work_id":"53a63122-dc79-4ad7-819c-ee610fa522d3","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2305.03374","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:c1e12824e0cbbe2dba6679018a4c14a99a6e7f396cb8b64acf67d57e86e8fa95","observation_id":"c220ff5a-f357-4427-9873-d3378da0e767","resolution":{"observed_at":"2026-05-19T08:02:10.472948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15779","last_updated":"2023-05-25T06:46:28Z","snapshot_observed_at":"2026-07-06T15:33:06.904026Z","submitted_at":"2023-05-25T06:46:28Z","title":"Custom-Edit: Text-Guided Image Editing with Customized Diffusion Models","version":1},"cited_work":{"arxiv_id":"2305.15779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15779","snapshot_observed_at":"2026-07-01T22:36:17.761672Z","title":"Custom-edit: Text-guided image editing with customized diffusion models","venue":null,"work_id":"ca99b0ff-02df-47c8-bf9f-de54c292bd62","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2305.15779","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:1fd04a7abdf3ee4c39ff77b881ebf2cf28ef980f6dcec14074e22110f9903bbe","observation_id":"b2b3fde7-ae64-4dd4-aeb1-e828e85ced94","resolution":{"observed_at":"2026-05-19T08:02:10.352929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xtuner: A toolkit for efficiently fine-tuning llm","venue":null,"work_id":"d9f75844-11f0-4256-be16-c4af415d9d65","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:6d7a6ffc16a425656c988d066e0dcb174b7c6f888edba0b7d053471be77b6659","observation_id":"fa20181c-3cbf-4d32-b02e-410a097a4084","resolution":{"observed_at":"2026-05-19T08:02:12.273878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"67cbf2e9-fbed-420e-b994-f62b956bd45e","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:50a5217ef58d51ea680471c0bca9534cd8cf05fc2b65a4b9498435acff040c93","observation_id":"efdbac32-062e-47ea-9d6a-6c80d15b47ff","resolution":{"observed_at":"2026-05-19T08:02:12.278390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ranni: Taming text-to-image diffusion for accurate instruction following","venue":null,"work_id":"0fbb4c28-0c3d-4e04-a643-7f2fc34fab38","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:1356f7ad4f533bb5f14c0825006f927857e277e83b2763da56848d0e005642d1","observation_id":"a2f7bd6b-83f6-4ea7-b099-fcc6c714255c","resolution":{"observed_at":"2026-05-19T08:02:12.282828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":"2208.01618","doi":"10.48550/arxiv.2208.01618","metadata_source":"pith","pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","venue":"cs.CV","work_id":"ca618c21-3ba6-448e-bd86-bcecff3cdeb5","year":2022},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:55e523330b1dc2f990089dbd84c81adc6a22dc1fe36795982654918535aabb23","observation_id":"dd46aff2-3f4a-414d-94c2-34a02b5e0920","resolution":{"observed_at":"2026-05-19T08:02:10.449282Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Encoder- based domain tuning for fast personalization of text-to-image models","venue":null,"work_id":"c1845a5e-d795-4d0c-952a-0be27f903932","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:224b0ceb83645c9f7b09074d9af92acb0053dd3d2f6845a700caf0bc53e52377","observation_id":"ebb3cb1f-6a65-4e80-b633-2d43a613dccc","resolution":{"observed_at":"2026-05-19T08:02:12.259975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Customizing text-to-image generation with inverted interaction","venue":null,"work_id":"83e0f489-4ce7-4d93-ae2b-05f3dc3e19f6","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:15a5617c9868553bf0eb0ece7a1027a6648ac52564a9e0e3c94b49056a2fce90","observation_id":"744e1ad9-8439-4125-b69e-95654f545776","resolution":{"observed_at":"2026-05-19T08:02:12.040103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools","venue":null,"work_id":"96836c8f-02f5-46ef-bb3a-6d3ceba5c7d0","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:666201783aab953450294b43f33c38b483781b5ec92da077d15b1da56dc50ccf","observation_id":"90d0a4bf-0411-4cc5-9dd1-356acc111aae","resolution":{"observed_at":"2026-05-19T08:02:12.032603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Check locate rectify: A training-free layout calibration system for text-to-image generation","venue":null,"work_id":"65fa929a-ef4c-4b9f-a9c3-08e4ac2da664","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:d83a5a11e25182b45e0beeb0cf1f577fa3749008bf4715811e0084af9845e7ac","observation_id":"838f5aff-7859-47b1-b451-0242ff774c09","resolution":{"observed_at":"2026-05-19T08:02:12.023906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uknow: A unified knowledge protocol with multimodal knowledge graph datasets for reasoning and vision-language pre-training","venue":null,"work_id":"12a95ea7-f0c4-4155-b9df-ad3548f14a75","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:011e55a9ce71e1164118d29ebc37579ceea41b19f188e6ef0505ea8a19d8daad","observation_id":"aec69dd9-1067-4b41-b9b7-cf2b26ad3889","resolution":{"observed_at":"2026-05-19T08:02:12.028349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18247","last_updated":"2023-05-30T08:54:42Z","snapshot_observed_at":"2026-07-06T15:34:51.593721Z","submitted_at":"2023-05-29T17:11:39Z","title":"TaleCrafter: Interactive Story Visualization with Multiple Characters","version":2},"cited_work":{"arxiv_id":"2305.18247","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18247","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Talecrafter: Interactive story visualization with multiple characters","venue":null,"work_id":"3ec0616f-fbab-4462-9c54-956eb899b45f","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2305.18247","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:94705f02684f1f0e7289ff0eb11de48c9ea6e361826bfa33b30054263d593dfb","observation_id":"d1f5a81d-176e-4efe-be68-43f995a43c65","resolution":{"observed_at":"2026-05-19T08:02:10.559675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:f664de3241eb1a1a64f75adc8eea2fb7f810aad795df53ad13bb2a574713c977","observation_id":"7d48b8d7-a71b-49ae-8cec-deaef2821c85","resolution":{"observed_at":"2026-05-19T08:02:10.331310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11305","last_updated":"2023-07-02T21:16:39Z","snapshot_observed_at":"2026-08-03T06:10:43.690213Z","submitted_at":"2023-03-20T17:45:02Z","title":"SVDiff: Compact Parameter Space for Diffusion Fine-Tuning","version":4},"cited_work":{"arxiv_id":"2303.11305","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.11305","snapshot_observed_at":"2026-07-09T18:36:27.287439Z","title":"Svdiff: Compact parameter space for diffusion fine-tuning","venue":"cs.CV","work_id":"564fc94c-3c4b-46af-9c12-538dc1a67982","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2303.11305","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:cfc3e5f9a396750030fe44e160a9c46139e573579cbd8d10fd0d443471845986","observation_id":"7b9609eb-df97-4669-a5a6-8ff2791ffb5b","resolution":{"observed_at":"2026-05-19T08:02:10.338062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"f723a579-633a-455d-9908-9ee21139e9b4","year":2020},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:d97c2ed9cc8120dc26837eea530dabf1a31617b7b46850384a7813792c1279b9","observation_id":"7b50f4fe-1f34-4887-ace0-94f4d7510b7d","resolution":{"observed_at":"2026-05-19T08:02:12.100192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video diffusion models","venue":null,"work_id":"7f674ed0-7224-4df1-90c9-d0b3c9b671f7","year":2022},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:59f63edcbd24f0ae095c53991b99ce828e7fd9dd36a4d888c3552b751056c8cb","observation_id":"8a369efa-db32-44c3-b4c9-fdd1c093e640","resolution":{"observed_at":"2026-05-19T08:02:12.236742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:abe03483c901e354e453b5eeb902357ba7e9f89f8e1ed1faf6b88c508dca18e5","observation_id":"009c3b34-18d0-4e15-9cac-4fca5c71e2e8","resolution":{"observed_at":"2026-05-19T08:02:10.572736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"575af9fc-cc83-4993-823c-732b4f9d9295","year":2022},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:e1e8fda29dcdfc9dcfe851317de6167d082bc2b9233da129e499648f4eea2547","observation_id":"0b4fe486-cfca-47d7-842b-e5e5cdc764b3","resolution":{"observed_at":"2026-05-19T08:02:12.241390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning disentangled identifiers for action-customized text-to-image generation","venue":null,"work_id":"d7e1850b-aa0a-47ce-b46d-2b6fa21994df","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:4431a3aa0d16a95eea23da993bb4e8a1317728eed47b9338d182e8e04598a2db","observation_id":"e94934e4-8188-4fb3-a134-087777a604d8","resolution":{"observed_at":"2026-05-19T08:02:12.250835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VBench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"ff308e05-175c-4038-b298-3fa4f099db95","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:5ad093ecbaa7d1091e5bedb276308075e21d2155c79d4c66f4e4861a6fc4fa25","observation_id":"e513f8b2-63f9-4bcc-83fa-546e4b87bebd","resolution":{"observed_at":"2026-05-19T08:02:12.291768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reversion: Diffusion-based relation inversion from images","venue":null,"work_id":"ed4de9b3-a1fb-46dc-8ae7-e44bbdbc282e","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:279ff2c34fe37d32e789fe8850f10f6d74cfee6d6f6206983536ec06769e1ce6","observation_id":"dc9cddc0-88a3-4c76-80c0-a87948864e43","resolution":{"observed_at":"2026-05-19T08:02:12.246292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vmc: Video motion customization using temporal attention adaption for text-to-video diffusion models","venue":null,"work_id":"7e9f554f-2953-497a-b9e9-2780c51163c7","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:408b46749ebc0aa9e728c7b28f8cc089fd1f26493716295f27aadac11664b3fb","observation_id":"07f8073d-121a-4c24-8e5d-08c2616fd585","resolution":{"observed_at":"2026-05-19T08:02:12.219143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pomp: Physics-consistent motion generative model through phase manifolds","venue":null,"work_id":"7c17ddb3-9cee-406a-96c0-2d02eedd67c1","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:eb7e619c9c28608ed37bf045967f1a8f5a5f66434e6eb83c8dd486e888a00c7d","observation_id":"a42d9dae-65f4-470f-8eca-2dc936ab4699","resolution":{"observed_at":"2026-05-19T08:02:12.264468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sport: From zero-shot prompts to real-time motion generation","venue":null,"work_id":"8ac9f9bc-edc5-403e-9d3e-1662f491e38f","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:1a19c8ece94aae603d4e0b314f9175fb59dbe88bed81591cb716b41ae6dc4a38","observation_id":"055906d8-80e2-4076-9513-0975280a0d89","resolution":{"observed_at":"2026-05-19T08:02:12.255303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylevr: Stylizing character animations with normalizing flows","venue":null,"work_id":"fadecb08-0932-49e0-aad5-56263b4e401f","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:bed48f892ba68d9f051db2e133a72ee2f58ca6ca084276af7aa08c713ec550e1","observation_id":"313c6472-ce22-4da2-b10b-c9340e7c3b27","resolution":{"observed_at":"2026-05-19T08:02:12.295813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chan, Yandong Li, Han Zhang, Boqing Gong, Tingbo Hou, Huisheng Wang, and Yu-Chuan Su","venue":null,"work_id":"4c80685e-458d-4bea-a2e0-0931fdbac032","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:c7042f49fe143611d7c997b76b241a5b5cba307b1f061459741b019d2f31dfce","observation_id":"59b5d566-b501-404c-bf06-cabcd887e070","resolution":{"observed_at":"2026-05-19T08:02:12.228119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09276","last_updated":"2023-03-20T15:58:50Z","snapshot_observed_at":"2026-07-06T14:06:48.707061Z","submitted_at":"2022-10-17T17:27:32Z","title":"Imagic: Text-Based Real Image Editing with Diffusion Models","version":3},"cited_work":{"arxiv_id":"2210.09276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.09276","snapshot_observed_at":"2026-07-02T23:17:28.942618Z","title":"arXiv preprint arXiv:2210.09276 , year=","venue":null,"work_id":"1788e556-8e11-4023-930c-dbb8fc0121a2","year":2022},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2210.09276","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:2d579d8b25939004eba98a5597769bb394b88b9e022b84a3a2a4f2fe26d44d0a","observation_id":"648bc8d7-b6a1-48d9-87cc-bf273ae5d7ef","resolution":{"observed_at":"2026-05-19T08:02:10.501901Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:22d0de7c2ee75ece772f9bf4d4e993eb38d9759073fc9609a3a5880d0a701698","observation_id":"761f4169-abc1-442e-b9b1-f9172730d5af","resolution":{"observed_at":"2026-05-19T08:02:10.298464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15650","last_updated":"2024-09-24T01:25:19Z","snapshot_observed_at":"2026-08-03T19:09:44.636015Z","submitted_at":"2024-09-24T01:25:19Z","title":"ImPoster: Text and Frequency Guidance for Subject Driven Action Personalization using Diffusion Models","version":1},"cited_work":{"arxiv_id":"2409.15650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15650","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imposter: Text and frequency guidance for subject driven action personalization using diffusion models","venue":null,"work_id":"a0970791-5dba-4e22-a726-8072525843e3","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2409.15650","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:c04f6a382a77fd2ac3b11c0ff57fc77c26d6ff3f2930d21ad06a313763d6ee6f","observation_id":"c2fc52d2-75ce-43c5-85f0-0b96e35df57d","resolution":{"observed_at":"2026-05-19T08:02:10.397507Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04488","last_updated":"2023-06-20T16:26:38Z","snapshot_observed_at":"2026-08-05T13:25:19.870503Z","submitted_at":"2022-12-08T18:57:02Z","title":"Multi-Concept Customization of Text-to-Image Diffusion","version":2},"cited_work":{"arxiv_id":"2212.04488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.04488","snapshot_observed_at":"2026-07-09T18:36:27.273245Z","title":"Multi-concept customization of text-to-image diffusion","venue":"cs.CV","work_id":"655cc7bc-e4c0-44ca-86dd-6a0f15818e82","year":2022},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2212.04488","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:0fb2850350d15bc94902690a06632501934e930b2875775db9cd287d34ef3e52","observation_id":"f8e2dec9-9729-4f6f-bcbd-efc075d7bfff","resolution":{"observed_at":"2026-05-19T08:02:10.344999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open-sora-plan, April 2024","venue":null,"work_id":"2b2b52e6-47b6-4a7a-9b82-3923d664dbcc","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:e99d0bad7fe9658f2be14f87216e1484fc1f14a4056da151de3987759b04c8b0","observation_id":"e90fbe00-d53d-43ad-b0a2-ffd806a1185e","resolution":{"observed_at":"2026-05-19T08:02:12.215161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14720","last_updated":"2023-06-22T02:36:06Z","snapshot_observed_at":"2026-07-06T15:32:14.701994Z","submitted_at":"2023-05-24T04:51:04Z","title":"BLIP-Diffusion: Pre-trained Subject Representation for Controllable Text-to-Image Generation and Editing","version":2},"cited_work":{"arxiv_id":"2305.14720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14720","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-diffusion: Pre-trained subject representation for controllable text-to-image generation and editing","venue":null,"work_id":"499fbfc1-949b-4ae0-9d77-c8f54f82bd63","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2305.14720","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:03cba79f4293c3c8a211d9e3ab37fc5551e8f557b4efeb18971f7f7e07a3ee34","observation_id":"5abbf5e6-f46e-4948-9cf0-b905ea3b1bb7","resolution":{"observed_at":"2026-05-19T08:02:10.466298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17154","last_updated":"2023-06-29T17:55:14Z","snapshot_observed_at":"2026-08-03T07:03:34.626283Z","submitted_at":"2023-06-29T17:55:14Z","title":"Generate Anything Anywhere in Any Scene","version":1},"cited_work":{"arxiv_id":"2306.17154","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.17154","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generate anything anywhere in any scene","venue":null,"work_id":"1be95688-5838-4fbd-9b69-6ef443d3eb63","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2306.17154","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:2a1172175587a42c24d6cac94a038bab87403dbb0324587e0dc610d598d5fc23","observation_id":"25e838f5-bdb5-474b-a990-571f274aefcf","resolution":{"observed_at":"2026-05-19T08:02:10.241449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking large vision-language models via directed scene graph for comprehensive image captioning","venue":null,"work_id":"ed7941c2-0a65-4af3-ade9-4bfc8dadfce8","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:faaefd1ff23465e1772b01ba29469b4284bbec05d0909f04b47e567457534501","observation_id":"56c66a59-befe-49fa-9fbb-b2b2a3ea0e92","resolution":{"observed_at":"2026-05-19T08:02:12.206444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11410","last_updated":"2024-05-19T01:40:39Z","snapshot_observed_at":"2026-07-06T15:56:49.865412Z","submitted_at":"2023-07-21T08:09:47Z","title":"Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning","version":2},"cited_work":{"arxiv_id":"2307.11410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11410","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Subject-diffusion: Open domain personalized text-to-image generation without test-time fine-tuning","venue":null,"work_id":"d18a3cf7-e33d-4b7e-9620-75a090143db2","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2307.11410","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:4f36e3cbb72dd1d3c60f302bab9c1d36678f7b231ba7d84a55e4382cb870201e","observation_id":"ccca2125-6a13-4bab-abf8-74f607530c5c","resolution":{"observed_at":"2026-05-19T08:02:10.283785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05275","last_updated":"2024-12-06T18:59:12Z","snapshot_observed_at":"2026-07-06T20:02:57.733746Z","submitted_at":"2024-12-06T18:59:12Z","title":"MotionFlow: Attention-Driven Motion Transfer in Video Diffusion Models","version":1},"cited_work":{"arxiv_id":"2412.05275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05275","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.05275 (2024)","venue":null,"work_id":"559ff5b9-a828-4424-a6f6-327f2556e9b7","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2412.05275","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:acdb89ce481857ed8d73c51a9cafaec2c75ca71e69910682090735aec3e50280","observation_id":"224ba058-2c64-4c74-9627-91d036262755","resolution":{"observed_at":"2026-05-19T08:02:10.565776Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ChatGPT","venue":null,"work_id":"84ac4173-0c20-43b0-b146-cbb5993f0b17","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:0fa7e1cbb3a73f9223aa1189f17abf6226ea5217716514fadf0bb42c89be1800","observation_id":"2e16899b-a1c6-4464-87ac-0addaadd3fdb","resolution":{"observed_at":"2026-05-19T08:02:12.197808Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:b04c6be2c5d7cb7973d0e7d402fe31accbed1896c93dfe225b60dcb04c1ee634","observation_id":"fa21e9db-e7fc-450c-a47c-18885283d7af","resolution":{"observed_at":"2026-05-19T08:02:10.411361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vasa-rig: Audio-driven 3d facial animation with ‘live’mood dynamics in virtual reality.IEEE Transactions on Visualization and Computer Graphics","venue":null,"work_id":"b0ff7cc8-1f40-4028-846d-ce774a739e88","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:e009d50c21c1a22f9867fa957455c7eb19bbe754eced4afa84db93ac9b34b46d","observation_id":"847281cf-04f3-42c4-bc5c-26592cdef6c5","resolution":{"observed_at":"2026-05-19T08:02:12.201779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expressive talking avatars","venue":null,"work_id":"5cf3990e-4d82-481e-b35e-d8e6a8771e5f","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:c0054ca4e3734b208ba9e99a5e17915e634beaf48f856c40c4cd38d3d24c18d0","observation_id":"8ba06e62-13f4-4e35-a1d9-51332664fd76","resolution":{"observed_at":"2026-05-19T08:02:12.210960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emotional voice puppetry","venue":null,"work_id":"e28d91a6-8b40-4684-8ccc-f4c5b12003eb","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:bdc547a905a2fb65e15abb86ab7b4fdc19c7361eda41ebb7d19e44b4b4b30eb7","observation_id":"86058e81-7273-4b11-8ddc-6ca95d97875e","resolution":{"observed_at":"2026-05-19T08:02:12.223335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:04:00.987123Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"37d0e719-864c-45b0-9652-1e73f06e260a","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:82f241d4a360fe0cc4882d334fc92a4a6b1c10cbf0cc840bd567f26f1d87d2c6","observation_id":"6b18ab41-1b18-46db-82e8-b861338f53cb","resolution":{"observed_at":"2026-05-19T08:02:12.299743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mos: Modeling object-scene associations in generalized category discovery","venue":null,"work_id":"e976162f-94f6-4711-b721-0a20f2d9d320","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:43855579813cdbdacb60ec1dd3f3e44617f1151f3e91b2046d82c5bcf1a432d5","observation_id":"d8db7ac2-d9a8-4ff8-b4ca-c4f3279fefc7","resolution":{"observed_at":"2026-05-19T08:02:12.194022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11525","last_updated":"2023-11-20T04:11:16Z","snapshot_observed_at":"2026-07-06T16:49:45.821983Z","submitted_at":"2023-11-20T04:11:16Z","title":"Generalized Category Discovery in Semantic Segmentation","version":1},"cited_work":{"arxiv_id":"2311.11525","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.11525","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized category discovery in semantic segmentation","venue":null,"work_id":"207a9cde-6372-430e-ba53-1b86ff823240","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2311.11525","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:4820810578539ae96b75e1c5e3656160e2f625d22c761324ed878abd29b18860","observation_id":"e14c70ae-d6f5-40b2-8cdb-d491b4a1d3e0","resolution":{"observed_at":"2026-05-19T08:02:10.425406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04483","last_updated":"2023-12-07T17:59:07Z","snapshot_observed_at":"2026-07-06T16:58:27.612525Z","submitted_at":"2023-12-07T17:59:07Z","title":"Hierarchical Spatio-temporal Decoupling for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2312.04483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04483","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical spatio-temporal decoupling for text-to-video generation","venue":null,"work_id":"164ce006-1a15-45d5-b57b-f13dfcc8a048","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2312.04483","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:52bf7e248b8406025bb430c7f9fa0f6e0c35c179fa83f49f0369d63f2830a4e7","observation_id":"37282ae2-2e36-4d2e-b485-3f2915af161e","resolution":{"observed_at":"2026-05-19T08:02:10.432478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"d95f4afd-7c4e-423c-be23-a063964797be","year":2021},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:602189378b28ad17f8e7ddd84d540382f70d8def578f7caaeaa8864e3169d0d6","observation_id":"14eb846d-f11f-472c-87f5-33581afca267","resolution":{"observed_at":"2026-05-19T08:02:12.175913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"eb47c630-8bcd-4f31-bc25-f7c73903d972","year":2020},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:f62ef0c0100aa21729d993342a3d34baf38dee7dfc70a14c8a21fb5a20107a8c","observation_id":"7a00a28c-9265-42ec-b0d9-7d8cc4f36d02","resolution":{"observed_at":"2026-05-19T08:02:12.180278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:4f5855251c2fafba2b31d4397cba815719b6a6cf752813b91b549da5dc3c60c8","observation_id":"5c4a8cb7-2ba3-4757-a2d4-2a5217e32703","resolution":{"observed_at":"2026-05-19T08:02:10.584708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"96d43d77-d9cf-478f-a3ef-8e0d0a0f2d10","year":2022},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:2d847f20754971d4e9e00387fa3f3a8138f2655fb99885da583631b53ee62e57","observation_id":"d27cf806-625e-4214-aec6-e466b412f807","resolution":{"observed_at":"2026-05-19T08:02:12.166777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12242","last_updated":"2023-03-15T17:52:27Z","snapshot_observed_at":"2026-07-06T13:45:31.237782Z","submitted_at":"2022-08-25T17:45:49Z","title":"DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation","version":2},"cited_work":{"arxiv_id":"2208.12242","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.12242","snapshot_observed_at":"2026-07-09T18:36:27.290071Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject- driven generation","venue":"cs.CV","work_id":"a531ae3d-a7d0-4cda-a38f-7ccb769014c3","year":2022},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2208.12242","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:ba2253e7a0a3651ecd35d454a52b044dedd205f31e7584c95d32f7fa7f71a6d7","observation_id":"c2c6c8f6-ea6e-4d61-90dd-11ae31b898fe","resolution":{"observed_at":"2026-05-19T08:02:10.382336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyperdreambooth: Hypernetworks for fast personalization of text-to- image models","venue":null,"work_id":"4283a079-4f20-447e-9a3d-f5f8db5ec74b","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:1e654d333b8cec1d45fe6a0a04b22ed51c1ebda17a67fcb48814cbf67a382abb","observation_id":"4b527691-2c64-45ae-bf37-d6fd753d230c","resolution":{"observed_at":"2026-05-19T08:02:12.162205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Photorealistic text-to- image diffusion models with deep language understanding","venue":null,"work_id":"c87566fb-58f3-4376-ad56-65d00d19dd34","year":2022},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:9e97360a1957d8e99d3ad858172ff426337b9de235ffb5a8b7d1ce8a98323b34","observation_id":"86b48d79-7a9d-4dc3-8dd3-b95141516243","resolution":{"observed_at":"2026-05-19T08:02:12.151189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06527","last_updated":"2025-02-20T02:55:52Z","snapshot_observed_at":"2026-07-06T20:34:02.031605Z","submitted_at":"2025-02-10T14:50:32Z","title":"CustomVideoX: 3D Reference Attention Driven Dynamic Adaptation for Zero-Shot Customized Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2502.06527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06527","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Customvideox: 3d reference attention driven dynamic adaptation for zero-shot customized video diffusion transformers","venue":null,"work_id":"0e0813ab-6006-419a-8846-ea13f8226b20","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2502.06527","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:2b4c98ab9938fc19448080a510ce430fa594853d0525fd0803442d0abc760f3d","observation_id":"10732f66-a21f-477c-91ed-0d5b7ea47e4d","resolution":{"observed_at":"2026-05-19T08:02:10.305173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23280","last_updated":"2025-04-05T14:15:09Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T17:57:21Z","title":"DreamRelation: Bridging Customization and Relation Generation","version":4},"cited_work":{"arxiv_id":"2410.23280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23280","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Relationbooth: Towards relation-aware customized object generation","venue":null,"work_id":"fdf5eaec-6e6a-4e16-9f48-ab429a902c47","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2410.23280","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:761d73fc47287beae90f3cf3455029c6559b22f71a9d90b37a0dde0d94269388","observation_id":"22f19353-fd31-4863-96ca-34547edc23f8","resolution":{"observed_at":"2026-05-19T08:02:10.359946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motionstone: Decoupled motion intensity modulation with diffusion transformer for image-to-video generation","venue":null,"work_id":"74b9cac5-8f02-45b4-b81e-de22cad31d93","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:4d401a4f2ec9d7677da94f6ef573c92de761e0882d44fa72546e6a557701559e","observation_id":"ec5ddebc-33fc-48ff-bc81-4871df2622b7","resolution":{"observed_at":"2026-05-19T08:02:12.171477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"2105a5bc-a4f8-42a4-a4d5-dc914054f5f4","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:7c5638bd6aa901b4fd8853fe6bc6b6b96178407dc760a445b5083c8479464f15","observation_id":"d2c2da22-37aa-4203-8e94-c0b84944c5f5","resolution":{"observed_at":"2026-05-19T08:02:12.118147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"e445f860-dcf2-49d5-8449-c35e746b590b","year":2021},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:de561187a891a05aee4dd586fc95d252a421bcd52b7d48540b66ae73295b7804","observation_id":"dbd8f26e-6686-4eb1-8588-21040d4af66b","resolution":{"observed_at":"2026-05-19T08:02:12.232732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable Diffusion 2.0 Release","venue":null,"work_id":"44b86392-1891-4343-994b-73fb08048275","year":2022},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:d2a81429678129a9cc4628d8373c917aa2bec26aae1dcb4793b237845d06a84e","observation_id":"8d0906e3-71e8-4c00-8703-ca70e06462fb","resolution":{"observed_at":"2026-05-19T08:02:12.049202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hunyuan-large: An open-source moe model with 52 billion activated parameters by tencent","venue":null,"work_id":"9cb4cfd6-d397-4cec-89b9-916a374f028c","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:6208a4f3ba01264b9eeb1fead37dba1b94f2e06a301383e8288df6fc13ce6da9","observation_id":"26bd1eca-dfb8-464c-8efd-86fc2aca3d5a","resolution":{"observed_at":"2026-05-19T08:02:12.109645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mimir: Improving video diffusion models for precise text understanding","venue":null,"work_id":"0b430493-e4af-4504-9676-1efc10eee28f","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:4419aa993d9c58e2d7954fe1b6309f5b274e64808f6bd45b0ee64290d7dba48b","observation_id":"a828fbec-2a56-4787-9432-1ac614659df1","resolution":{"observed_at":"2026-05-19T08:02:12.054039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animate-x: Universal character image animation with enhanced motion representation","venue":null,"work_id":"866207dd-0b15-4684-bcb5-27a18a97ed59","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:ff6601ef861bd34672d401919a7e80f47f0498ff40036214cd6c652d648babdf","observation_id":"7aafec5f-d89f-4e83-943e-1da335583b69","resolution":{"observed_at":"2026-05-19T08:02:12.113904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Edtalk: Efficient disentanglement for emotional talking head synthesis","venue":null,"work_id":"15adbd1c-97b5-4756-b08e-53f5958d1910","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:69b8ee7b64717142aef6960ff7217e0acb8b2ba0a35e164bee920cc52e6fcf20","observation_id":"e6002792-3538-4e1c-a31f-13f4f5e80b4a","resolution":{"observed_at":"2026-05-19T08:02:12.128184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Say anything with any style","venue":null,"work_id":"40a7f3ef-a7ad-4a17-8cdb-60f292774a98","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:7a7a30f42de568c0c1ea58ee6d15f2208d791f488a162cac3fac880debd034ea","observation_id":"d19af50e-b0d9-48be-b893-255dfbc3a2a8","resolution":{"observed_at":"2026-05-19T08:02:12.087999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emmn: Emotional motion memory network for audio-driven emotional talking face generation","venue":null,"work_id":"6eb379ff-9170-429c-8491-7fb880daa655","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:1db107a5d0499650e0e3611d7f1106ea803e1668329ab5b40716bef519dc5a26","observation_id":"5967e65c-efb8-4396-b7d0-a6271f176269","resolution":{"observed_at":"2026-05-19T08:02:12.092415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flowvqtalker: High-quality emotional talking face generation through normalizing flow and quantization","venue":null,"work_id":"c52fbcef-9c9e-42c8-b2de-87fdcd77f68a","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:67e9d40ff123c2f327662c54566b2ade4aa875d641d49b5624f47491ce3c11a8","observation_id":"e2ed14f8-871f-4e5f-adcf-39e50cc89b37","resolution":{"observed_at":"2026-05-19T08:02:12.105147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Style2talker: High-resolution talking head generation with emotion style and art style","venue":null,"work_id":"829533a7-3b52-4ac5-9656-ebc577d6b4a5","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:cadc2a66bef2d8ddd83e3fd6919d8cdda7972544c7337051589a34c2bd25d003","observation_id":"85fa438a-27ff-4092-9090-63d9c70de093","resolution":{"observed_at":"2026-05-19T08:02:12.268956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"105d9a9c-a654-428e-9347-684122668ca6","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:0e154fd7606ac5d6a0cd7add83d64f86a1c451ac1f0e4a4687bb53285061d1a1","observation_id":"b6887621-2b9e-4307-bf19-178c9182c079","resolution":{"observed_at":"2026-05-19T08:02:12.057802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09522","last_updated":"2023-07-15T15:48:48Z","snapshot_observed_at":"2026-07-06T15:04:23.117620Z","submitted_at":"2023-03-16T17:38:15Z","title":"P+: Extended Textual Conditioning in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2303.09522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.09522","snapshot_observed_at":"2026-07-02T16:07:08.994009Z","title":"p+: Ex- tended textual conditioning in text-to-image generation","venue":null,"work_id":"9b12ea52-1c4d-492a-a8db-b0de42ec81a6","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2303.09522","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:8dff3d51c49dd404a844c7df3f01bde9d7be2219ecb679c09012d7f81336a508","observation_id":"8d380d80-da0d-4199-bd52-1abae46bd6d7","resolution":{"observed_at":"2026-05-19T08:02:10.389326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-07-06T16:05:35.645037Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":"2308.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-07-11T01:57:50.025885Z","title":"ModelScope Text-to-Video Technical Report","venue":"cs.CV","work_id":"1b1baf78-58ec-44d0-b700-84dff57b2f1f","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:3e2542cfa9d5642a6d82d7fe7590164941f1e8128c6e72875c94b191191b7b41","observation_id":"97dccc30-a719-4a45-b828-e96ce59a65f4","resolution":{"observed_at":"2026-05-19T08:02:10.578896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20193","last_updated":"2024-10-16T18:35:31Z","snapshot_observed_at":"2026-08-06T01:11:00.872917Z","submitted_at":"2024-03-29T14:14:22Z","title":"Motion Inversion for Video Customization","version":2},"cited_work":{"arxiv_id":"2403.20193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.20193","snapshot_observed_at":"2026-06-30T13:44:40.581238Z","title":"Motion inversion for video customization","venue":null,"work_id":"eb92c9d2-6778-40ba-8d96-ccd3e12c3422","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2403.20193","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:4918d2407e04f65bb8b58f7114dc482820812a6a65230269f3e26948e4ba4367","observation_id":"c40e0aac-9f2d-40d7-97c3-46d5e47a815a","resolution":{"observed_at":"2026-05-19T08:02:10.276503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:4efcb3aeba416cba080288e6e59205f073640c4cd1e047cd906102e810c6059f","observation_id":"8dce6031-506a-422a-90b5-407725958f72","resolution":{"observed_at":"2026-05-19T08:02:10.318941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A recipe for scaling up text-to-video generation with text-free videos","venue":null,"work_id":"a91186ba-949c-4419-82a7-b52696874f87","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:99be00c3d1e45008443c065e4285658cb0e380b876596fd70a8123736d75cb01","observation_id":"2d839ab3-6b1e-4d9c-b7c5-86fbf2d72234","resolution":{"observed_at":"2026-05-19T08:02:12.044566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":"1e3f84a5-62c0-402e-8ac6-9cb1d5bb35d0","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:74599605af38eaef1fdb1f720c514a7d0c6d81f50b3b194c74d0fd708ec01dcb","observation_id":"c6efda44-efad-4c85-8762-93978af032c0","resolution":{"observed_at":"2026-05-19T08:02:12.189028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07602","last_updated":"2025-03-10T17:58:03Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:58:03Z","title":"DreamRelation: Relation-Centric Video Customization","version":1},"cited_work":{"arxiv_id":"2503.07602","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07602","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamrelation: Relation-centric video customization","venue":null,"work_id":"4171db55-f064-497d-ba58-2854ba949efd","year":2025},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2503.07602","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:bd4fe8ab781f45bcb3317a1e94eb50fe6ef8e729c0d6fb3cb59a270d3165df32","observation_id":"5d03f3c6-9d1b-49d4-b115-f606c1edbe46","resolution":{"observed_at":"2026-05-19T08:02:10.270039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13848","last_updated":"2023-08-18T17:12:13Z","snapshot_observed_at":"2026-08-04T02:07:54.822320Z","submitted_at":"2023-02-27T14:49:53Z","title":"ELITE: Encoding Visual Concepts into Textual Embeddings for Customized Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2302.13848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.13848","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elite: Encoding visual concepts into textual embeddings for customized text-to-image generation","venue":null,"work_id":"0f52104e-2d64-4f37-a7f8-e9a44c02d75f","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2302.13848","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:49ce704c01d73a7b149310de641b64bf7e0a925bcb2f7ccc0a2c23bbee08a4f9","observation_id":"02bda76d-e424-4691-969f-c0f4595b5dd1","resolution":{"observed_at":"2026-05-19T08:02:10.375261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"fbe0e85d-5e47-41a0-8464-8baee3ae7a5d","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:43a2ac62d288167ab513ecb1de91d9232873663f1d804ecb675aa9ea21d5f119","observation_id":"ea3567c5-4769-460a-a90a-3b6944d14b55","resolution":{"observed_at":"2026-05-19T08:02:12.075094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2406.17758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-07-03T10:17:57.923573Z","title":"Mo- tionbooth: Motion-aware customized text-to-video genera- tion","venue":null,"work_id":"f0160eed-d753-4fc7-becc-433843258af9","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:5e2eb3444b48a128078c8c11458af9429b3a10b4865a4fd4ef4774a0a6b9bcb8","observation_id":"8b73aebd-0140-40db-8b6b-30be63da433c","resolution":{"observed_at":"2026-05-19T08:02:10.614007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19645","last_updated":"2024-12-30T02:50:45Z","snapshot_observed_at":"2026-07-06T20:13:40.548345Z","submitted_at":"2024-12-27T13:49:25Z","title":"VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2412.19645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19645","snapshot_observed_at":"2026-07-03T08:17:45.922106Z","title":"Videomaker: Zero-shot customized video generation with the inherent force of video diffusion models","venue":null,"work_id":"f1105b8c-7f89-47bf-b280-9ac02ee9aee2","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2412.19645","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:efa81ece0e57f4cfcac948ab4c1b671cfa7bc613b51842a4bc561fbba9a4f5d0","observation_id":"85200cf7-3b60-4892-8817-72461ee0b9e9","resolution":{"observed_at":"2026-05-19T08:02:10.490458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13239","last_updated":"2024-12-27T13:58:39Z","snapshot_observed_at":"2026-07-06T19:05:14.227812Z","submitted_at":"2024-08-23T17:26:06Z","title":"CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities","version":2},"cited_work":{"arxiv_id":"2408.13239","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.13239","snapshot_observed_at":"2026-07-03T10:17:57.898895Z","title":"Customcrafter: Customized video generation with preserving motion and concept composition abilities","venue":null,"work_id":"97da478c-8f69-477c-abc9-4577c78991de","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2408.13239","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:6c5a6e0101d12d30492641a8c9eb55f7d8a3693bb6ae5a94ee95b9ec2abd89f1","observation_id":"18161855-8512-4f01-8c79-8905e9efe585","resolution":{"observed_at":"2026-05-19T08:02:10.607556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2410.10629","doi":"10.48550/arxiv.2410.10629","metadata_source":"pith","pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","venue":"cs.CV","work_id":"c53bf282-3c74-4c37-a7bd-6531aee212b8","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:9264243e253c8c923ee480fd4a4a5e08d05da709db1f3cac9f25b08eeeae6c2f","observation_id":"a6ba775a-6ba4-4a59-81ad-563bacc09166","resolution":{"observed_at":"2026-05-19T08:02:10.600384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09710","last_updated":"2023-08-18T17:58:44Z","snapshot_observed_at":"2026-08-06T05:11:38.959077Z","submitted_at":"2023-08-18T17:58:44Z","title":"SimDA: Simple Diffusion Adapter for Efficient Video Generation","version":1},"cited_work":{"arxiv_id":"2308.09710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09710","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simda: Simple diffusion adapter for efficient video generation","venue":null,"work_id":"44ec24bc-2079-4451-9f10-77114adc273a","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2308.09710","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:bfe0d7bc26d2591a7bd6e67bfb8fb440b726b17ddbc2ef4deceb6c004ed814de","observation_id":"c1bc7727-e8e0-4466-8dae-752d1999253e","resolution":{"observed_at":"2026-05-19T08:02:10.442544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16223","last_updated":"2023-06-01T02:27:42Z","snapshot_observed_at":"2026-08-03T15:51:59.551339Z","submitted_at":"2023-05-25T16:30:07Z","title":"Prompt-Free Diffusion: Taking \"Text\" out of Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":"2305.16223","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.16223","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prompt-free diffusion: Taking \"text\" out of text-to-image diffusion models","venue":null,"work_id":"9231f36d-48ac-46e6-971d-dd572f681f94","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2305.16223","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:041daae4a1245f990fc125c553e98b24dbc24c9d350cd805389b0a3d4ec9f078","observation_id":"dea3775c-01e5-4182-82ca-431156cf7cbb","resolution":{"observed_at":"2026-05-19T08:02:10.249676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:f5ac8ddabf1f95f30db79db9d07f263481d5494d85e10a00a95eaf824b369d76","observation_id":"b5d09024-2a1e-45c3-b2ae-fe259f5bcd2d","resolution":{"observed_at":"2026-05-19T08:02:10.507341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Space-time diffusion features for zero-shot text-driven motion transfer","venue":null,"work_id":"c29eb20f-1ffd-43b7-9ff2-48deb0153275","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:28c8457667797166dbafc7cfc6e2921e3fc059efc7f6276f80eb8f543a6b3cf1","observation_id":"8903b534-9cf1-4b72-b1e4-67c085a8d2a6","resolution":{"observed_at":"2026-05-19T08:02:12.070817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2308.06721","doi":"10.48550/arxiv.2308.06721","metadata_source":"pith","pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"98e51b10-54bd-4251-8a2d-f79bd6215c19","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:4b9ab0a63637be57554b42d9ebf4b3dd1a94172e38d7188fcd4401cf6bcc5ba9","observation_id":"57016c3e-558d-4284-ae8f-60699b460cb0","resolution":{"observed_at":"2026-05-19T08:02:10.484831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05355","last_updated":"2024-12-06T18:59:17Z","snapshot_observed_at":"2026-07-06T20:03:02.297824Z","submitted_at":"2024-12-06T18:59:17Z","title":"MotionShop: Zero-Shot Motion Transfer in Video Diffusion Models with Mixture of Score Guidance","version":1},"cited_work":{"arxiv_id":"2412.05355","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05355","snapshot_observed_at":"2026-07-03T16:28:38.478684Z","title":"Motionshop: Zero-shot mo- tion transfer in video diffusion models with mixture of score guidance","venue":null,"work_id":"cdf1e7ed-2798-487d-afbc-cf8894308f71","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2412.05355","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:f358968a7b4b1f018348c12b6d375ea525f2ca540114efcab4a90e0874ab146d","observation_id":"bbdb52ac-cb23-4abd-aa0c-5035ef792f8d","resolution":{"observed_at":"2026-05-19T08:02:10.418659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12490","last_updated":"2023-12-19T17:55:16Z","snapshot_observed_at":"2026-08-05T16:05:50.440633Z","submitted_at":"2023-12-19T17:55:16Z","title":"InstructVideo: Instructing Video Diffusion Models with Human Feedback","version":1},"cited_work":{"arxiv_id":"2312.12490","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12490","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructvideo: Instructing video diffusion models with human feedback","venue":null,"work_id":"7ff7b124-baa3-4a45-b7df-7e81ac4ec973","year":2023},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2312.12490","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:dbc0a44ac6698bdec07eb6f5fc8b8ac44804884dfbcd0721eb0ab178622ce139","observation_id":"588b85d0-ab55-4ce7-abe2-0f11d7c565bf","resolution":{"observed_at":"2026-05-19T08:02:10.552578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":1,"unresolved":1,"verified_exact":42,"verified_fuzzy":53},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 2 inbound Pith citation observations for arXiv:2506.23690."}