{"as_of":"2026-08-19T19:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e900d8acd072393653d45850e36ff87bd3efa7dc5d8e5acd8afc7efbe491b1b","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:34:44.921475Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11752/citation-record","integrity":"/paper/2608.11752/integrity","json":"/paper/2608.11752/citation-record.json","paper":"/paper/2608.11752"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.614662Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"ce366890-d6df-461d-bb73-ec8a85a8bc98","year":2021},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.758406Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:bddc1291b629e1125c41a13a7f247317579fb7f9bfebc92c9ec9804cac09f8cb","observation_id":"e0a2bd94-66fd-41ab-82c9-92f5384b7982","resolution":{"observed_at":"2026-08-16T00:34:45.617921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.605373Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffu- sion","venue":null,"work_id":"4b304089-bef4-4df7-b6b6-de082682b508","year":2024},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.762274Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:57f85c2b885ce960d7a138d27362c14876a66f7dc154465429406e75e5f3adf6","observation_id":"131cc951-9f92-4247-b836-801728c96427","resolution":{"observed_at":"2026-08-16T00:34:45.608749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.596314Z","title":"Simswap: An efficient framework for high fidelity face swapping","venue":null,"work_id":"46f3fff0-9403-472b-b610-7a36e91d39ba","year":2020},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.765808Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:83a564c6b3e0f1c05c2ea1e223281b2aa5157523fbb2eba3c045b1c0144bbfd4","observation_id":"80487082-2489-480d-aafb-69e303f873f6","resolution":{"observed_at":"2026-08-16T00:34:45.599587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:44.769542Z","title":"Wan-animate: Unified character animation and replacement with holistic replica- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.769542Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:d64af122e88e6045646f662f033e6db432779524ca14e722eed083fca4b56022","observation_id":"4b5412f7-ae97-47f5-a7b4-c92da1f5e8f4","resolution":{"observed_at":"2026-08-16T00:34:44.769542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.586830Z","title":"Out of time: Auto- mated lip sync in the wild","venue":null,"work_id":"cc007917-3cee-4ea4-908c-043c42b537ad","year":2016},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.772765Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:4c65c9f789f1abd8c801a04557d857f3f9157ff3f0f47df2a58a2dc89e3b457b","observation_id":"41245199-c981-429f-b2e9-d543c56e4958","resolution":{"observed_at":"2026-08-16T00:34:45.590449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.577663Z","title":"High fidelity neural audio compression","venue":null,"work_id":"0f375152-cf35-448c-8ed4-a7689da0abb2","year":2023},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.776021Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:0e924f23eb3486d707947cc9bea5a24af09a33c7810d4c4a8c94a5a43a83a75e","observation_id":"4928abc3-0ffe-454e-b5c4-bfa568fe2e5a","resolution":{"observed_at":"2026-08-16T00:34:45.581075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-16T00:34:44.779593Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic to- kens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.779593Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:c24fa7b3c0d4f5713c360a7c2b1526e37078e56bb8c3b7682849798bca2dcb65","observation_id":"1e77cd2b-6f56-4497-96f8-6ca223385895","resolution":{"observed_at":"2026-08-16T00:34:44.779593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.568479Z","title":"Freeman, and Michael Rubinstein","venue":null,"work_id":"eadee867-42b1-4564-814d-410623211fe2","year":2018},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.783139Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:76e771390b4febaeeb352b3dcb57b4209293ecf84a10a07eadc6c265adc1b2de","observation_id":"ce80ddc6-bd10-4157-8407-f312b4e86e03","resolution":{"observed_at":"2026-08-16T00:34:45.571614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-19T16:28:33.825358Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10783","snapshot_observed_at":"2026-08-16T00:34:44.785950Z","title":"Video diffusion transform- ers are in-context learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.785950Z"},"links":{"cited_paper":"/paper/2412.10783","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:a62c4de2f00acb711d830fb8ce164547f79563a6a04cf0b9b6c1f13f9248d573","observation_id":"ea42b9c8-20c1-4395-a209-de4a99b83469","resolution":{"observed_at":"2026-08-16T00:34:44.785950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.558611Z","title":"Infoswap: Information bottleneck disentanglement for identity swapping","venue":null,"work_id":"ec306aa3-7c5b-4380-a0a5-398f4ad88da6","year":2021},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.789439Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:07d696c5ae1704dd8d68061ff7136266d687098d6106334ebff2ccd21a8370b9","observation_id":"13ae0261-a23d-4d0b-b3b5-7e85f30771a4","resolution":{"observed_at":"2026-08-16T00:34:45.561843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-08-18T20:29:58.857701Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-08-16T00:34:44.792702Z","title":"Ltx- 2: Efficient joint audio-visual foundation model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.792702Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:8fd3106f97ecca821ac1ce5d9fc87dc56a972357a665156babbd73ebe47dbd42","observation_id":"d2593158-ce82-4d20-a5fd-2699eebc81c1","resolution":{"observed_at":"2026-08-16T00:34:44.792702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04213","last_updated":"2025-06-05T03:35:21Z","snapshot_observed_at":"2026-08-16T21:42:42.894310Z","submitted_at":"2025-06-04T17:57:09Z","title":"FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04213","snapshot_observed_at":"2026-08-16T00:34:44.795982Z","title":"FullDiT2: Efficient in-context con- ditioning for video diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.795982Z"},"links":{"cited_paper":"/paper/2506.04213","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:92dc2045ba54bc7a0aceff97e607d93bb220d5ef813fc21c073d75ff839aeee4","observation_id":"84d79091-442b-4a65-9d08-8155f7354844","resolution":{"observed_at":"2026-08-16T00:34:44.795982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.549065Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"79eed8d5-09ba-461b-a111-ddf47a749ab0","year":2022},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.799943Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:337a9fa660dc356e3f7e916be0394223ab8f1509430da36b25ce7b3240faf5a9","observation_id":"ef0750c1-638e-483d-8947-82f86d380629","resolution":{"observed_at":"2026-08-16T00:34:45.552326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-18T10:31:16.201312Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-16T00:34:44.802842Z","title":"Hunyuancus- tom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.802842Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:9feaa526676ebed100d97fddd4f181215b84f4c6246ff1953aac3dd96c51bd9e","observation_id":"1aad171a-0f5d-4b06-a868-d2a11f8e1f47","resolution":{"observed_at":"2026-08-16T00:34:44.802842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23775","last_updated":"2024-11-05T06:41:27Z","snapshot_observed_at":"2026-08-17T23:31:59.305347Z","submitted_at":"2024-10-31T09:45:00Z","title":"In-Context LoRA for Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23775","snapshot_observed_at":"2026-08-16T00:34:44.806956Z","title":"In-context lora for diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.806956Z"},"links":{"cited_paper":"/paper/2410.23775","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:9d2a7bce4a1d38539905abc01aae7a1d9dd3c3bdd6a4a1fa5db296de828a3a3a","observation_id":"45c9d40e-5cc9-42ac-aa28-f3ff1e0ebb9f","resolution":{"observed_at":"2026-08-16T00:34:44.806956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-15T15:02:59.826496Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-16T00:34:44.810403Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.810403Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:9b11071db726073fa54a075a8045240385485baa72e9622d74a77f9d7e22b908","observation_id":"ca726dfa-3ba5-4a90-8266-6570709a4c23","resolution":{"observed_at":"2026-08-16T00:34:44.810403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04996","snapshot_observed_at":"2026-08-16T00:34:44.813743Z","title":"Ref-vc: Robust, expressive and fast zero-shot voice con- version with diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.813743Z"},"links":{"cited_paper":"/paper/2508.04996","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:711e6e9bc4dcaa1312ba3a4bc170100a669199098d26e0e94ba1264daaacdfab","observation_id":"44c1d740-c104-4cd3-b809-a566076147bc","resolution":{"observed_at":"2026-08-16T00:34:44.813743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-08-16T00:34:44.817988Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.817988Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:e360b1517edf460b75f16a4bb75d265bc4cb3163ae6b2fcca4216b34a72d6573","observation_id":"c48a0d8a-00f4-4601-bf67-0ed00ea735c8","resolution":{"observed_at":"2026-08-16T00:34:44.817988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.540028Z","title":"Faceshifter: Towards high fidelity and occlusion aware face swapping","venue":null,"work_id":"398e7d4d-e2f1-43e4-a6ae-2fa2d110b9fb","year":2020},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.821578Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:070181b37dfaa27e8776ccb3558ea56d9592a1721a1abc6a451ac7095134d2cf","observation_id":"6483e68a-ab90-48ca-88f1-d0ec1eea21fa","resolution":{"observed_at":"2026-08-16T00:34:45.543317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.528389Z","title":"Rolling forcing: Autoregressive long video diffusion in real time","venue":null,"work_id":"ab6162c5-6453-4ab3-90d2-ac64a0cdf9d5","year":2026},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.824578Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:f79ec2ea2f9745fbbee80828a7210a243ea1674fbbfe70239e9ba02dc12a424e","observation_id":"6515f221-9296-4b83-9bc6-6fba7e6d4e29","resolution":{"observed_at":"2026-08-16T00:34:45.533176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.517928Z","title":"JavisDiT: Joint audio-video diffusion trans- former with hierarchical spatio-temporal prior synchroniza- tion","venue":null,"work_id":"e278e99b-6479-4c0b-b526-74495b897ad0","year":2026},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.827507Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:f4953761530cfeb8582cfed6da94ebfa6fc19b2f3b5a29f482053121ee814eba","observation_id":"1de3ba52-1241-4d3e-888c-d7004100fa8e","resolution":{"observed_at":"2026-08-16T00:34:45.521525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-18T12:41:13.446582Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-08-16T00:34:44.830514Z","title":"Zero-shot voice conversion with diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.830514Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:e427d6a95caccde011ba519d06d8370eb60a412257c105f739522a3f79e46b84","observation_id":"02750d3b-f5d3-46e8-8522-9a31d5734a70","resolution":{"observed_at":"2026-08-16T00:34:44.830514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.508250Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"8beb87d7-6ff0-40d8-a104-6421d616bfc2","year":2023},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.833696Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:702073a79c7c930874eace97d3b92101cc8af1276bd5cb987b01162d8e6a1777","observation_id":"f19a9fc5-caa5-49ba-9085-a4bbcfb44244","resolution":{"observed_at":"2026-08-16T00:34:45.511740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01479","last_updated":"2024-08-18T16:36:50Z","snapshot_observed_at":"2026-08-17T05:27:37.272553Z","submitted_at":"2023-12-03T18:41:54Z","title":"OpenVoice: Versatile Instant Voice Cloning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01479","snapshot_observed_at":"2026-08-16T00:34:44.836725Z","title":"Open- voice: Versatile instant voice cloning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.836725Z"},"links":{"cited_paper":"/paper/2312.01479","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:97d45d3cd595b037d70c3d6d8a3ea322afc3346e41cf9653986e86c29d51cbd4","observation_id":"c0e569ce-d332-4391-a1f8-166049140720","resolution":{"observed_at":"2026-08-16T00:34:44.836725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.497541Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":"0f87f849-a4bd-44e7-bb71-d301f4876ec7","year":2025},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.840178Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:62d8a3cca8c50c2b825dbae4049714fe415c30354e2f005161256358c902f177","observation_id":"7fea2ab3-3036-4c28-b478-673e796c16bc","resolution":{"observed_at":"2026-08-16T00:34:45.501215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.488076Z","title":null,"venue":null,"work_id":"00e78a25-6488-49ab-a96c-b5d5abd88959","year":2022},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.843641Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:7fca4ce126376d386d32d76e782c7aeb49159e50181f7fbc54b03bba7351db73","observation_id":"4b19e922-6906-4475-b323-9d24855ffcfd","resolution":{"observed_at":"2026-08-16T00:34:45.491605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.478070Z","title":"MM-Diffusion: Learning multi-modal diffusion models for joint audio and video generation","venue":null,"work_id":"9182bfeb-131c-49e0-be19-3280d4848f92","year":2023},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.847306Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:a7b4eff5928a2c00afcb31824d05dc5f8527c9e87ad2ee0fb6e091cbdbd2e7ad","observation_id":"53991683-2ff0-40f4-9991-609ffbaceea2","resolution":{"observed_at":"2026-08-16T00:34:45.481419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:44.850720Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.850720Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:d84c56259e4d6c4312c3500fbd5e8ec6a418ec31a9562ce43d389fec7cf11981","observation_id":"257e803d-5781-4ce5-9c0b-659b4e0d74de","resolution":{"observed_at":"2026-08-16T00:34:44.850720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.462757Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"8a4fcde5-10d9-460e-abdd-7aa2c2336af7","year":2024},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.854000Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:3cc6fad0ff3760cc07dddbe588cc6ac53abb49a1aeed6f9136db728c1f910edc","observation_id":"9fd3a51e-658e-4533-bf93-f464a06f43ef","resolution":{"observed_at":"2026-08-16T00:34:45.466367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:44.857252Z","title":"Omniforcing: Unleashing real-time joint audio- visual generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.857252Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:2a96f851079290fcf7167a6da0bda9ba64725873836feddb3154fab432278504","observation_id":"99ab2679-559d-454a-a029-d90548a7a6b3","resolution":{"observed_at":"2026-08-16T00:34:44.857252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-16T00:34:44.860514Z","title":"Wan: Open and advanced large-scale video gen- erative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.860514Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:b752b30691ef2b8349943708e9b32a036d5a6198bab6971b33196791959249a0","observation_id":"89528c1c-f894-4ead-a3dc-9ca6444e4839","resolution":{"observed_at":"2026-08-16T00:34:44.860514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.453579Z","title":"Generalized end-to-end loss for speaker verification","venue":null,"work_id":"3acd44fc-fe62-439e-8309-890da4b7e6a1","year":2018},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.864312Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:53ad293d2111104e309322b4b1652d21b8502fd5c512f759364c5367fbd9c1a0","observation_id":"fe34031a-b2e8-43af-b62a-73bcf18a7490","resolution":{"observed_at":"2026-08-16T00:34:45.456924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.444384Z","title":"Bovik, Hamid R","venue":null,"work_id":"0962d900-8897-4544-a541-a9c80948d9ce","year":2004},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.867781Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:7d2256d0f702f2335f6abf406c505f79123c4b0bf527c660d4b215295390a321","observation_id":"58307b3f-a855-4825-a056-cf32436d8b5c","resolution":{"observed_at":"2026-08-16T00:34:45.447706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.435219Z","title":"Williams and David Zipser","venue":null,"work_id":"b3f699f1-cc49-4c34-b8e2-6337273a80c5","year":1989},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.871050Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:00c429386734581045aa4fa83b9cec03d36b57747ab8ec528abe4abd0ad9822b","observation_id":"cf83fc06-4075-4d70-aa5f-d8ce9cba181e","resolution":{"observed_at":"2026-08-16T00:34:45.438474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.425541Z","title":"Q-Align: Teaching LMMs for vi- sual scoring via discrete text-defined levels","venue":null,"work_id":"2a21f04c-c60a-442b-8dd9-d5701a0a51d7","year":2024},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.875183Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:f55818fbb546ac1b2c9e3c5b879d01b9a7d9afcc647df6334331376174a6e390","observation_id":"bb0d50fc-89bc-41b0-a29b-4eedf4bd61e7","resolution":{"observed_at":"2026-08-16T00:34:45.429404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.416195Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"e3c06997-8dc1-4327-b457-b650b32792fe","year":2024},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.878806Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:6fe1d7870934a5950a56f11d55c53ea49fe83cc3c91be3df2fb843dd8911c1e3","observation_id":"9a94d4ea-e773-4e0f-b6b3-5873782d1241","resolution":{"observed_at":"2026-08-16T00:34:45.419609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.406531Z","title":"Vit- pose: Simple vision transformer baselines for human pose estimation","venue":null,"work_id":"cd8dc1ea-9b1d-4924-8ff6-5443a328e623","year":2022},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.882068Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:1fd8fa55407486d6637c7c6ce78c85ac78f764b013bd88c3519bfa07a0015bf8","observation_id":"afb43cf0-ccee-4f73-add5-d82decaa9806","resolution":{"observed_at":"2026-08-16T00:34:45.409786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:44.885408Z","title":"Mocha: End-to-end video character re- placement without structural guidance","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.885408Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:5f251a13aaf64fda47bf233028bc2866bf418caafee870bfd51e077d349a3373","observation_id":"fd0df51c-5499-4fe8-b510-0302c302c4da","resolution":{"observed_at":"2026-08-16T00:34:44.885408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10804","last_updated":"2026-08-05T01:57:13Z","snapshot_observed_at":"2026-08-13T04:21:58.755533Z","submitted_at":"2026-06-09T12:49:34Z","title":"SCAIL-2: Unifying Controlled Character Animation with End-to-End In-Context Conditioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10804","snapshot_observed_at":"2026-08-16T00:34:44.888795Z","title":"Scail-2: Unifying controlled character animation with end-to-end in-context conditioning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.888795Z"},"links":{"cited_paper":"/paper/2606.10804","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:96b8ddd8c32fd557bf9b866ee9fe512127e8c2fd5cbdc557bcfa681842cb3718","observation_id":"34d99a8a-e375-42f7-846f-178ac4403970","resolution":{"observed_at":"2026-08-16T00:34:44.888795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-16T00:34:44.892364Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.892364Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:7c0e8380ba4d87244af05c812d5ecac57f9edad2b112851e0616f3cc56118b3c","observation_id":"075238d9-9d63-4afa-9e59-aabaf7e7e446","resolution":{"observed_at":"2026-08-16T00:34:44.892364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.395457Z","title":null,"venue":null,"work_id":"491e4495-b6e7-4841-96a2-07533baefe7b","year":2024},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.895952Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:107ed2d8655be1928ed8514182b6e44cf9f3573196c3ee010e63f735e245a85e","observation_id":"92a404c2-381d-4a3c-ba4d-5b6e4d836660","resolution":{"observed_at":"2026-08-16T00:34:45.399087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.384233Z","title":"Freeman, and Taesung Park","venue":null,"work_id":"1c3ac1ba-456a-4b17-8c70-3fdb922cb6cb","year":2024},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.899017Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:7d456a4e0fa3fa1733aef3b6fef4dfe5a74ba3576849de37abd17640a988dcd4","observation_id":"ff9bd18d-c2e3-4c90-b0a7-b8a03b906b33","resolution":{"observed_at":"2026-08-16T00:34:45.388288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.373801Z","title":"Free- man, Fr´edo Durand, Eli Shechtman, and Xun Huang","venue":null,"work_id":"2260c839-b85c-461e-8bdc-d138a9ee6bf4","year":2025},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.902081Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:6c5d397ed2d05864dc8ba05d2bcbaa4058b742e0932855e476116471ea6956c6","observation_id":"4492e9ed-aa5a-494e-b2ff-17a36c0cc83b","resolution":{"observed_at":"2026-08-16T00:34:45.377929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.363220Z","title":"The ablated variants exhibit increasing identity drift and vi- sual artifacts in later segments, whereas the full model re- mains more consistent","venue":null,"work_id":"f1cd20ba-a22e-4db8-8b31-7bdbe7edb752","year":null},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.905261Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:0060d90a4c388e543d2166f55a4438c35aeee88d9f12b62483b5aa3b7209c400","observation_id":"0c368f77-fe29-47d4-9c41-cd7a5dc58c3e","resolution":{"observed_at":"2026-08-16T00:34:45.367030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.351712Z","title":"The reference cache persists throughout generation, source keys and values are tem- porary, and completed target blocks are committed to the clean-history cache","venue":null,"work_id":"bad6cdad-fdea-4b89-8a7e-7e27f2d08716","year":null},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.908491Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:6fdb1e2f8d52cdb70a716a263563f1adcae0e8be7cbfec0f58f97aa1f3ae94a5","observation_id":"de58b078-ca90-434e-af6a-44373ebb30cc","resolution":{"observed_at":"2026-08-16T00:34:45.355170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.341511Z","title":"The study compared UniSwap with four video-replacement baselines, each paired with Seed-VC following the cascade protocol in Table 1","venue":null,"work_id":"d7136a17-18aa-4ef0-b897-4a8570088333","year":null},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.911900Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:51ffb0fe3888b946a6d5066d06d4d8a6918480daec0c0d8d7286840f92d51940","observation_id":"896a7ddd-61ad-43c7-bf44-608589ad03ca","resolution":{"observed_at":"2026-08-16T00:34:45.345225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.331239Z","title":"In all figures, each example con- tains a reference image and reference voice clip, a source video and its audio, and the joint audio-video output pro- duced by UniSwap","venue":null,"work_id":"a67ec8c6-767b-46a6-baca-6a4e1434367b","year":null},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.915155Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:f44438afead22de5e2436c4747be1d573bdb86f6e29e3f6507c305fa988fa55f","observation_id":"bc9a1f1d-3ab5-4c1e-a6e3-b7bcdeca3c31","resolution":{"observed_at":"2026-08-16T00:34:45.335051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.319686Z","title":null,"venue":null,"work_id":"cb516f6c-2333-4ce7-91fc-2cc76da46d7f","year":null},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.918493Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:ed3caf05113e550dfeff4ef2d40abff2ffd925735903943166780e1282314a62","observation_id":"a15be8c3-6fd1-496e-9ff5-4214f51def9c","resolution":{"observed_at":"2026-08-16T00:34:45.323486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:34:45.306818Z","title":"Deployment should require consent and provenance mechanisms, visible disclosure where ap- propriate, access controls, and compatibility with forensic detection tools","venue":null,"work_id":"4b6b114b-351b-4a64-a764-4dad0b777205","year":null},"citing_paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:34:44.921475Z"},"links":{"citing_paper":"/paper/2608.11752"},"observation_digest":"sha256:f24d18962585f4250f07397107f0cb0748a32a6d60c1dbf50f2684b352fc21ef","observation_id":"fd69542b-0ccd-45b2-8e7a-6dea3a7af39e","resolution":{"observed_at":"2026-08-16T00:34:45.312445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11752","last_updated":"2026-08-13T06:23:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T15:43:32.663997Z","submitted_at":"2026-08-12T07:45:39Z","title":"UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2608.11752."}