{"as_of":"2026-08-06T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71a43ad29f9a4df05ee610ccf7bc22e93ceeedb6da7a5404dd1973f865ab6dc9","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T07:50:56.947671Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.30230/citation-record","integrity":"/paper/2605.30230/integrity","json":"/paper/2605.30230/citation-record.json","paper":"/paper/2605.30230"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"A morphable model for the synthesis of 3d faces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:fa278a138ce8af6c8016f397c66b1da4f2e4b353eef9953af6ce8e5f89bbf95b","observation_id":"158878bb-2764-4cb4-bc92-b4db6567b7a6","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:d4b548f184e427757854feb62f2b56906cf42d195dd5bca3aae2db9173e3c5f8","observation_id":"54dc6a8c-bd38-49c6-92c4-6b7f186af7da","resolution":{"observed_at":"2026-06-29T07:53:13.352553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"A no reference image blur detection using cu- mulative probability blur detection (cpbd) metric.Interna- tional Journal of Science and Modern Engineering, 1(5),","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:a71764a55e28e4d6d21e0bdf7a13d95215273eab28c7e34d159c9e3ac98cc316","observation_id":"29a8aa5a-91fc-4ec1-bdb9-454dee1a07d5","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset.IEEE transactions on affective computing, 5(4):377–390, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:973b98f01a62ac440d8fee7e1f60764cacfeb41d4b2823acac7632e620cc8c92","observation_id":"e4abc6e1-f003-421a-9047-bc0b296d80f9","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:e5152962e9915ae75896329cbebd2d738acd6cec8819455a6651a43d47869057","observation_id":"22e9ea92-5e1f-41fa-8633-8fe1fa90e322","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-03T11:40:51.182181Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":"1412.3555","doi":"10.1145/2939672.2939875","metadata_source":"pith","pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","venue":"cs.NE","work_id":"c7f2f5a9-ae4b-48db-aff0-24b9d0528995","year":2014},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:1f53f59edd4ee6e273938124e06afa9ea283d28ba004c0501b90de05047f16e0","observation_id":"12454229-ab24-45cb-92d3-ac8b8d3a7b10","resolution":{"observed_at":"2026-06-29T07:53:13.381159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-19T20:22:37.170537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T20:22:37.170537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Out of time: auto- mated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:df713504a136929a362be79902b905d4d3ea2e5343f7aab8361b52243c82b2e2","observation_id":"899595d1-4933-4ae9-9dbc-dee115267ad7","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-04T08:09:48.365818Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":"1806.05622","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-07-05T12:41:04.363820Z","title":"V oxceleb2: Deep speaker recognition","venue":"cs.SD","work_id":"34bd493f-4aed-4603-a33c-9658bfb84686","year":2018},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:9bcf71087b2c7e4b67ba6725b5dbf4c3f11dfc4b93866009db1268d13ec25ac0","observation_id":"54d5e6ca-0fb2-4633-ad75-d2ef26479d5b","resolution":{"observed_at":"2026-06-29T07:53:13.378912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:333d2b9cf97aa2aed5af2c4ed8a07a84c43d49c8c68ec2700b2a7f5f1417d85d","observation_id":"49b7f15e-7bf3-4ab7-8cb5-9e5594e07e6d","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:91aaccec909b5371f3cfc22ccda628fd736cead9c1cc3bdcf466780036f58453","observation_id":"abc18808-f875-4add-af7c-f0872658280c","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Generative adversarial networks.Commu- nications of the ACM, 63(11):139–144, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:0c5b69c1932fb4612e9627c6b4451f798f899b438cb3a5c7a90f82310c1e59c2","observation_id":"faa24f3c-407e-4809-b3b2-906bb85cf988","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Generative adversarial nets.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:022eb1b81afc16a41b6c6fc3f61a24a8b7a1a5888decd2120bd4b4711a828764","observation_id":"1732ee76-5d22-4a22-af68-2e08474b8a90","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Generalized procrustes analysis.Psychome- trika, 40(1):33–51, 1975","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:2ff3f05c9a7533ead88e6a6924ffecd68fb7d38c8ff37dcf74720d4700faf040","observation_id":"d3510382-f6c7-4375-a2e5-5839afc77837","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:25d9e183b42757c82b544f543f19862300f751a06f1283b39275e76c8a4456ae","observation_id":"91e3457b-b9d6-41af-917f-f184338a3d7b","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:d1904071d93aafc0ab8bd511e68c1f04c511513e60794eac1a526bf6bcfd23fc","observation_id":"ac4ba313-a31d-47e7-bbf2-21b0a158f264","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:56901fd2a31a28f10961fe0b0fd9ce4195f8c53c273ee84320f61e9b0fec5fa3","observation_id":"9cb31306-7fc8-4cac-8e1d-f619742ab85f","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Long short-term memory.Neural computation, 9(8):1735–1780, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:6b97838acafcfcdc3777ced12325dd6f6a86e07e9072b65627db7f672db2cf7b","observation_id":"825201cf-afaa-4dc9-b08b-227329b464f9","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"A multiresolution 3d morphable face model and fitting framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:134e57d0ea6f21eff277513c6cf822d20e0e91287ad9b9f4fe3cb7e5d958f47b","observation_id":"f1ec6658-00a4-4536-b232-d4c3684102b6","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Eamm: One-shot emotional talking face via audio-based emotion-aware motion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:ed3d08c974122f97f96ae2dac8b432b5467f10d62b8525d7a1f462f2b4279792","observation_id":"86b0bb51-247f-4be6-b50b-23564fcd333a","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Sonic: Shifting focus to global au- dio perception in portrait animation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:bfc22bc250e9f2d95086d6cc3ead67ed144645cb27ef953d7316ecdfe825d7a0","observation_id":"1324c729-c8a7-4d03-9a81-5639a3c0ff12","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":"2409.02634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-06-29T07:53:13.362380Z","title":"Loopy: Taming audio- driven portrait avatar with long-term motion dependency","venue":null,"work_id":"859b3e77-263d-470a-b684-a710acd16630","year":2024},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:640a569d5cf65ff120e8a8505f2f6d83cda7cee61cb40dc079ddaedd1af428f1","observation_id":"c65b835d-a955-46ef-ab41-04cc87cc4e8a","resolution":{"observed_at":"2026-06-29T07:53:13.364202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Modular primitives for high-performance differentiable rendering.ACM Transac- tions on Graphics (ToG), 39(6):1–14, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:0a52bccb872c5a35ea040f586708a8de7ac75336f206845deb23a2f39962697a","observation_id":"c0de5e89-5438-4e5c-b229-753cc5c940f6","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-07-06T20:05:55.982214Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:e2bd4c437da5ac3f9e9bc5b05dc1148fb6bf81544e086fcd51d306b22f5d5804","observation_id":"87a6e748-6fea-43b1-9e31-d89be474d3d0","resolution":{"observed_at":"2026-06-29T07:53:13.366600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Dpm-solver++: Fast solver for guided sam- pling of diffusion probabilistic models.Machine Intelligence Research, pages 1–22, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:0ffbb9cc7a349ff8c00e66de27c1c89d6ea5c10418dd072ba5bde5584ef6e77f","observation_id":"958d26e1-4378-4c3c-b3a8-3964269a2059","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Umap: Uniform manifold approximation and projection.Journal of Open Source Software, 3(29):861,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:42365d9e874ad2da3e1b2abf0062111f7fe577bd3dc4dd2ed58b3ff7a636aeac","observation_id":"1b359f18-ea41-495e-9e7c-22a1b1da809e","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Echomimicv2: Towards striking, simplified, and semi- body human animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:6c87d71db357d8a784499c82af710ed27072cc1b274d6c14f8b5f66ec76e57cb","observation_id":"0ec4de4c-67f6-4b5a-a0fd-369d1b190162","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.1784","last_updated":"2014-11-06T22:33:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-11-06T22:33:22Z","title":"Conditional Generative Adversarial Nets","version":1},"cited_work":{"arxiv_id":"1411.1784","doi":"10.48550/arxiv.1411.1784","metadata_source":"pith","pith_arxiv_id":"1411.1784","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conditional Generative Adversarial Nets","venue":"cs.LG","work_id":"1d3bbf10-6268-4cc1-9702-27df9208c6af","year":2014},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/1411.1784","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:dd1cedf5cced0f288486150e64bdfc19feb51e94a1ca4ccdf34e13aca10eb162","observation_id":"e18987d0-999a-4853-be91-4b091b81f5c7","resolution":{"observed_at":"2026-06-29T07:53:13.368861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:cc36a54b9a2b879605954ff32e287ec18a8298eebfbf729a50784bcb0e12af75","observation_id":"14d73753-57cc-477f-855b-5ecb54c3358d","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06434","last_updated":"2016-01-07T23:09:39Z","snapshot_observed_at":"2026-08-04T04:34:27.861448Z","submitted_at":"2015-11-19T22:50:32Z","title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","version":2},"cited_work":{"arxiv_id":"1511.06434","doi":"10.48550/arxiv.1511.06434","metadata_source":"pith","pith_arxiv_id":"1511.06434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","venue":"cs.LG","work_id":"fe2c86f4-daa0-4e36-b130-d09d98afa55a","year":2015},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/1511.06434","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:4c284650bd55f2e6f4d6dfcf57692f6e45da473abdf1f17f432f6c3c943c2aa1","observation_id":"de306a7a-bf1d-4535-89a3-a0ba5edf4ff5","resolution":{"observed_at":"2026-06-29T07:53:13.379708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:eb717c6009b60bf6b814e97f6b6cdd1f36fd45f9a35741a937ee362883b6cf5b","observation_id":"2041faa7-1452-424f-aa01-70dabb446a85","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:8232a3650bc8f6a44202803acc0e1ec5e281edcc06d67821ef41c06654a68759","observation_id":"7640b7a7-f78c-4850-9f31-ed7ebbfd1d37","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:39514f4f9a4449b90a4f2bed1d6e67ca4dc10e87e73a12db30b2536278af561c","observation_id":"a36dab9e-f5d3-4350-84ae-876b1a80dfb2","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1402.1128","last_updated":"2014-02-05T19:01:51Z","snapshot_observed_at":"2026-07-06T03:35:13.381526Z","submitted_at":"2014-02-05T19:01:51Z","title":"Long Short-Term Memory Based Recurrent Neural Network Architectures for Large Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":"1402.1128","doi":null,"metadata_source":"pith","pith_arxiv_id":"1402.1128","snapshot_observed_at":"2026-06-29T07:53:13.369947Z","title":"Long Short-Term Memory Based Recurrent Neural Network Architectures for Large Vocabulary Speech Recognition","venue":"cs.NE","work_id":"48bb1280-7a1f-4800-9a3b-22ea3750dda6","year":2014},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/1402.1128","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:af4fdfbd6d3f6ac796f9943de6fe6171eb55b3e5842bb26b241159664f5caeb0","observation_id":"3d50fb21-688d-412c-8616-a011a17c0a94","resolution":{"observed_at":"2026-06-29T07:53:13.371163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural in- formation processing systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:e60fe2929722c356b1d5cf8305819713648e4e252b8ea96eb74380dd84a1d918","observation_id":"3bf900ef-22cc-45c1-bca6-d3e078ac4fff","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"An analysis of variance test for normality.Biometrika, 52(3):591–611, 1965","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:6e821170fc63a7e4ae7cba804b8192758c96e4acb11f58b2630922a63f6bbab4","observation_id":"0eda510d-6b2d-4a06-bc63-9f6a0f2a7c8c","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:dcb02d79a3dfbd7f083df0867c51d0ef05c2ffd448db4122396305dfe0ccbeeb","observation_id":"43be2e79-f7fd-4218-a05e-a28cbd0d7956","resolution":{"observed_at":"2026-06-29T07:53:13.376258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Seeing what you said: Talking face gen- eration guided by a lip reading expert","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:84439892795c8864eea627365d779e144955d458ee83a38b7859ee99832251e7","observation_id":"7d64a7ae-ef43-4e05-9a3e-840dca4938c4","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-07-06T21:05:20.266350Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":"2504.04842","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-07-03T04:47:38.002589Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":"b516fa8f-3f56-422f-bd2c-f6c785d1f6f5","year":2025},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:1e70c5d62da20289e43fb5fafea4f96ab60374291d02a7cf61c72e049db40c2d","observation_id":"84f34697-78db-4053-be6a-b312f29cfdf7","resolution":{"observed_at":"2026-06-29T07:53:13.382287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Audio2head: Audio-driven one-shot talking-head generation with natural head motion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:582b43597a2eab3f68091157cbf98e5b6d09be51388c1c8e21cab0ec406e1cc1","observation_id":"0d5d366b-99c1-4658-99fe-968a99dfc9e6","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-06T01:54:50.445862Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:c1f749c9cb4e1f2c0b44fb84380d3a553ea661da617eab3a4982e8810a6a9fc2","observation_id":"35c1c419-e08c-47c2-a075-f516d9e9a118","resolution":{"observed_at":"2026-06-29T07:53:13.369443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Vfhq: A high-quality dataset and bench- mark for video face super-resolution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:8141cf4c1c0fb618a3d711de9c7220ce8d13b308a7294e1a1f3b12ca1cec3500","observation_id":"7954f15d-9872-4304-8dfb-54357796104d","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:2058ac366c09a9ddc0a6b5b37a6a6a1a867af2832476af9f1cacce7e8a60351c","observation_id":"a89fcbd1-5187-4cb5-abf3-3dc878572ccf","resolution":{"observed_at":"2026-06-29T07:53:13.366896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2308.06721","doi":"10.48550/arxiv.2308.06721","metadata_source":"pith","pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"98e51b10-54bd-4251-8a2d-f79bd6215c19","year":2023},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:17735acc0ff3909619bb0049450c3f829ca11cd2d9824932593f8d5fa0ce71c6","observation_id":"44aa7573-a938-4cfb-87c0-57509c3ed80d","resolution":{"observed_at":"2026-06-29T07:53:13.374710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Celebv-text: A large-scale facial text-video dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:89176e4a6a187e0acf2c58d1a134246bdafebbde68a6b2d3ab3b081e7f212a21","observation_id":"ec0d4b40-2d66-4a74-aaec-5e2397ea623a","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:bc1e31b9123c0236fcd4fe345cfa20de391c4b37c06992bea3b9e70a9ee4a12e","observation_id":"eb170dfb-26c2-47c9-a195-a6a3f357cf84","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:8b64b1fc7401af8b2c31400089fdffa21d8680185ef4c9971d222b72e08c5fb1","observation_id":"c41f292c-c68d-4452-b17e-01258a1a3d45","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:d7eec0e063d043b622f9f43612fcf428c99f64a868117fbb70caf88a1345ad27","observation_id":"ddf0cf62-4118-40f6-9bc9-0bbcc1961ac1","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Musetalk: Real-time high quality lip synchronization with latent space inpainting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:bef206b31f324a1e2c40b3e7b79a8b9c380a065e3ea2ac3fad8786641e146414","observation_id":"266d3d54-885e-401e-bd75-37703e4ad51a","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:a95368d5d720a5ffa6941d492280a395f9d910096cbe383abf3bf2ca122acfcd","observation_id":"f3043fff-9c33-4714-b040-20261cb01415","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Hearing lips: Improving lip reading by dis- tilling speech recognizers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:9212c8e43184be886ffdde9b2955ad2bface0832220e712299f2d9341e3a2d68","observation_id":"8005b1dc-1148-4234-8fe3-1bb1d904a57d","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Makelttalk: speaker-aware talking-head animation.ACM Transactions On Graphics (TOG), 39(6):1–15, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:4e47c644e0e72a605c472239db697a3af677f8f52c17a89ee75ff46db8118f36","observation_id":"a31039a5-3168-416c-8c8a-3157c46de69e","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"Celebv- hq: A large-scale video facial attributes dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:2b9b5c62bed89a5f0515fb7179bb9eccd5f18911c34cbf14f64304b7bbfc814b","observation_id":"f7de0adb-7e20-4a56-8a25-a46e3d37bafe","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:9945576b788b6cccc3faf39d8c1d22e532a4c9324c778ad19a00c0416e24bec8","observation_id":"67fb0735-a5c3-43e8-838e-69fb746e4977","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"All derivations and intermediate steps are included to ensure completeness and clarity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:b37c4d840bfd9ab50276d78ffbaa437f78c6c1b92ef899b64dc05a33a25a95c9","observation_id":"440b30a9-b72f-4d3e-951c-2b8e31a6a603","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"AnimateDiff + IP-Adapter","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:21675d5973ad29e058b0d50f93bdfc487e53263b4d2b5d26d44ff64f8764642d","observation_id":"70ac0295-6604-4af3-a33f-3279e4b586ee","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:50:56.947671Z","title":"To mitigate such risks, all generated videos in our study can be clearly marked as synthetic (Fig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:c39a53cf1f1ebfa2892b099aa72eef12ea3fb3ef32e7f61e2046d3eca507f37a","observation_id":"7a7085f9-c6d8-4fe3-9f1f-2d2d7113c691","resolution":{"observed_at":"2026-06-29T07:50:56.947671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":13,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2605.30230."}