{"as_of":"2026-08-09T23:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5efec43825b20e0753551f21a72589fc2a8ea7fc0d216d061837709c1c65537","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:19:01.019573Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24013/citation-record","integrity":"/paper/2607.24013/integrity","json":"/paper/2607.24013/citation-record.json","paper":"/paper/2607.24013"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:57.551433Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:57.551433Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:40583936c5dc6ac996e2f5a0ff4bfad408c2da96a1f18902c38cd93bfdb49bee","observation_id":"cded2093-9efd-451c-a627-45e0eeb0396f","resolution":{"observed_at":"2026-07-31T23:18:57.551433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:57.600242Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:57.600242Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:ffe09cae3735a438c701085c0121eadbf675ec3f493114a415a24fa184fcc303","observation_id":"16a178e8-f239-4512-9b4b-cecef3446c18","resolution":{"observed_at":"2026-07-31T23:18:57.600242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:57.661383Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:57.661383Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:832c726f284d5481a684e81178de7e1940e76c6643f67d9aa16270a525da7dd3","observation_id":"47b98aac-d4d6-4116-a780-1cb600127710","resolution":{"observed_at":"2026-07-31T23:18:57.661383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:57.713164Z","title":"Proceedings of the 43rd International Conference on Machine Learning , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:57.713164Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:d84ce8e931c5c9f867c6859f64d9b37ce55cc2f93280ca919f2750d1612cde56","observation_id":"ea4a6877-d20e-4b73-8b03-73bf635152a0","resolution":{"observed_at":"2026-07-31T23:18:57.713164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:57.804661Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:57.804661Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:f7ccf675ed17fd249e2e63ddcf62ee2beef9c30f01570969a7d4b8336fd3fffa","observation_id":"341d20fe-6edd-4d33-ba0f-ecd699b3d026","resolution":{"observed_at":"2026-07-31T23:18:57.804661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:57.867160Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:57.867160Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:19c0eab7630e1d845feffb1fbbf955f0dfcc9e82743d604cf7e106d381d950d9","observation_id":"18de17fa-c006-4fa4-ae2e-cc030c8dcf9e","resolution":{"observed_at":"2026-07-31T23:18:57.867160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:57.921607Z","title":"Proceedings of the 43rd International Conference on Machine Learning , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:57.921607Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:ae72ac636b23a8eb3e191ef5b7fd44ddfa0c4f545f2fa16efec63f0171d5d47f","observation_id":"eabf065c-67eb-4cec-a02b-9f9b21c6c980","resolution":{"observed_at":"2026-07-31T23:18:57.921607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:57.986428Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:57.986428Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:43b1327fb73239a09b418bb03d87a5bd8e513526be7a8e1226e1bf732e8b2c80","observation_id":"fa669794-f285-4351-9e74-8e0e8afc0f3c","resolution":{"observed_at":"2026-07-31T23:18:57.986428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:58.046955Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:58.046955Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:a030156e45c2ec1e49f9379bf9b95863112edea66c81545b8c279cc646c43e85","observation_id":"fc5bfc8e-c8a0-4d4c-ac2b-d805aa3e158a","resolution":{"observed_at":"2026-07-31T23:18:58.046955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:58.090279Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:58.090279Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:4b02682642cff7b74117090e73d19c2245f0e43bba3f46a22673a21458eec814","observation_id":"2169f99a-8f8d-44e9-95cf-db579913129b","resolution":{"observed_at":"2026-07-31T23:18:58.090279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:58.145268Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:58.145268Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:54f1d0cec5ff952a1ad27562deebf2087205c4b2c8c77467cfbde18a7f16bd1c","observation_id":"d8ab22d6-9eca-48ac-a74a-365ee40f6cd5","resolution":{"observed_at":"2026-07-31T23:18:58.145268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:58.334203Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:58.334203Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:3a8b3777b568a17a7a0caec84563556a8d76e5f38f7e96fc5c47aca2d3959f14","observation_id":"42575ae2-7a41-4435-bed4-91e43053a6b0","resolution":{"observed_at":"2026-07-31T23:18:58.334203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:58.466500Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:58.466500Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:5d0330b47371746e4e00399826792bff9f72a24304c36f7474fb3499dc4d44c3","observation_id":"b4cfb423-152e-4543-99e3-477f45b03431","resolution":{"observed_at":"2026-07-31T23:18:58.466500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:58.543690Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:58.543690Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:34f190c0fcab1a86178e42b8aebb05d22537fb294d66108ced7884fb3c81246d","observation_id":"1a24e188-c6eb-43f3-a47a-6d1f60d1e440","resolution":{"observed_at":"2026-07-31T23:18:58.543690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:58.654145Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:58.654145Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:4825b4f97215628ef5d34b70bd9dcb3f78d9e1716ceacbc479778af4a2397bc7","observation_id":"6db8e46d-910f-413d-8f28-bfae09529a17","resolution":{"observed_at":"2026-07-31T23:18:58.654145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:58.759326Z","title":"Transactions on Machine Learning Research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:58.759326Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:5f8e8e14578070c56efd51e6cbcc10f55beff54a5044fe6590141f9f64c14228","observation_id":"59549db8-50c5-4396-98d5-360052c061e5","resolution":{"observed_at":"2026-07-31T23:18:58.759326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:58.826415Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:58.826415Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:2495492db16a60ee089a753048b7659b4d25e8db87601a1e60f3815c9a003d40","observation_id":"7a83ed3d-55c2-4822-bc18-72c8a6a2ed33","resolution":{"observed_at":"2026-07-31T23:18:58.826415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:58.894978Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:58.894978Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:bd7b1cb66ec6ba7473dbb996b89c46733f5e50c5b00a5ea247fcdec07aa1edb9","observation_id":"6e1730f2-ce60-4c45-a483-e9b7b26d2e2c","resolution":{"observed_at":"2026-07-31T23:18:58.894978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:58.952849Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:58.952849Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:4d0d817a0737f7e5dc865c9a582fc7649cb3dcfb4cdace36d4320f50c9d346fc","observation_id":"c7b717d9-b2b0-4ec9-92ad-a7089d105964","resolution":{"observed_at":"2026-07-31T23:18:58.952849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.008931Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.008931Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:9735267cfdde12215c06f9b37699bafae71b715f47548f46b3ecbe776a029a2b","observation_id":"e8b82b74-156f-4b66-ac22-453a4c40ebc5","resolution":{"observed_at":"2026-07-31T23:18:59.008931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.082691Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.082691Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:2440c411ca7b5b23868bf6a4f2fb90cef124f7afb738b9778e6b5115db1b8f02","observation_id":"34fd572c-cd29-4019-b66a-c47d612a413d","resolution":{"observed_at":"2026-07-31T23:18:59.082691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.131355Z","title":"nature , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.131355Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:b5fd72585aeeab5a9ea9bd526cdac1a9ad831b5d8c810a6138c1dd54ae996c46","observation_id":"aeb5f7f1-1067-4c58-8841-a6fa52cccf07","resolution":{"observed_at":"2026-07-31T23:18:59.131355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.188022Z","title":"Proceedings of the 28th ACM international conference on multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.188022Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:15292c6e8f65bb4568ea685019826ae853535b9f76594c440a79c32146d577b5","observation_id":"09d94a58-fe9e-4a7b-bbdb-0c6147e9d88e","resolution":{"observed_at":"2026-07-31T23:18:59.188022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.252297Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.252297Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:179957d4f98fd1a424be52ce63a83a9f73b858c41eb03a59052bc91d2d609963","observation_id":"92cb63bc-4ae8-4bfc-b397-77824f02da92","resolution":{"observed_at":"2026-07-31T23:18:59.252297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.292548Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.292548Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:91c6b8fd78238fb364050880a314fa010078029a192bb6a3ab93de79281e8604","observation_id":"2b3974ac-c99a-445c-b045-f92aa20c69ee","resolution":{"observed_at":"2026-07-31T23:18:59.292548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.365334Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.365334Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:ca07c78a2f6edd7c26e93411285f563c0f58a07e6926086cf150c02b2f9141b7","observation_id":"95b0c4cc-0ad2-4967-8f62-1f22c7233857","resolution":{"observed_at":"2026-07-31T23:18:59.365334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.412274Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.412274Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:7e6510fe134d0f8fe377c12e6a4868db0b8c2c113a9bac4b608e71749c95ed42","observation_id":"3d6d31ac-c9e4-4c98-a876-ea0daf678480","resolution":{"observed_at":"2026-07-31T23:18:59.412274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-31T23:18:59.468371Z","title":"2508.18621 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.468371Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:57fa796575972a2fc84182b90d20e53bc67dffb0d414fbe174c4cc58621e8085","observation_id":"51f7c75e-916d-4188-b3d9-db5c41a5be5a","resolution":{"observed_at":"2026-07-31T23:18:59.468371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-07-31T23:18:59.579082Z","title":"2505.20156 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.579082Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:27f24a01c06ed97b296b78aff543d54e759dba9da47995266ec755310086b829","observation_id":"bdcf06bc-8e18-4506-977f-6f1d8ac4919a","resolution":{"observed_at":"2026-07-31T23:18:59.579082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.651593Z","title":"Seminal Graphics Papers: Pushing the Boundaries, Volume 2 , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.651593Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:c0ba51a9726e32e345f703fd9c0d43799abbd6ea69b2d4c8a237ceb41256becb","observation_id":"6d75b9b0-3a56-415b-94c3-c76aa0ff53fd","resolution":{"observed_at":"2026-07-31T23:18:59.651593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.749679Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.749679Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:14006f06eb478914a85a2aac0ffdbab9284cc892cae79d723b860c77801cf1bd","observation_id":"76746557-dd69-4439-8d99-bea1af8bd29e","resolution":{"observed_at":"2026-07-31T23:18:59.749679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.824364Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.824364Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:f2f14d2cba199867f34f0a1fb046e96ce6e143869eea9eff66876470be2091b8","observation_id":"cf930692-63af-46a8-aa70-25a76cf28967","resolution":{"observed_at":"2026-07-31T23:18:59.824364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.865208Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.865208Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:e232dc1b3c34d176bc555ee0298f281c5292e6da051900a111636781bf0bc74b","observation_id":"6839a5f4-a4ff-43db-b8aa-ee036ec87d98","resolution":{"observed_at":"2026-07-31T23:18:59.865208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.928008Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.928008Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:2282e9910fb866a9210db9de1219548af6b6e5ecc7f99180842ebbaf03a68fe8","observation_id":"98d1f3ec-7838-4d3c-86c2-7baa616fb990","resolution":{"observed_at":"2026-07-31T23:18:59.928008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:18:59.995615Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.995615Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:c229ab058770b71f7924440171c53ba88dfffc958087c04a40b8c244de161918","observation_id":"2a230cb6-d8a7-43cd-a098-6c160cf9274d","resolution":{"observed_at":"2026-07-31T23:18:59.995615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:19:00.154093Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T23:19:00.154093Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:fdfb5f66def911ff4a2b83799a01b86c1a8ab70d301f5e6fb396125566e97022","observation_id":"f49ffe70-e2e2-49ff-b8d7-c30f4d9488de","resolution":{"observed_at":"2026-07-31T23:19:00.154093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:19:00.201529Z","title":"Proceedings of the 42nd International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T23:19:00.201529Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:bad695078426108464e2e034f6cbbb44fc8bd9d1d34636d24c5d67160eaa317c","observation_id":"0d53d515-a724-4d6c-b6bc-40c0009a6aa0","resolution":{"observed_at":"2026-07-31T23:19:00.201529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:19:00.269741Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-31T23:19:00.269741Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:21b409771f1d3fc556586611287633398e28adaee0fe4601ebdb4e0cf92ea037","observation_id":"7117ebd9-5444-4024-8da7-b56ede77368c","resolution":{"observed_at":"2026-07-31T23:19:00.269741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:19:00.345035Z","title":"European Conference on Computer Vision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-31T23:19:00.345035Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:992b311cfc7fcde5bc30f5789a091d20813b35173a427a0db4f18a7591aa9458","observation_id":"8629696d-eaf2-4fcd-93cc-a574301d44d9","resolution":{"observed_at":"2026-07-31T23:19:00.345035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:19:00.447517Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T23:19:00.447517Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:bea5dc164981cc01a21015a8951aa756bbf3e02ac293f9df6ef8e8d6f93b729c","observation_id":"ef48f3a2-9b6c-4582-8fb9-093c0c4f3a8e","resolution":{"observed_at":"2026-07-31T23:19:00.447517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:19:00.573977Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-31T23:19:00.573977Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:ff4742cb925c87af8ea55bf0e0f0ec919b1e0117084b90c1f2095ec696882f9c","observation_id":"78113e2f-8a93-4990-b783-9ebdd3bec547","resolution":{"observed_at":"2026-07-31T23:19:00.573977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:19:00.699022Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T23:19:00.699022Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:649ab510e224f98471d18edcca01c391ac0f39a1db64a8797271b30e73a94a3b","observation_id":"c13a4172-529a-4c9a-9933-b50a3208cc47","resolution":{"observed_at":"2026-07-31T23:19:00.699022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:19:00.810119Z","title":"Q-Align: Teaching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-31T23:19:00.810119Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:20488de162f8d86f66bcbe88bb223235c3858d772e98f4e6a09e3343e560907d","observation_id":"b44a0fda-2806-4b65-97e9-3f7687b50ba5","resolution":{"observed_at":"2026-07-31T23:19:00.810119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:19:00.903951Z","title":"Asian conference on computer vision , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-31T23:19:00.903951Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:34710d36f5bbd13b2d07a2065bc6b6910e51386315e62ebd5161805caf726d7a","observation_id":"5271f344-8084-4f55-bed5-62229acaf83c","resolution":{"observed_at":"2026-07-31T23:19:00.903951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:19:01.019573Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-31T23:19:01.019573Z"},"links":{"citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:808125327f2eafa305e2aeb8a82d0b6fe2dd7fc6ffa9c2e6763f5234923d8569","observation_id":"d70365ae-a8c4-40f6-b9e8-0adcb75860c3","resolution":{"observed_at":"2026-07-31T23:19:01.019573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.24013."}