{"as_of":"2026-08-09T13:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:158f38a91acdb28b1f78dbcdd3a7ab2948834ce805c0f9d8ebd9503684e393ce","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:19:37.295188Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:13:11.504526Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T09:45:40.337791Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"cited_work":{"arxiv_id":"2508.20210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20210","snapshot_observed_at":"2026-07-01T09:45:40.337791Z","title":"Infinityhuman: Towards long-term audio-driven hu- man","venue":null,"work_id":"d3ad7bc4-da89-4874-962a-d7faa182afe6","year":2025},"citing_paper":{"arxiv_id":"2512.14234","last_updated":"2026-04-14T19:54:15Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-16T09:41:21Z","title":"ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T22:04:07.403410Z"},"links":{"cited_paper":"/paper/2508.20210","citing_paper":"/paper/2512.14234"},"observation_digest":"sha256:b4c0a9ec625dfef90b3e1a6d7b0dcce13f3f5261a35a1c0faec18b3d3a4bc2f6","observation_id":"8cc9086a-b1ed-47f3-9a91-3f6e7527df13","resolution":{"observed_at":"2026-05-16T22:08:36.256770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"cited_work":{"arxiv_id":"2508.20210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20210","snapshot_observed_at":"2026-07-01T09:45:40.337791Z","title":"Infinityhuman: Towards long-term audio-driven hu- man","venue":null,"work_id":"d3ad7bc4-da89-4874-962a-d7faa182afe6","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2508.20210","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:eaa0010c586b2d329f764fb4f3de2a0a75e647b574ae198065d0d17929231ee7","observation_id":"b2c3cf4f-83f6-44c6-af86-5a5b00ca820b","resolution":{"observed_at":"2026-05-15T22:20:22.355150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"cited_work":{"arxiv_id":"2508.20210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20210","snapshot_observed_at":"2026-07-01T09:45:40.337791Z","title":"Infinityhuman: Towards long-term audio-driven hu- man","venue":null,"work_id":"d3ad7bc4-da89-4874-962a-d7faa182afe6","year":2025},"citing_paper":{"arxiv_id":"2604.27918","last_updated":"2026-04-30T14:22:27Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:22:27Z","title":"Generate Your Talking Avatar from Video Reference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T05:32:04.519820Z"},"links":{"cited_paper":"/paper/2508.20210","citing_paper":"/paper/2604.27918"},"observation_digest":"sha256:f6aeb490341f53298423d42352c97eec061f0914116a0676d1252d25dd5eeb14","observation_id":"ea9b4d82-3dad-4742-a484-16aae52bc771","resolution":{"observed_at":"2026-05-12T10:36:29.794020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"cited_work":{"arxiv_id":"2508.20210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20210","snapshot_observed_at":"2026-07-01T09:45:40.337791Z","title":"Infinityhuman: Towards long-term audio-driven hu- man","venue":null,"work_id":"d3ad7bc4-da89-4874-962a-d7faa182afe6","year":2025},"citing_paper":{"arxiv_id":"2606.30849","last_updated":"2026-06-29T19:26:13Z","snapshot_observed_at":"2026-08-02T00:44:38.626792Z","submitted_at":"2026-06-29T19:26:13Z","title":"SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T06:13:11.504526Z"},"links":{"cited_paper":"/paper/2508.20210","citing_paper":"/paper/2606.30849"},"observation_digest":"sha256:0ea0f89c0e3a2d1fcb4a9149ed61c819857191a2458174738f2d33c081399626","observation_id":"2200ada8-547f-435e-8314-93b52070d8c4","resolution":{"observed_at":"2026-07-01T09:45:40.339046Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20210/citation-record","integrity":"/paper/2508.20210/integrity","json":"/paper/2508.20210/citation-record.json","paper":"/paper/2508.20210"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.050321Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.050321Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:59d5f1223ed2db9c4ae8fe29cbcbfb9bcd15bd51195d9ec5ba8ac360ee45897b","observation_id":"cc0a63cf-7900-428f-a39b-d6c8e77fb643","resolution":{"observed_at":"2026-08-05T15:19:37.050321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.056293Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.056293Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:06786fb3809978802e9842011951882b194c58775d3ddc5a8f769f4ba835db75","observation_id":"6505ceef-5c88-4522-8425-d8ed5a63c410","resolution":{"observed_at":"2026-08-05T15:19:37.056293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-05T15:19:37.062536Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.062536Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:e543055e29893100540de14b2f9cc235f19aaf65e658b10318f1a52b1b606882","observation_id":"271442c1-62b2-4a68-aea6-e7ae265cbd28","resolution":{"observed_at":"2026-08-05T15:19:37.062536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-09T05:07:43.521969Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-05T15:19:37.068815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.068815Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:d74b99f57fa698546e7c8a52485a48a0955e880acd9c3d1d7c01670740efd78d","observation_id":"36bc65c8-c9c2-4d2d-af15-bb7aad95c0f7","resolution":{"observed_at":"2026-08-05T15:19:37.068815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.243498Z","title":null,"venue":null,"work_id":"51a318af-8270-4869-93fb-b0920333f9cd","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.073887Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:277e60000ee1fd68bf54cb812f53feacc9e756358dc7b25faa42e9d394135d2e","observation_id":"0ed0deee-0350-4de7-94b2-808957e9e457","resolution":{"observed_at":"2026-08-05T15:19:38.248653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.227203Z","title":null,"venue":null,"work_id":"64d4a515-8f68-40e9-8058-1af332a1c22f","year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.078799Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:14681e9060fbb3e18c5b724b9f417460c8ae9c4bd1c567afdc4c85f1f12a1f4f","observation_id":"23e80ff6-605b-4c51-b118-967cc6ce4aab","resolution":{"observed_at":"2026-08-05T15:19:38.231867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.210953Z","title":"E.; Fang, Y.; Lee, H.-Y.; Ren, J.; Yang, M.-H.; et al","venue":null,"work_id":"0be80c20-01fe-4e96-9457-a4b45bb983e6","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.083837Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:7e150ac704acc7601670b25a64e411695327e07a6df0104661e4edc782412c5d","observation_id":"6ba1d3e8-553d-4672-8be4-43b9c8007171","resolution":{"observed_at":"2026-08-05T15:19:38.215824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-05T15:19:37.088684Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.088684Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:30632a385b01b4d912c663b69119018d7074ac6b2cf91ff66aaf107d7d2f8340","observation_id":"69e9fe5b-c627-4661-b3b4-3e72b6611d20","resolution":{"observed_at":"2026-08-05T15:19:37.088684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.194942Z","title":null,"venue":null,"work_id":"233b7ef3-cd23-4386-a50d-fa8d4d74d1f4","year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.094997Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:54dcd8b15a024017c6651dfa6c19db800aaddc4c2f271086fe43ae66adf3fc27","observation_id":"af6ce6b3-4224-4969-821f-bcbbb626aca4","resolution":{"observed_at":"2026-08-05T15:19:38.199900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.178466Z","title":"S.; and Zisserman, A","venue":null,"work_id":"ce986abc-691b-451c-96e8-90da68ac46b4","year":2017},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.100643Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:7e2564a1535205dbe5dbb8a248fa9c9f24ceb7fd38e787d22335bbc163dbf675","observation_id":"038f89b7-c932-4c4b-8e8e-2c3d2d0df5ea","resolution":{"observed_at":"2026-08-05T15:19:38.183644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-07-06T19:59:37.692710Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-05T15:19:37.110895Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.110895Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:9122a90ec384d080430b4133100565bb610d1693fcbc74e5be8fb886b720a912","observation_id":"c85cec5c-d3de-468e-b6cd-8fe99dcf3647","resolution":{"observed_at":"2026-08-05T15:19:37.110895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-08T21:10:36.903047Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-08-05T15:19:37.115944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.115944Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:be9fa26c0e719b668209eb3c037837a6f002ff5af637bae9c53c03a7e79b0868","observation_id":"2a2ed21f-c783-4b36-8408-d28c9f114b26","resolution":{"observed_at":"2026-08-05T15:19:37.115944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18866","last_updated":"2025-06-23T17:33:03Z","snapshot_observed_at":"2026-08-06T23:13:02.949681Z","submitted_at":"2025-06-23T17:33:03Z","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18866","snapshot_observed_at":"2026-08-05T15:19:37.120737Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.120737Z"},"links":{"cited_paper":"/paper/2506.18866","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:7075d4dcfc3234ecb07ba9e4d9a1b5689a72d162e1daff7471221c9752d50512","observation_id":"fde95110-063c-4cbc-b40e-69b6b689c989","resolution":{"observed_at":"2026-08-05T15:19:37.120737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-06T14:42:35.046089Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-05T15:19:37.125808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.125808Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:26629667d7e0d9434f77c4edef85489fac2f487759969fdd9f878921ec9e9e9e","observation_id":"be44d807-5be1-4d44-ab87-3bdd660a9c7b","resolution":{"observed_at":"2026-08-05T15:19:37.125808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.130452Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.130452Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:fe5821af3bd553b550d441fa16a3326502218e15e26a14278a3e66d4d99a5bcb","observation_id":"5d6bbbce-33c5-4d1f-a207-93c7d5aa1711","resolution":{"observed_at":"2026-08-05T15:19:37.130452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T15:19:37.134859Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.134859Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:58cd2fcfbd79b8932487925eeef64fc6d3a6c01eb57488cbb85d474b81e90301","observation_id":"74d7fde3-0a2b-426a-b704-d1d1e071aba8","resolution":{"observed_at":"2026-08-05T15:19:37.134859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.151329Z","title":null,"venue":null,"work_id":"13bca89c-8fc5-4dd2-968d-cff30a5eaefb","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.139672Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:c5bc3e951437bbc36adcc08701c2dd9813dcb50d62954319e4c15b4aaaf6341d","observation_id":"2f00f6c6-edfe-4e6b-a774-de02a241b6e2","resolution":{"observed_at":"2026-08-05T15:19:38.156136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-05T15:19:37.144059Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.144059Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:190e237439f34e3fbb2585d3143be12a75a225da9c812e395537de54916e61d4","observation_id":"16202775-438d-4101-9eef-a2e57bc02574","resolution":{"observed_at":"2026-08-05T15:19:37.144059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16771","last_updated":"2024-12-28T17:42:44Z","snapshot_observed_at":"2026-08-07T05:22:26.276397Z","submitted_at":"2024-04-25T17:23:43Z","title":"ConsistentID: Portrait Generation with Multimodal Fine-Grained Identity Preserving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16771","snapshot_observed_at":"2026-08-05T15:19:37.149071Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.149071Z"},"links":{"cited_paper":"/paper/2404.16771","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:e30d1be5bcfbe7353d81c69f32a36c0c4cc20be5fb696ec422300197281338a5","observation_id":"8ef05fc4-daad-43b3-84d3-de7da141afac","resolution":{"observed_at":"2026-08-05T15:19:37.149071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-05T15:19:37.153799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.153799Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:372101d137cc778b928a1b6165bafdfef71b92d1389a22d6f3a3cbd8963a48a8","observation_id":"146a4c50-26b6-4f83-a965-e321afbfb3c1","resolution":{"observed_at":"2026-08-05T15:19:37.153799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.134893Z","title":null,"venue":null,"work_id":"789eb2ed-5054-4168-912f-82182f0aa3e8","year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.158574Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:8611b4d5c4badeb24913184bb636ff9891b5ba39c06c38961c239408d784b345","observation_id":"469de640-625a-4dff-b7be-60a476dd0985","resolution":{"observed_at":"2026-08-05T15:19:38.140059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12569","last_updated":"2024-08-27T02:31:42Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:37:27Z","title":"Sapiens: Foundation for Human Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12569","snapshot_observed_at":"2026-08-05T15:19:37.163455Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.163455Z"},"links":{"cited_paper":"/paper/2408.12569","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:55d1d6c045bf435bffa20f88405cbb027b363d20a623911ab7510ba4781002e6","observation_id":"aefc38d3-8410-471e-ae5e-979f2c89fec7","resolution":{"observed_at":"2026-08-05T15:19:37.163455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-05T15:19:37.168237Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.168237Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:204b16dc681b264a38dfeb2b85104e0aa35b8b78ffbf6432ab8124c64dc496dc","observation_id":"2b649be8-018a-4de3-b28b-05f9b18454b2","resolution":{"observed_at":"2026-08-05T15:19:37.168237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01876","last_updated":"2025-04-05T05:31:38Z","snapshot_observed_at":"2026-07-06T19:09:46.147436Z","submitted_at":"2024-09-03T13:19:31Z","title":"CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01876","snapshot_observed_at":"2026-08-05T15:19:37.173088Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.173088Z"},"links":{"cited_paper":"/paper/2409.01876","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:122c9c43c9a121bfb5112a5b4c8b35d0e2af469d73a0f5a25aa91c41cd974726","observation_id":"3022cb00-cc3f-403b-b724-35d80d10d2ff","resolution":{"observed_at":"2026-08-05T15:19:37.173088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-09T07:07:57.149519Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-05T15:19:37.178523Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.178523Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:fe6ae4ea50b52e0ab98903bc1bbdd7de8ce419f4078399c00114765ddc93e819","observation_id":"efb1e719-f16c-46fd-9d6d-61eceaba2a69","resolution":{"observed_at":"2026-08-05T15:19:37.178523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T15:19:37.183577Z","title":"T.; Ben-Hamu, H.; Nickel, M.; and Le, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.183577Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:5a43e9731b43d9789d0c3abcbae9264276356e223883c731de93da0ce86a2476","observation_id":"20f435bd-b508-4dfa-addd-d92d80bb6b1a","resolution":{"observed_at":"2026-08-05T15:19:37.183577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.188569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.188569Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:113317595d0fe536c37acc9e442595a4a044b67e54449450064ed2ca0f8649b1","observation_id":"202e6d05-139c-4a7a-b6a7-0f719cdf91d8","resolution":{"observed_at":"2026-08-05T15:19:37.188569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.119597Z","title":null,"venue":null,"work_id":"f9a29c5e-612b-4ccd-9ce2-50fd7fca1636","year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.193017Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:eff6ee06b8317a35a7f9fc861808894f8bbad1079419cb87c1822de6131c9a10","observation_id":"2718cb59-cc64-459f-b56e-103e47549e3a","resolution":{"observed_at":"2026-08-05T15:19:38.125171Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15169","last_updated":"2024-01-30T16:44:20Z","snapshot_observed_at":"2026-08-03T19:40:46.693368Z","submitted_at":"2023-10-23T17:59:58Z","title":"FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15169","snapshot_observed_at":"2026-08-05T15:19:37.197844Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.197844Z"},"links":{"cited_paper":"/paper/2310.15169","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:bac91e52d732b0ae972a45a58339085a6c8fba7f8ec8582758314eabe51c11b3","observation_id":"d7d657ff-ebc3-4af5-8c10-adf6cf5f7986","resolution":{"observed_at":"2026-08-05T15:19:37.197844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.104933Z","title":null,"venue":null,"work_id":"073f6ea0-f803-4c5a-a53d-b0e204235b7f","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.203126Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:da18a3947493bdec6db393cde7d7b9f48f4ff16543e08022d54b392e28750023","observation_id":"97676dc0-2473-447e-b5e5-e0efa5e7aeac","resolution":{"observed_at":"2026-08-05T15:19:38.109624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.088561Z","title":null,"venue":null,"work_id":"e967fd75-aafc-4f87-8882-0297f93fb4a1","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.209356Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:98a4451173407d5be0fb5e7d9f1681b0a8d72e7c238abf0f6f8a49264f1a66a9","observation_id":"c1f3cd11-6ade-422c-b551-322c9f20e18a","resolution":{"observed_at":"2026-08-05T15:19:38.093372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-05T15:19:37.213971Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.213971Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:d691064ae5bad9e42de8922517c4fc36e86fe88fff7705965690f9ae04bce407","observation_id":"d34993e8-472d-4343-8392-b985e2748253","resolution":{"observed_at":"2026-08-05T15:19:37.213971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02511","last_updated":"2024-06-04T17:32:52Z","snapshot_observed_at":"2026-07-06T18:25:18.469656Z","submitted_at":"2024-06-04T17:32:52Z","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02511","snapshot_observed_at":"2026-08-05T15:19:37.223978Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.223978Z"},"links":{"cited_paper":"/paper/2406.02511","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:da16fe9eb817150900279135a954a6e99a61a8b5e379f4c464310e3c4aeb2f96","observation_id":"272fa9aa-e990-4612-add2-f17b4de8a0d7","resolution":{"observed_at":"2026-08-05T15:19:37.223978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-09T05:07:43.219616Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-05T15:19:37.229734Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.229734Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:fb3e82a775426b479f40359399c7b7b1d8d61259a2647adee807c5c468b9a257","observation_id":"d25195cc-2719-4df0-8b08-247ecd523f08","resolution":{"observed_at":"2026-08-05T15:19:37.229734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.071868Z","title":null,"venue":null,"work_id":"b07af98a-7fb3-488d-a254-013a7a24f0f2","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.234878Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:16642558a89c94604264751a068d406c35f0388d63e23a827bdd005d86ec9993","observation_id":"62331e57-43f5-4b1b-a284-cc7be6a613b5","resolution":{"observed_at":"2026-08-05T15:19:38.077176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-08-09T02:00:54.345290Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-05T15:19:37.239985Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.239985Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:80e9c2a01cba883c08af4576cf7495d677d7d095a125d5f314c0c41e616259e1","observation_id":"5cf5dd96-bd4c-4fee-82a1-fe661de31133","resolution":{"observed_at":"2026-08-05T15:19:37.239985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-05T15:19:37.244894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.244894Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:77730e5e36a6753eed2607202a98daba34b061dc435166cb7f0d2b682cb2ac60","observation_id":"2728a245-1ee2-4b8b-9c40-ab9ca16ade0a","resolution":{"observed_at":"2026-08-05T15:19:37.244894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-05T15:19:37.250325Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.250325Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:6b02f8e3aa64d2b50c28d4a8a4606abb697951dabb079303f38f6671786dd68f","observation_id":"f037a761-4b70-49a6-82b6-336aaf4a3a45","resolution":{"observed_at":"2026-08-05T15:19:37.250325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.255149Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.255149Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:3e028620861a0d675f1f17f5d6641ed4d3334b39dfea91bcd3ac218fd05c60da","observation_id":"38bb490f-c1fa-4a8d-83aa-6c91a5e74898","resolution":{"observed_at":"2026-08-05T15:19:37.255149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-05T15:19:37.259854Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.259854Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:c24db42d58d73e5060b97bb060aae7a5aaef8760f2e35267928c8f13180458d3","observation_id":"62b552ec-c597-4ea0-8810-5b3f829d2845","resolution":{"observed_at":"2026-08-05T15:19:37.259854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.056565Z","title":"T.; Durand, F.; Shechtman, E.; and Huang, X","venue":null,"work_id":"3053b631-1763-4a5c-b2e3-abae21c58c87","year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.265364Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:bea399972c4f1d95faa65c35f0d18a60793c71bf83982a52d54acfe37530aa73","observation_id":"bc0897b5-7993-4954-b38f-c6b837c17fcf","resolution":{"observed_at":"2026-08-05T15:19:38.061494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.039968Z","title":null,"venue":null,"work_id":"f4ac3850-c07c-442d-bb21-af1258a9d1b7","year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.270656Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:ab6850800b5eb4f0d1f730f85839013d9ee08e5303fa96b082fc79aa4adb9b1f","observation_id":"aa22d217-42a1-4175-86d8-d5c0af9172a9","resolution":{"observed_at":"2026-08-05T15:19:38.045258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.023566Z","title":null,"venue":null,"work_id":"35fb56d2-6aca-47b9-a7a4-f3224a36da0f","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.274971Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:d69344695665ae4b0afcb50fe35934cf614b0190acdfb3edf37ea047c4281a21","observation_id":"712e5916-70f3-47b7-ab08-bff605e41d50","resolution":{"observed_at":"2026-08-05T15:19:38.028130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.007768Z","title":null,"venue":null,"work_id":"d8b05f89-8384-457f-bbcf-105d23baaf10","year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.280329Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:56b22e1a51647f2cb33ee5ffade5744799dfe11e673711a26783f1597f7c825c","observation_id":"5457650e-b5c7-4784-a037-f3279b68171a","resolution":{"observed_at":"2026-08-05T15:19:38.013438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.990814Z","title":null,"venue":null,"work_id":"316bed96-74d9-42d8-9628-ce94b121a33c","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.285521Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:23d330fc255a1fc6e2c1227435c1b84488170e9463e43e6dafd679bd0db0b114","observation_id":"72e7c357-8f3a-4075-abd4-21cdf2c8c831","resolution":{"observed_at":"2026-08-05T15:19:37.995922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.973192Z","title":null,"venue":null,"work_id":"6ceb6f9d-2820-474f-9592-228abb378d5d","year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.289764Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:fe906e20c93f57eec2afeb698989c1f4fcac9a4d5514b2e9c5dbc05ab2236b3c","observation_id":"5a86f957-c397-499e-a732-7b44102fb00f","resolution":{"observed_at":"2026-08-05T15:19:37.979057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.955006Z","title":null,"venue":null,"work_id":"e2412dbb-ba5e-4608-b70a-74b9b3755923","year":2021},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.295188Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:11029a3b628599ae118989e3f43e874a356bdb1ca0ccd1ef1a5e45251e5e173d","observation_id":"7ff90854-b684-44a0-9008-1925e1374859","resolution":{"observed_at":"2026-08-05T15:19:37.961578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T08:57:43.205933Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 4 inbound Pith citation observations for arXiv:2508.20210."}