{"as_of":"2026-08-20T15:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5bf3a4078d4078d51e23bad36ed30227d3640fa4d1e530486305fadf8636a467","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:15:17.804936Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:29:35.949368Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T04:37:09.368227Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25659","snapshot_observed_at":"2026-08-01T03:52:55.577671Z","title":"arXiv preprint arXiv:2605.25659 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23023","last_updated":"2026-07-28T02:01:27Z","snapshot_observed_at":"2026-08-18T22:20:10.192450Z","submitted_at":"2026-07-25T03:42:52Z","title":"OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T03:52:55.577671Z"},"links":{"cited_paper":"/paper/2605.25659","citing_paper":"/paper/2607.23023"},"observation_digest":"sha256:83cfa43abfec11ceac428e82d1306076e3d864e965a090aae6ac3476a963ee27","observation_id":"eaa5d5ca-d2d2-477d-afc0-413b4ffaeab9","resolution":{"observed_at":"2026-08-01T03:52:55.577671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"cited_work":{"arxiv_id":"2605.25659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25659","snapshot_observed_at":"2026-08-08T04:37:09.368227Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","venue":"cs.CV","work_id":"e12ae8aa-d3fc-493c-8078-853c1edf1d55","year":2026},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T04:37:09.248527Z"},"links":{"cited_paper":"/paper/2605.25659","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:5a3d5ce78fa3c7efced4b087fee4ed9653d4b9d153851dc9b389518cb8e4fbf7","observation_id":"84acae5e-d1da-441b-8605-88bacd024224","resolution":{"observed_at":"2026-08-08T04:37:09.398041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25659","snapshot_observed_at":"2026-08-10T04:29:35.949368Z","title":"Streamchar: Long-horizon streaming character audio-video gener- ation with decoupled orchestration.arXiv preprint arXiv:2605.25659,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.949368Z"},"links":{"cited_paper":"/paper/2605.25659","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:e02e1e888980ebc4220d04e82395d1bbe4b93fcafbad5b0a1768b3a715d96254","observation_id":"69749f90-9b72-4028-b2bc-1b123ea579f9","resolution":{"observed_at":"2026-08-10T04:29:35.949368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.25659/citation-record","integrity":"/paper/2605.25659/integrity","json":"/paper/2605.25659/citation-record.json","paper":"/paper/2605.25659"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:b69f3c08adc9d681c83ed65e7cbf97cdaa0b14b116ddd61c7936ccc9f7880c78","observation_id":"e86f6417-42e0-4aa4-9cfa-8a757890574e","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01392","last_updated":"2024-12-10T01:32:23Z","snapshot_observed_at":"2026-08-16T13:38:04.174848Z","submitted_at":"2024-07-01T15:43:25Z","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","version":4},"cited_work":{"arxiv_id":"2407.01392","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01392","snapshot_observed_at":"2026-07-10T01:46:41.061392Z","title":"M., Du, Y ., Simchowitz, M., Tedrake, R., and Sitzmann, V","venue":"cs.LG","work_id":"e7d25a8e-cc3d-4006-adb8-b4430c78e47f","year":2024},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2407.01392","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:556376f850a6391e33b6c9f2f122225df514781d506c6bc8c1a5fd706aab2678","observation_id":"1119a13e-75e2-4714-983f-275ec8d0349d","resolution":{"observed_at":"2026-06-29T22:24:00.899585Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-18T16:25:59.172304Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:e16ae09e54c8d4be897fb07daac8f73ce2fca6dd1abc240793620fc7dd7f801c","observation_id":"6b01a8fd-5bb2-4d0f-a464-9b771debbcb7","resolution":{"observed_at":"2026-06-29T22:24:00.912836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:6380b5a4fe48f523ee738c8e5d8268a627c022e5fe8272293629250d85e20d8b","observation_id":"fdc54096-6969-45a3-95a7-d0a3c6d54fea","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:5a5901172d26909201ba8cdca320d4485c207a245161fc3eb4fd53a64ffac698","observation_id":"129b03ca-ba15-46e9-9e0d-92e9f04799dd","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-13T04:00:21.942422Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2510.02283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.02283","snapshot_observed_at":"2026-07-08T13:14:53.231711Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","venue":"cs.CV","work_id":"3b83d5f5-6929-46ae-9de2-7c32af3c7346","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2510.02283","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:df57711a44b414a6bfd131af74dd40e5a31f642c7480a7aedaacf9d13bce0843","observation_id":"4bff21e0-05fd-4812-9f77-8863e2a5fb74","resolution":{"observed_at":"2026-06-29T22:24:00.891302Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":"2407.05407","doi":"10.48550/arxiv.2407.05407","metadata_source":"pith","pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","venue":"cs.SD","work_id":"e5ad925a-4045-49b5-b301-208bcbf3eca8","year":2024},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:12d56ab49912cac16accfa72da1cd2abba75baf9242040ee24fd883bc14c7900","observation_id":"251c0796-b5b2-4567-a9cd-a7c5ba4b4b4c","resolution":{"observed_at":"2026-06-29T22:24:00.896410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:13.570764+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:13.570764+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-15T01:56:17.706891Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:d380ce68f45264f63d74680f7bc6ff05666d81676c0e6c2527201c98f60ad453","observation_id":"fe6b0a7c-2970-472b-a76c-05962dcf8ef6","resolution":{"observed_at":"2026-06-29T22:24:00.909558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-08-18T20:29:58.857701Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:72e8b60cbd4252a458fdba5901feaf2323ec51082002356f7b9a26bdb26749c8","observation_id":"c131e491-52d1-4f18-863a-f8352f04fd00","resolution":{"observed_at":"2026-06-29T22:24:00.915332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-19T13:44:12.385881Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:e34a9037c3c843b46dfa4175e6567d3fc387aea9839e15eaab9ccdb524065d0c","observation_id":"608f90e4-bc54-4082-943e-6bf1fa17f6bf","resolution":{"observed_at":"2026-06-29T22:24:00.893750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:231e952f134fb41d60fd39facd3dcad308683908587a20977d748ff5cc984977","observation_id":"f57e85db-0703-4e3d-86c1-64895f6ff600","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":"In Advances in Neural Information Processing Systems (NeurIPS), V ol","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:d66a5bfbe025dd03e32c39df6f1d004fec2213469483d6dbffc9f6028b7c6a42","observation_id":"2f8ff6df-a9dd-457f-a741-6bb2264d22f6","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:4dc528b9c5624ec9badedb4215d45246e284629c8cf3a6272af9c2fd4d49fd4d","observation_id":"36974cf2-6254-4adf-8f6a-6b8bbcaf7837","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-15T15:02:59.826496Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:3a853852b7ccbbb41c59adf91d3e80b09170a290ad658083f949cb2b311cb81b","observation_id":"c4bd8aeb-ce9e-436d-ba48-0b15b1404424","resolution":{"observed_at":"2026-06-29T22:24:00.895652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-13T11:03:16.956715Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:3db9be2262aeacea79524af8126a86059d3a29301aeb15f0503b28e4e809938d","observation_id":"7040923c-9aff-48c2-ad82-54f78f4ce2fe","resolution":{"observed_at":"2026-06-29T22:24:00.828792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19209","last_updated":"2025-08-26T17:15:26Z","snapshot_observed_at":"2026-08-17T16:30:13.120250Z","submitted_at":"2025-08-26T17:15:26Z","title":"OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation","version":1},"cited_work":{"arxiv_id":"2508.19209","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19209","snapshot_observed_at":"2026-06-29T22:24:00.837311Z","title":"Omnihuman-1.5: Instilling an active mind in avatars via cognitive simulation","venue":null,"work_id":"daaf0e46-1cef-45b6-a07a-f26e54a9207d","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2508.19209","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:27c2f565a59e1ba60f16cdb36ec69214c2e13e4fde860b692862db0a39f0c61c","observation_id":"17985ccb-0cca-43d0-adae-c6848e5a05ae","resolution":{"observed_at":"2026-06-29T22:24:00.838767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23632","last_updated":"2026-04-26T09:46:58Z","snapshot_observed_at":"2026-07-06T23:09:48.137856Z","submitted_at":"2026-04-26T09:46:58Z","title":"Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation","version":1},"cited_work":{"arxiv_id":"2604.23632","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.23632","snapshot_observed_at":"2026-07-04T16:49:57.673621Z","title":"Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation","venue":"cs.CV","work_id":"d8e2f554-fe50-4db5-aabf-f9b88d23f2fd","year":2026},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2604.23632","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:e61b2b106bdcfd5c6772702764718af85502f31e965983d8bc251420ea943742","observation_id":"ed00f89c-55ba-47fe-8c19-a2109c223fc5","resolution":{"observed_at":"2026-06-29T22:24:00.845043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-08-17T01:19:21.155701Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":"2412.00115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00115","snapshot_observed_at":"2026-07-04T10:09:44.579833Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation","venue":null,"work_id":"8e193be1-fb2e-45f5-9b0c-01e3bd7a47f4","year":2024},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2412.00115","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:c677ab5238890a17ff8b5d67fce815b3ecffcf3e2457c4e17eece68a447a160e","observation_id":"6b2aef5f-21a7-40da-ac62-832a36fcbc77","resolution":{"observed_at":"2026-06-29T22:24:00.866740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.22677","doi":"10.48550/arxiv.2511.22677","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled dmd: Cfg augmentation as the spear, distribution matching as the shield","venue":"ArXiv.org","work_id":"dd7b113f-29cc-40ce-b257-4d30880efdc4","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:866270344bb310d5093bf55913705c29f733af61a71550e40434a51222cc372d","observation_id":"3f7cf04f-8156-4b94-9cf3-63bf3b130090","resolution":{"observed_at":"2026-06-29T22:24:00.874729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-08-09T09:15:39.740119Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":"2509.25161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-07-08T10:54:49.169100Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","venue":"cs.CV","work_id":"e44fcf99-6683-4319-a07d-0db4c89ff93c","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:3a4b53f5a65954050209c8c2fedf988e9d6431c6f0c05c3d63365a42d56c2179","observation_id":"fc7c2bb2-cd0a-42b7-a33c-3c3ce418bd42","resolution":{"observed_at":"2026-06-29T22:24:00.882478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:6753b45c58a0fcffc8b24ee7433bbe894cd1e6d101ae320bd5de77936035d9e5","observation_id":"bd85f56a-e73c-4d4b-bdd4-42d9a3855541","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:9c9e74bd41054f96cefd9bdb7b60ea2237f8287c9698dd5c324b4b332e7ae51f","observation_id":"a92c13b6-de24-45d8-8083-344519f0e5f6","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-13T04:37:51.305325Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2510.01284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-07-05T12:41:04.361399Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","venue":"cs.MM","work_id":"4ea3b1fc-d272-47f2-88a8-36cbeaa92448","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:47c625e43f3811e07a73966e863eb7cefff9fc7097209ba59e001f166e6f9d28","observation_id":"199d4850-0ed6-4de9-9a4f-dfc417907b35","resolution":{"observed_at":"2026-06-29T22:24:00.857814Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.10061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T21:25:04.914755Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation.arXiv preprint arXiv:2411.10061","venue":null,"work_id":"4082fc2b-f89a-457f-baa3-0bc7fcf24a73","year":2024},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:f9b67637dfba606a4e83b233816f973c9a220443660b7cf0ead2e64e018d03fa","observation_id":"e69b1563-b4cc-42e9-9828-f8871e50e797","resolution":{"observed_at":"2026-06-29T22:24:00.864107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.09881","last_updated":"2026-07-09T22:49:12Z","snapshot_observed_at":"2026-08-09T17:44:11.904091Z","submitted_at":"2026-01-14T21:30:03Z","title":"Transition Matching Distillation for Fast Video Generation","version":2},"cited_work":{"arxiv_id":"2601.09881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.09881","snapshot_observed_at":"2026-07-13T01:17:54.723797Z","title":"arXiv preprint arXiv:2601.09881 (2026)","venue":null,"work_id":"6c7090b9-779a-4f46-a85f-bb67c9d84022","year":2026},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2601.09881","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:1f3672ec22091fbec434c6813677c0fe855a27c1739376f2bd93e34eefb874a1","observation_id":"714c5bb8-0c95-4363-95c9-594f3cf39863","resolution":{"observed_at":"2026-07-13T01:17:54.723797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:7ebcca969836b88f643141671f1ac73bcacc3389fab4bc479a2ea734448f7714","observation_id":"8c8ceca2-2379-4a00-bfae-ba2e6142f814","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-08-15T16:51:35.217742Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":"2508.19205","doi":"10.48550/arxiv.2508.19205","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vibevoice technical report","venue":"arXiv (Cornell University)","work_id":"6d46a99d-ed41-4221-8fbe-35859ee85e2d","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:8b9505dc5a71022b5508c782776c0ec1a0ac77adae2dc0baffeb60270013c38c","observation_id":"16237dbd-dbed-4b65-88be-b114e5263c9b","resolution":{"observed_at":"2026-06-29T22:24:00.859989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:13.233628+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:13.233628+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:7d2c6a98847e7a7ec489956839791fbdb844a84789c730bce223a83a1f01e3b6","observation_id":"56297ed3-1797-44f3-8637-0d4f568a0ef6","resolution":{"observed_at":"2026-06-29T22:24:00.865070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:91524b09a938e035f0d51adbce35546e3eee139c77080b28b5c67b3d732f8164","observation_id":"24f9f210-a520-4a65-ba3b-afaf41017d50","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-19T04:53:25.142828Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:b8f3cf49e42f8d05cca15661cc8256c89578ca3673725344452658ca1a256a91","observation_id":"4b101729-3d6c-4eff-a670-f30cdd4fd390","resolution":{"observed_at":"2026-06-29T22:24:00.885554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.23379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:24:00.878424Z","title":"Soulx-livetalk technical report","venue":null,"work_id":"d5a6542d-c260-4528-a427-7f9cb7bfc051","year":2026},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:62495461e9bc3d982728b37b3594401a7e8ad7b936dc81290419419c84654d95","observation_id":"412a678b-3366-4c9b-a574-65efab75c29d","resolution":{"observed_at":"2026-06-29T22:24:00.879951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:37:29.792063Z","title":"Speed by simplicity: A single-stream architecture for fast audio-video generative foundation model","venue":null,"work_id":"b20b430c-75db-48ea-9a8d-4bbdeb416467","year":2026},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:f1b598dea1a7b05683163869a92bc04fc4d8ca9701794f94b846da9d4dfbaaa3","observation_id":"dbe461c6-6fb2-430d-a90b-898854041991","resolution":{"observed_at":"2026-06-29T22:24:00.872200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14987","last_updated":"2022-03-28T18:00:51Z","snapshot_observed_at":"2026-07-06T12:53:50.496350Z","submitted_at":"2022-03-28T18:00:51Z","title":"Multilingual Knowledge Graph Completion with Self-Supervised Adaptive Graph Alignment","version":1},"cited_work":{"arxiv_id":"2203.14987","doi":"10.48550/arxiv","metadata_source":"doi_reference","pith_arxiv_id":"2203.14987","snapshot_observed_at":"2026-07-09T21:46:34.506658Z","title":"Dickerson","venue":"cs.AI","work_id":"5c2060c6-427c-4321-be22-49ccae439d80","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2203.14987","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:5fb78a65e0e1c3080e256b408c2e2e4596af02cfcada6e8ba09210b25247e0ec","observation_id":"2a9c9c0a-e2a5-47ca-8545-1bd966d14631","resolution":{"observed_at":"2026-06-29T22:23:59.746338Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-08-20T08:43:15.720979Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":"2402.17485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-06-29T22:24:00.867907Z","title":"EMO: Emote Portrait Alive-Generating Expressive Portrait Videos With audio2video Diffusion Model Under Weak Conditions","venue":null,"work_id":"ab7f5724-ddf7-4030-a2bb-f1d585b6977e","year":2024},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:3d6d2dc144c53de30a9e8879957fae4ff9ba5f9caa9062a39761ccd95cc3f536","observation_id":"29a3cffe-8fc2-41ee-9db5-90eb6abd75d8","resolution":{"observed_at":"2026-06-29T22:24:00.869494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:5d44b1c2aecad14ede238191d26010bc6793c6f20c1446fa6d7b3f173d61e5fb","observation_id":"95451ad3-c104-4606-88a4-9cca37973830","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:98a579f48ca4903616d5ea652d000e1a4d4fb2ebfc3b84737a24ef0f90170a41","observation_id":"3f1be05c-d59c-477e-959d-550af30f6f83","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:af88c4ec7dfa7858de53eee988f3bd788a1f96d3c7bf4161ada361e01370e9f5","observation_id":"55e8437f-b6b4-4de0-aa3d-b9558b220376","resolution":{"observed_at":"2026-06-29T22:24:00.877232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:d718eea80b9a174bf92ec9e954798f300d50aa8fac0dd4eca290af744605da0d","observation_id":"201a50c4-cb27-436f-95f8-e2d55e298185","resolution":{"observed_at":"2026-06-29T22:24:00.836169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18828","last_updated":"2024-10-04T04:41:06Z","snapshot_observed_at":"2026-08-20T14:16:53.799372Z","submitted_at":"2023-11-30T18:59:20Z","title":"One-step Diffusion with Distribution Matching Distillation","version":4},"cited_work":{"arxiv_id":"2311.18828","doi":"10.48550/arxiv.2311.18828","metadata_source":"pith","pith_arxiv_id":"2311.18828","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Freeman, and Taesung Park","venue":"cs.CV","work_id":"b7f7dc30-a5c5-4364-a21a-2d0a9e50e741","year":2023},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2311.18828","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:2edeb5ca2e675bb7700ee04436b7dc5703cd4adcb10cbe89a06d1489d7cbdf5f","observation_id":"d57379ff-8caf-4b2f-b05a-c3f103360558","resolution":{"observed_at":"2026-06-29T22:24:00.848098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:15:17.804936Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:6c8b874a6bc3de59c22e16e48909d420f6dacc19602d83e92fb440682268cd14","observation_id":"1bc2666b-0138-47e4-9bb6-767a6855b763","resolution":{"observed_at":"2026-06-29T22:15:17.804936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.07449","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:24:00.828406Z","title":"arXiv:2602.07449 [cs.CV]https : / / arxiv","venue":null,"work_id":"920f1602-61e8-47f3-8d12-f823cb2bc4de","year":null},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:3ff501b03357ed6d496440df87de791c17e14b525c94e8bfcec254c9f8b155bc","observation_id":"7eadb51c-116f-4b7e-ad89-436b2c89984e","resolution":{"observed_at":"2026-06-29T22:24:00.829880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07823","last_updated":"2026-04-14T22:09:01Z","snapshot_observed_at":"2026-08-12T18:55:29.657974Z","submitted_at":"2026-04-09T05:26:09Z","title":"LPM 1.0: Video-based Character Performance Model","version":2},"cited_work":{"arxiv_id":"2604.07823","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07823","snapshot_observed_at":"2026-07-04T16:49:57.680916Z","title":"LPM 1.0: Video-based Character Performance Model","venue":"cs.CV","work_id":"45ba45a3-7c87-45d8-a356-bc54d049c1af","year":2026},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2604.07823","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:b7cac873b8d9ce8f9ab4d4edb7dba471ff74303377dfc2216a8aec7395b4a626","observation_id":"f0614a03-a9da-4d66-bed4-d4d39f112ded","resolution":{"observed_at":"2026-06-29T22:24:00.827132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09862","last_updated":"2025-07-14T02:22:47Z","snapshot_observed_at":"2026-08-19T21:46:46.680017Z","submitted_at":"2025-07-14T02:22:47Z","title":"SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation","version":1},"cited_work":{"arxiv_id":"2507.09862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.09862","snapshot_observed_at":"2026-07-05T12:41:04.344983Z","title":"Speakervid-5m: A large-scale high-quality dataset for audio-visual dyadic interactive human generation","venue":"cs.CV","work_id":"688016ba-158b-407b-a0cf-8c4e05da5c25","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2507.09862","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:23999d1a4233508e1cd751fd993baf6452b6ae10d6bb1647fe8e7c776d02b2ab","observation_id":"c8954270-ad6b-475a-a5fd-20e19cf5df25","resolution":{"observed_at":"2026-06-29T22:24:00.841546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-15T12:21:16.936063Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":"2503.21755","doi":"10.48550/arxiv.2503.21755","metadata_source":"pith","pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","venue":"cs.CV","work_id":"14060202-ac5f-48e9-b91a-24d150775431","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:776e19c323991aac71e7e2adad56c458a4a372af78f028437d288b8b00ee3f63","observation_id":"1a8e8902-5c98-47f7-9334-02f415bedda7","resolution":{"observed_at":"2026-06-29T22:24:00.833339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":13,"verified_exact":27,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 3 inbound Pith citation observations for arXiv:2605.25659."}