{"as_of":"2026-08-21T10:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e096abb745b72bfd1a9b0a736c16099a364e4bf0c3b27029bf2f42f3490acace","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:29:35.963805Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05663/citation-record","integrity":"/paper/2608.05663/integrity","json":"/paper/2608.05663/citation-record.json","paper":"/paper/2608.05663"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-13T04:37:51.305325Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-08-10T04:29:35.933949Z","title":"Ovi: Twin backbone cross-modal fusion for audio-video generation.arXiv preprint arXiv:2510.01284,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.933949Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:0482681028412fb91b3244b5f11a52429cf09e91d136e177b07863e05fa9ef0b","observation_id":"eb89b08a-c5a7-4804-9ca3-f2981b74f2f2","resolution":{"observed_at":"2026-08-10T04:29:35.933949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:29:35.945967Z","title":"Yaofeng Su, Yuming Li, Zeyue Xue, Jie Huang, Siming Fu, Haoran Li, Ying Li, Zezhong Qian, Haoyang Huang, and Nan Duan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.945967Z"},"links":{"citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:1226178790e4cb99e18efb6e07714e6413eebf04890f4369abb57e53d1714601","observation_id":"d61c9683-b47c-459c-9e2d-fd1d50540a1d","resolution":{"observed_at":"2026-08-10T04:29:35.945967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-08-13T16:52:19.187566Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25659","snapshot_observed_at":"2026-08-10T04:29:35.949368Z","title":"Streamchar: Long-horizon streaming character audio-video gener- ation with decoupled orchestration.arXiv preprint arXiv:2605.25659,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.949368Z"},"links":{"cited_paper":"/paper/2605.25659","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:e02e1e888980ebc4220d04e82395d1bbe4b93fcafbad5b0a1768b3a715d96254","observation_id":"69749f90-9b72-4028-b2bc-1b123ea579f9","resolution":{"observed_at":"2026-08-10T04:29:35.949368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-18T04:00:09.136122Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-10T04:29:35.952948Z","title":"Towards accurate generative models of video: A new metric & challenges.arXiv preprint arXiv:1812.01717,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.952948Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:c4384d17edbe78a607e49eb1359d6a4f082f77bf9accd6bfeb4b0ce12ec53bd3","observation_id":"f77f7ea1-626b-479a-bf65-0705ae76118e","resolution":{"observed_at":"2026-08-10T04:29:35.952948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-08-20T21:21:54.424645Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-08-10T04:29:35.956596Z","title":"Longlive: Real-time interactive long video generation.arXiv preprint arXiv:2509.22622,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.956596Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:31ea180b9d8b2616e7a28c5b3ea9aba582060d827e72512db2cffae961399daf","observation_id":"687f4def-a464-4abe-8d0f-7873a4c9aa4f","resolution":{"observed_at":"2026-08-10T04:29:35.956596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-15T12:21:16.936063Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-10T04:29:35.960244Z","title":"Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.960244Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:fcde83e708de5d00442bf8bf8dec79663ee7b3096a08d5856ee18e48f6daa36e","observation_id":"4e7a7e3d-bf41-4100-84a0-d93a515b1c39","resolution":{"observed_at":"2026-08-10T04:29:35.960244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-17T22:01:08.736822Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02214","snapshot_observed_at":"2026-08-10T04:29:35.963805Z","title":"Causal forcing: Autoregressive diffusion distillation done right for high-quality real-time interactive video generation.arXiv preprint arXiv:2602.02214,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.963805Z"},"links":{"cited_paper":"/paper/2602.02214","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:7b465c5a634448ef121015b15c982b74dd414d1cccc70fb82dd42832f4c16cf9","observation_id":"b5c7cb3e-d353-42a9-96f8-8c187d8dfd57","resolution":{"observed_at":"2026-08-10T04:29:35.963805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-10T04:29:35.920343Z","title":"Qwen3-tts technical report.arXiv preprint arXiv:2601.15621,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.920343Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:ad6882c029c0098f30435bd391d9ba25a579cf6c04e72fdf2a9e4b71ac477a4d","observation_id":"610c8caf-2a41-4d73-85b1-d1a24639c7c6","resolution":{"observed_at":"2026-08-10T04:29:35.920343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-08-21T07:01:40.887307Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-08-10T04:29:35.915778Z","title":"Ltx-2: Efficient joint audio-visual foundation model.arXiv preprint arXiv:2601.03233,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.915778Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:6c69a98ceecb4d5976a78a5fbe65a22109c93d931763be768cbd95efd4f797ab","observation_id":"fc6e11c0-209c-4487-8b6f-b08e39271b5c","resolution":{"observed_at":"2026-08-10T04:29:35.915778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-19T04:53:25.142828Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-10T04:29:35.941299Z","title":"Seedance 2.0: Advancing video generation for world complexity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.941299Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:f46c330719368a843791f466a231cc9bb5f963df2637a55bfc6e2f847fc98a10","observation_id":"2e437e8c-84f7-4676-9e8f-1d3fc6846179","resolution":{"observed_at":"2026-08-10T04:29:35.941299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23632","last_updated":"2026-04-26T09:46:58Z","snapshot_observed_at":"2026-07-06T23:09:48.137856Z","submitted_at":"2026-04-26T09:46:58Z","title":"Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23632","snapshot_observed_at":"2026-08-10T04:29:35.929035Z","title":"Hallo-live: Real- time streaming joint audio-video avatar generation with asynchronous dual-stream and human-centric preference distillation.arXiv preprint arXiv:2604.23632, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.929035Z"},"links":{"cited_paper":"/paper/2604.23632","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:ddd5cb3a8b46aaf77206a41c4669bb56294e512f660147ffaeec22e6c233f4ed","observation_id":"6933ea50-b74c-4838-9e28-92ee8a085d9f","resolution":{"observed_at":"2026-08-10T04:29:35.929035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:29:35.937878Z","title":"Build llm-based zero-shot streaming tts system with cosyvoice","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.937878Z"},"links":{"citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:889e4c290dcd7ec11e253637bc26571b49364bf5e27dc4e097340b99404e9a51","observation_id":"2001127f-8aa6-46fc-9f4c-31a90c4e13ea","resolution":{"observed_at":"2026-08-10T04:29:35.937878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04443","last_updated":"2026-07-08T11:37:37Z","snapshot_observed_at":"2026-08-12T18:02:30.318154Z","submitted_at":"2026-07-05T18:05:20Z","title":"Wan-Streamer v0.2: Higher Resolution, Same Latency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.04443","snapshot_observed_at":"2026-08-10T04:29:35.925051Z","title":"Wan-streamer v0","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:35.925051Z"},"links":{"cited_paper":"/paper/2607.04443","citing_paper":"/paper/2608.05663"},"observation_digest":"sha256:6f0f163d1171e9d0e8a38a001a846040b7f7cb5b049d9252128ac88971ec614c","observation_id":"e8b79d37-e3e2-4fea-9eda-c81ff451a5f5","resolution":{"observed_at":"2026-08-10T04:29:35.925051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05663","last_updated":"2026-08-07T03:30:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T23:10:13.559246Z","submitted_at":"2026-08-06T07:00:37Z","title":"Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2608.05663."}