{"as_of":"2026-08-08T06:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:060dcc29364102acb0e9ff76289ef2967cdd9543f2441c3e040750a7088a74f1","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:01:30.793099Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:45:46.122397Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:57.706870Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T23:09:55.836036Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T01:56:44.123092Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:56c12714a4b14c0a707d900266c5ecd9121ef6c0221758332e806776ee761ae1","observation_id":"53c7a565-32d3-4fa6-b7a2-cba71f4677f3","resolution":{"observed_at":"2026-05-17T01:58:51.499544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-08-03T18:39:41.196491Z","title":"Midas: Multimodal interactive digital-human synthesis via real-time autoregressive video generation.arXiv preprint arXiv:2508.19320, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T23:09:55.836036Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.196491Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:634945c8e7b9a7f8d664acc24289960020bdd4dcfb325e263da85ebdd7fb08d7","observation_id":"0cb89d86-de96-464c-a2f5-08274b1f2d33","resolution":{"observed_at":"2026-08-03T18:39:41.196491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2512.10571","last_updated":"2026-05-02T11:27:08Z","snapshot_observed_at":"2026-07-31T11:34:00.884185Z","submitted_at":"2025-12-11T11:58:53Z","title":"AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T23:26:21.855485Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2512.10571"},"observation_digest":"sha256:3e7d8b5ac7cf9e0ba52f7a791c7795937a923312aceb711e004d79d52843ac0b","observation_id":"108d7ebf-e767-4e25-bd24-cec23c714294","resolution":{"observed_at":"2026-05-16T23:28:40.883660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":148,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:43b3491b4443303ad9240dc98bc2676594288289f755441ce9679c24080ef4c9","observation_id":"665fde9b-a8a6-4d66-a681-4e7eac0bc3bb","resolution":{"observed_at":"2026-05-11T08:30:56.876833Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Midas: Multimodal interactive digital-human synthesis via real-time autoregressive video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:4f888e11fa45a80161cee46366d934acccc0f94c56bcc2f7f176768c7124c1ee","observation_id":"5db50733-5e4c-431f-b55a-f56a089308b9","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-01T16:25:56.041910Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T20:19:39.565157Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:2a5b3b47fd63ed1210baf4947dd3b3e4a56c0bdb819b9b5b1bf7ca5a7fbc80f7","observation_id":"4b8026f9-42e5-4e45-b571-5ba2bc0952fb","resolution":{"observed_at":"2026-05-11T15:16:11.366786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2605.10079","last_updated":"2026-05-11T07:01:38Z","snapshot_observed_at":"2026-07-06T23:22:03.830881Z","submitted_at":"2026-05-11T07:01:38Z","title":"SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:28:30.471533Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2605.10079"},"observation_digest":"sha256:ced2452628d9b1609237b2f08bd9312b76942674afe0f4a7a6b905c04d8116bf","observation_id":"f2f4e523-8418-4ece-a17a-6951507b5999","resolution":{"observed_at":"2026-05-12T07:21:23.960771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2605.18467","last_updated":"2026-05-18T14:27:05Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:27:05Z","title":"InstructAV2AV: Instruction-Guided Audio-Video Joint Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:32.558440Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2605.18467"},"observation_digest":"sha256:967eb97e4ee4b9696dab37b14c963169f8cbb643094c47dc5019df76676b15f4","observation_id":"add3ca7b-f2a2-4f9d-a150-b6b9f950d996","resolution":{"observed_at":"2026-05-20T11:38:14.757856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T00:13:38.523397Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:19c7cee60604e432fe663801e7fd4d25c55fbf88a240471efb61d8f17eb53e38","observation_id":"49a4d07d-3d86-40f9-95b8-099f10a15b9a","resolution":{"observed_at":"2026-07-04T16:49:57.708442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T05:27:24.078053Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:b894a71cc3cfbc6801d82cb3fe2e7c2e9fc3c56c1af734c70562073ae414fd74","observation_id":"b7e421ae-0ffe-48aa-b59e-219dd8b4607d","resolution":{"observed_at":"2026-07-04T13:09:50.999411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T09:43:09.347118Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:a5d37a04b0b81c18e604f8ba8f1d84f370acc06b3edbcb25fcccb9ba803ac221","observation_id":"482642b1-8e99-4271-acf3-86030bcb6b72","resolution":{"observed_at":"2026-06-30T09:44:37.344060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2606.27779","last_updated":"2026-06-26T07:11:10Z","snapshot_observed_at":"2026-08-07T20:53:29.333353Z","submitted_at":"2026-06-26T07:11:10Z","title":"MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T05:04:31.366845Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2606.27779"},"observation_digest":"sha256:f9a777dd549c1137410fe22e1b987e3a2c8ed48121cf45c2ffee54dc898f20b9","observation_id":"0e7788fd-13a0-44e1-ab20-7915a5a6513e","resolution":{"observed_at":"2026-06-29T18:33:51.194113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-08-01T03:52:55.445287Z","title":"arXiv preprint arXiv:2508.19320 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23023","last_updated":"2026-07-28T02:01:27Z","snapshot_observed_at":"2026-08-06T04:02:53.538330Z","submitted_at":"2026-07-25T03:42:52Z","title":"OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T03:52:55.445287Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2607.23023"},"observation_digest":"sha256:119ca23a0d8638c7711df971ca4e4318b5a38303d3cc937323b7eefd8b033d23","observation_id":"55e9fcb2-b64a-476c-802f-ffb5b005e91e","resolution":{"observed_at":"2026-08-01T03:52:55.445287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-08-04T06:45:46.122397Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.122397Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:807dc45df95bf95748fcda1a22bf44aab9b30b8abf63fd74b9aca506a205ffd3","observation_id":"d958e652-9421-4996-b66f-9ef6324edd8e","resolution":{"observed_at":"2026-08-04T06:45:46.122397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19320/citation-record","integrity":"/paper/2508.19320/integrity","json":"/paper/2508.19320/citation-record.json","paper":"/paper/2508.19320"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-05T16:01:30.733718Z","title":"Lrs3-ted: a large-scale dataset for visual speech recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.733718Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:e589d9215457bea10a1cf74d3c96523e9a4b1dc317579e37652d1fed68081f6f","observation_id":"17051457-5094-405d-b920-58048bd69c7d","resolution":{"observed_at":"2026-08-05T16:01:30.733718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-07-06T19:59:37.692710Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-05T16:01:30.743448Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.743448Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:928e912b4dd7cd0675fe4c207622503e79dd4100a69027c426a8971ed67c1042","observation_id":"9079251d-3480-4c4e-a654-a288346b7d44","resolution":{"observed_at":"2026-08-05T16:01:30.743448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-07T22:08:51.244821Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-05T16:01:30.751310Z","title":"Liveportrait: Efficient portrait animation with stitching and retargeting control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.751310Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:52cd24339940778fe4a27d9c2f2c248af3717e7e44362631fb994ee9a763e7fd","observation_id":"58175350-9275-4437-beee-9c33f9f6a819","resolution":{"observed_at":"2026-08-05T16:01:30.751310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-05T16:01:30.758960Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.758960Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:22558ef3bd411fa65252a7cd4c7b90d00af64b6bf11cbff0a8eeb3b8ba9b3192","observation_id":"87e2ecc3-0a5f-4fa9-ba94-ac0d8c4a75e5","resolution":{"observed_at":"2026-08-05T16:01:30.758960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-05T16:01:30.762208Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.762208Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:c37034efbe1b51a4e91cb6a38671b2c121eef1300beb4d4f683b22faea5eee68","observation_id":"b7dc1f40-57f5-44e4-a77f-f664e284d62b","resolution":{"observed_at":"2026-08-05T16:01:30.762208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-07-06T20:30:02.903743Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-05T16:01:30.764940Z","title":"Omnihuman-1: Re- thinking the scaling-up of one-stage conditioned human animation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.764940Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:d27cc7a171bb3b309b7360e11abc5036ed29128c1397238a4f6c902b4d6c91df","observation_id":"b49db34c-bbd5-4f14-8308-656af95ccf76","resolution":{"observed_at":"2026-08-05T16:01:30.764940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-08-05T16:01:30.768612Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.768612Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:6811b1df6b406434d1ff4c54ebca24d317781c2d3758a6c8975c2d88d8bcc1f2","observation_id":"fe4cfe71-a521-4a47-b5ef-56faa10a8e68","resolution":{"observed_at":"2026-08-05T16:01:30.768612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:30.941816Z","title":"V oxceleb: A large-scale speaker iden- tification dataset","venue":null,"work_id":"0e497f49-ec89-4de3-b502-0924367d5d44","year":2017},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.772271Z"},"links":{"citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:0fd9a502cccdd55784fb988ee38f18bd12698982fb756a6da046247653909cc0","observation_id":"a9928428-2bc5-4a59-b748-6472665c45af","resolution":{"observed_at":"2026-08-05T16:01:30.946894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T16:01:30.778327Z","title":"org/abs/2212.04356","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.778327Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:eefdcf046e15f10d51fcf8ae48b5bc4e73febf4e6b0031350cdba319c8967efa","observation_id":"2a1348e7-2ac6-4672-8192-6cbeaeab58f0","resolution":{"observed_at":"2026-08-05T16:01:30.778327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-05T16:01:30.781337Z","title":"Magi-1: Autoregressive video generation at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.781337Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:9d170c663805d9bb4229b8920e69921caf859127b666aac1a455d4be1674654e","observation_id":"be07b53f-fc56-413b-b096-767400a84c2a","resolution":{"observed_at":"2026-08-05T16:01:30.781337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-07-06T20:22:50.018799Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-05T16:01:30.783917Z","title":"Emo2: End-effector guided audio- driven avatar video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.783917Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:c1651448f2f9988be39053065f6f060d4bc5f9e53cba35ed4e767c7c0910db79","observation_id":"c3902634-2cbb-4768-91eb-efa0626f97cf","resolution":{"observed_at":"2026-08-05T16:01:30.783917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-05T16:01:30.787197Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.787197Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:580f7380a10deeb070e05d0b54ffef2e6eb479a2ba8cf5ff61fc6ba41f42ff6e","observation_id":"5abb561e-3940-4e21-9c09-452074a8ff51","resolution":{"observed_at":"2026-08-05T16:01:30.787197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21144","last_updated":"2025-03-27T04:18:53Z","snapshot_observed_at":"2026-08-07T16:33:53.883380Z","submitted_at":"2025-03-27T04:18:53Z","title":"ChatAnyone: Stylized Real-time Portrait Video Generation with Hierarchical Motion Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21144","snapshot_observed_at":"2026-08-05T16:01:30.775017Z","title":"Chatanyone: Styl- ized real-time portrait video generation with hierarchical motion diffusion model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.775017Z"},"links":{"cited_paper":"/paper/2503.21144","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:077ecf4b9b33dbdd563e0faa52151b83efc2f7b6e1de556de530def88bacc617","observation_id":"fb3361aa-f299-458b-9e9d-02fd7de75b16","resolution":{"observed_at":"2026-08-05T16:01:30.775017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02879","last_updated":"2024-08-06T01:13:09Z","snapshot_observed_at":"2026-08-05T17:22:02.707336Z","submitted_at":"2024-08-06T01:13:09Z","title":"Body of Her: A Preliminary Study on End-to-End Humanoid Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02879","snapshot_observed_at":"2026-08-05T16:01:30.737383Z","title":"Body of her: A preliminary study on end-to-end humanoid agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.737383Z"},"links":{"cited_paper":"/paper/2408.02879","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:e17d0b333f2689b4fee57e3a82d6e81da51586fa939743e7a785ed41d9891a19","observation_id":"e9078eba-f632-477d-9580-59079727a280","resolution":{"observed_at":"2026-08-05T16:01:30.737383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23307","last_updated":"2025-03-30T04:22:09Z","snapshot_observed_at":"2026-08-07T20:48:48.663695Z","submitted_at":"2025-03-30T04:22:09Z","title":"MoCha: Towards Movie-Grade Talking Character Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23307","snapshot_observed_at":"2026-08-05T16:01:30.790252Z","title":"Mocha: Towards movie-grade talking character synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.790252Z"},"links":{"cited_paper":"/paper/2503.23307","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:b1d04764eb70ac82697ecd6a626b5c468393f851da367669a88dbdd310df14bb","observation_id":"e3481134-6850-4cd3-8ffa-015982987b44","resolution":{"observed_at":"2026-08-05T16:01:30.790252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-05T16:01:30.747278Z","title":"Long-context autoregressive video modeling with next-frame prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.747278Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:c454875eb6b369a4ee30d8c681c21781786824ed13dd32b2f08e2aa763fafff5","observation_id":"c3dc2ccd-0c20-40ec-9c59-4cc98d8737e8","resolution":{"observed_at":"2026-08-05T16:01:30.747278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T16:01:30.793099Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.793099Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:2a5e4362bc1c1ef327da65c04eb8520553c1447d1cd25d2bcbb3321ee644c9bd","observation_id":"6b852dd8-9b9b-4d85-8dee-48b1a43d6c9b","resolution":{"observed_at":"2026-08-05T16:01:30.793099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19833","last_updated":"2025-06-24T17:50:16Z","snapshot_observed_at":"2026-08-06T22:59:27.051058Z","submitted_at":"2025-06-24T17:50:16Z","title":"Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19833","snapshot_observed_at":"2026-08-05T16:01:30.754418Z","title":"Bind-your-avatar: Multi-talking-character video generation with dynamic 3d-mask-based embedding router","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.754418Z"},"links":{"cited_paper":"/paper/2506.19833","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:0ec9bd36056fb8a682d0a56963b4160cc62bfbf3096d885d1da0ecb0f7584717","observation_id":"637da00f-17f4-4838-b577-1697b3dc2884","resolution":{"observed_at":"2026-08-05T16:01:30.754418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:30.954041Z","title":"V oxceleb2: Deep speaker recognition","venue":null,"work_id":"11f463b8-ff88-47f4-9123-21724506cb06","year":2018},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.740367Z"},"links":{"citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:306a0047459236b5deafbe6b1763acc279adc4f7eba1488c4f2c170e9e2c74c8","observation_id":"7e51af2a-bd1f-4de3-bd17-ae5ac711161a","resolution":{"observed_at":"2026-08-05T16:01:30.957306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T16:01:30.244519Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 14 inbound Pith citation observations for arXiv:2508.19320."}