{"as_of":"2026-08-21T04:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c5866df22574bc23631e335d2531698387d3a59f394e3741df7bb8e0cb12329","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:19:18.112043Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08279/citation-record","integrity":"/paper/2506.08279/integrity","json":"/paper/2506.08279/citation-record.json","paper":"/paper/2506.08279"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:06.228094Z","title":"Botev, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.228094Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:c1f66e1401f05a547f567ebba24da42bcb29e4b4e8587c4ad382ffcb4f878af7","observation_id":"479f80bc-7a74-44e7-ac9e-b57cf92ee2a9","resolution":{"observed_at":"2026-08-07T05:19:06.228094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.097824Z","title":null,"venue":null,"work_id":"c73f3521-4602-4f21-b4ec-40d4c5d7d249","year":2009},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:16.284169Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:cb9ace77d6bb87af38ac3394e52e55c1f278848581c71e53d97963e1e4d7fabb","observation_id":"a9d4e9c9-6263-40ad-8548-98ec8621b3fa","resolution":{"observed_at":"2026-08-07T05:19:21.109196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:07.536393Z","title":"Chhatre, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.536393Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:a7973a3ef9935e7efd4b4b43ea7020909d9ecc68fa0b948b6eec5c3c38bbc79c","observation_id":"4e5db915-f178-49db-b69c-e8d38b4ec85e","resolution":{"observed_at":"2026-08-07T05:19:07.536393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:07.945995Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.945995Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:8bcb7196d02a6b8461fab3c32f8a193f44ee2875cd7ea486d043ec5b0b4f72f4","observation_id":"5a733e25-757d-4a9e-930c-26c517cd6210","resolution":{"observed_at":"2026-08-07T05:19:07.945995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:08.085410Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.085410Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:b9874778fe5260a649830d37cc94b313fd84cfbf61369784623efaf85f95e299","observation_id":"cf2b7ac4-05b8-41b0-8159-f1f078a395b4","resolution":{"observed_at":"2026-08-07T05:19:08.085410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:08.348957Z","title":"Denton and R","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.348957Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:2f7d2d01ed5279bda9ec1243ae1c99dbef322eeb065fee30ff947c54fde19c2a","observation_id":"194d9689-d4fa-4519-95c6-f58c9b949ef8","resolution":{"observed_at":"2026-08-07T05:19:08.348957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:08.546745Z","title":"Dhariwal and A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.546745Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:ebcdcd32410006138d11602c53f8276835c0a14361b8665a6a319b0053abe84d","observation_id":"e4c4cd5f-eca2-45c3-8e9b-3a687e2d45e9","resolution":{"observed_at":"2026-08-07T05:19:08.546745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:08.663302Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.663302Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:3e0e2d2e86f0a6b68c0d2eb7146785e14e1385ed7093beec782cd718b370ff6c","observation_id":"bd410431-1f6a-4d69-ae20-ea8a556ba5d9","resolution":{"observed_at":"2026-08-07T05:19:08.663302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:08.960765Z","title":"Ferstl and R","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.960765Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:c5943979cfc232d2a3a22defb6960034a5a821a21f8b3c212a3fb2456bed28c3","observation_id":"f83ddc31-1d31-46db-ac26-6b91c2ffe4fc","resolution":{"observed_at":"2026-08-07T05:19:08.960765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:09.106021Z","title":"Gafni, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.106021Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:2e2225510ad28439100774ec20293f9978a6e18e7d4db4afd91ee8e05adc25ae","observation_id":"9cea87a3-94e7-4c0b-adb4-a4da078424dc","resolution":{"observed_at":"2026-08-07T05:19:09.106021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08430","last_updated":"2021-08-06T03:22:14Z","snapshot_observed_at":"2026-08-19T15:19:25.831687Z","submitted_at":"2021-07-18T12:55:11Z","title":"YOLOX: Exceeding YOLO Series in 2021","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.08430","snapshot_observed_at":"2026-08-07T05:19:09.227404Z","title":"Genmo Team","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.227404Z"},"links":{"cited_paper":"/paper/2107.08430","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:23a66b3cecd6b0ee73f24bac914b1181d8bd698197c96da9326769e15fb43722","observation_id":"1efe8836-bb01-4427-ace4-1efe6c774951","resolution":{"observed_at":"2026-08-07T05:19:09.227404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.285299Z","title":null,"venue":null,"work_id":"14131492-1f32-4273-b938-ccd849b34b5b","year":2022},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.370489Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:fccd6749973efe4e6073894220a868197e091ceee7138739da2af7023207cd78","observation_id":"3ea7c290-b037-4495-9b99-df3a01843858","resolution":{"observed_at":"2026-08-07T05:19:22.289746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.270882Z","title":"Girdhar, M","venue":null,"work_id":"f853c18b-2aa6-43c5-8896-0b791652a0ab","year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.493523Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:da5196fd1844c0da2bc1f4ed5902e5da980078d28c13b22c9d28d0e7c5aa44e7","observation_id":"08fe4d56-1bc0-4e81-a222-68ab8e9dba1d","resolution":{"observed_at":"2026-08-07T05:19:22.275455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.256428Z","title":null,"venue":null,"work_id":"e8a694ac-f7a0-471e-8170-ee4a3d1b6270","year":2014},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.607341Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:30e744d124471bd7b5dd621df9bb5a1e9d5374230198e591831ee11bcad22bcb","observation_id":"d08da8f7-e8e3-47a6-a32a-55e9ef667048","resolution":{"observed_at":"2026-08-07T05:19:22.261424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.227876Z","title":null,"venue":null,"work_id":"53463869-4d04-4cbb-85a5-431cfc0a866f","year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.887337Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:a9d1b05106662fa89ab2558ec95bd3b7d284f62966daf4b5bc70a0c15f492e07","observation_id":"27d77a7e-db61-4544-b293-3cb55ad155ec","resolution":{"observed_at":"2026-08-07T05:19:22.232589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.5567","last_updated":"2014-12-19T21:36:13Z","snapshot_observed_at":"2026-08-14T23:07:07.038301Z","submitted_at":"2014-12-17T20:39:45Z","title":"Deep Speech: Scaling up end-to-end speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.5567","snapshot_observed_at":"2026-08-07T05:19:10.180414Z","title":"Hannun, C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:10.180414Z"},"links":{"cited_paper":"/paper/1412.5567","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:3852118c843b38113bdb58864d6b1bcb706bf2c7f8a54a8434aa3b966f9e6f2d","observation_id":"b8e4de33-62e3-406d-aa21-bdf16f79fe64","resolution":{"observed_at":"2026-08-07T05:19:10.180414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.213619Z","title":"Hawthorne, A","venue":null,"work_id":"f0b58a76-2357-4550-a4e8-875e8d058ccd","year":2022},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:10.330039Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:56fc99bc873dc469fb649d3515885f3d7090e99eeab3677beacebd4da2d157ac","observation_id":"d126c9a0-6255-4228-bdac-df49b097c246","resolution":{"observed_at":"2026-08-07T05:19:22.218510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.198712Z","title":null,"venue":null,"work_id":"29bcf8fa-772d-4b46-84da-1ea48073ccaa","year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:10.493736Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:e46ab396e1d49f44976b65061eaa31280cfce01e50363152f9c74990d5edc900","observation_id":"a9b416fb-53fc-4678-a140-d78ff219b44a","resolution":{"observed_at":"2026-08-07T05:19:22.203791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T05:19:10.650271Z","title":"Ho and T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:10.650271Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:e41dc97e89ac532199af2f6a69c508e08a8bfd6ab03236a677be510259664536","observation_id":"4dfbf09e-2ea8-45f1-ab6f-2c425c09527b","resolution":{"observed_at":"2026-08-07T05:19:10.650271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.183363Z","title":null,"venue":null,"work_id":"add0e101-cbfd-49f5-9fb8-5e4c5e5d753a","year":2020},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:10.765088Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:a8378fbe658cb575282b2a317c35f8a3084209a04bd57214e4f520e0720a2773","observation_id":"fe625630-b95b-4a4a-9d82-a653db9bf334","resolution":{"observed_at":"2026-08-07T05:19:22.188609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.169362Z","title":null,"venue":null,"work_id":"91680c50-7278-4092-b23d-507114b65a0f","year":2022},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:10.854356Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:aa2078e7d787242b5096a7c44de6bbaf0666e2ae59d11c3bb8b75af079c7002d","observation_id":"42b982fc-ef34-4676-acfd-9198c1f002c5","resolution":{"observed_at":"2026-08-07T05:19:22.174067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.155208Z","title":"Hochreiter and J","venue":null,"work_id":"c5e283df-c690-4ef5-bbb5-a67c466c997e","year":1997},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:10.951433Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:cb2cf36fc38b035b8698d29b48ad5193d8e69e366bc43df36c205e320f868413","observation_id":"88e8327c-fa8e-46d8-b5ad-a577535243c2","resolution":{"observed_at":"2026-08-07T05:19:22.160012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18664","last_updated":"2024-11-27T15:59:48Z","snapshot_observed_at":"2026-08-19T07:58:48.355381Z","submitted_at":"2024-11-27T15:59:48Z","title":"Spatiotemporal Skip Guidance for Enhanced Video Diffusion Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18664","snapshot_observed_at":"2026-08-07T05:19:11.152850Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:11.152850Z"},"links":{"cited_paper":"/paper/2411.18664","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:8359712f6e22952638a145e7c16763e6d442a487df9947c501620305995dc715","observation_id":"4f8add9d-d97b-4a13-999b-483adf215372","resolution":{"observed_at":"2026-08-07T05:19:11.152850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.126768Z","title":"Jaegle, S","venue":null,"work_id":"f84d7335-3d15-4ebe-9811-c41aa1bf2e60","year":2022},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:11.377252Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:f81c3e82201c6df20eb63e1b69c0781be4be6f7c6f15f0e87a3761e438567191","observation_id":"04a5b83c-9263-4032-98cd-0dc3fafe6b3e","resolution":{"observed_at":"2026-08-07T05:19:22.131835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.00527","last_updated":"2016-10-03T13:06:40Z","snapshot_observed_at":"2026-08-14T21:37:01.428239Z","submitted_at":"2016-10-03T13:06:40Z","title":"Video Pixel Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.00527","snapshot_observed_at":"2026-08-07T05:19:11.480669Z","title":"Kalchbrenner, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:11.480669Z"},"links":{"cited_paper":"/paper/1610.00527","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:f00191631a240d27c28e8f670d4b6a820be4da79eae3b0082f05c3f0cd5d37ba","observation_id":"b8bd732a-ee48-4109-90a5-ecbf48cdc8d8","resolution":{"observed_at":"2026-08-07T05:19:11.480669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.111297Z","title":"Karras, T","venue":null,"work_id":"66cba112-26c9-42be-8183-80ed08230f6f","year":2017},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:11.581851Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:7baca60c97ea34fe4a9df9dd73d89b04c0eb761b7068ac91d150d81fe90e485d","observation_id":"d97905c6-c039-4c35-ad70-594cac4e4bf2","resolution":{"observed_at":"2026-08-07T05:19:22.116858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.058726Z","title":"Kopp and I","venue":null,"work_id":"ff129c82-9c10-4274-b06b-8d94503e9a31","year":2004},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:11.830083Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:8c1ef96f60cf6740201f6f7e7b838d8d6dc81cb1290e033110e97561cc1855a0","observation_id":"614788d6-4cbf-4313-88fa-5c63d5a5872f","resolution":{"observed_at":"2026-08-07T05:19:22.087834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.924409Z","title":null,"venue":null,"work_id":"56149af2-3c44-4b3b-b9b5-db0e1c4e3746","year":2021},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:12.030695Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:4fd99146f45962d9109eef4f68d8dfce461d499f23d91a7a2a713f96f197b86c","observation_id":"1f207263-be4f-4c50-b375-0f3f7ab0abb7","resolution":{"observed_at":"2026-08-07T05:19:21.956318Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.888100Z","title":null,"venue":null,"work_id":"6bb9f8ad-f36a-4983-9975-61558d577343","year":2017},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:12.094677Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:470ad8f3e96995d95579bb15741c7b2c959b120c33ac8a2bbdee117da977c547","observation_id":"fb2470c0-39c8-4355-a312-737b853b98c1","resolution":{"observed_at":"2026-08-07T05:19:21.895764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-20T06:05:18.569195Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-07T05:19:12.187722Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:12.187722Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:d3655ef98a380c598233cbc5a797ed58091fae76b97f7206dfaff797f36d8485","observation_id":"03cac34e-c3bb-4ac4-a4c9-a0825685288b","resolution":{"observed_at":"2026-08-07T05:19:12.187722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T05:19:12.270666Z","title":"Lipman, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:12.270666Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:c9ddbce8cf91bd8f6efed6e4f0fa1443e4e6bb14e8c70ef2053422a089cebaee","observation_id":"2a4d77f3-7446-4cbf-8155-a783324048ba","resolution":{"observed_at":"2026-08-07T05:19:12.270666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2310.0188","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:18.619686Z","title":null,"venue":null,"work_id":"8ca4e1fd-829e-4a64-8e3c-85b562baa536","year":null},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:12.373471Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:cdf4a848e62634b96329486e6a3f26165b47cf0f4189e4fe68259663d033a5fa","observation_id":"38b811d2-0ec0-4145-bda0-9583e361f8c8","resolution":{"observed_at":"2026-08-07T05:19:18.742137Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.867622Z","title":null,"venue":null,"work_id":"fa3b0bc4-7ead-4d33-b8ac-0c022d85c577","year":2019},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:12.464998Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:343d4a74e6d357ddf05305a735f0e363467295f8c641c2023cd0f701df2641af","observation_id":"f971ec60-a45e-4f94-b528-a3f7d1ee0fde","resolution":{"observed_at":"2026-08-07T05:19:21.874888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-20T11:52:04.914215Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-07T05:19:12.568058Z","title":"Lugaresi, J","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:12.568058Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:74e560579e00639bb21636a08ddfdc411b7f5f357be036b8ec9c7512037b2dc2","observation_id":"fe1c6971-fb5b-4274-aa63-4eb2831e5bc5","resolution":{"observed_at":"2026-08-07T05:19:12.568058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.848350Z","title":"Mathieu, C","venue":null,"work_id":"0f976407-a2d5-4d1b-8c01-f7779f7b5195","year":2016},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:12.668371Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:cc922f51298ae47fb8630c9dacf77f4ac6a6c62b585f583be7650b4524c93250","observation_id":"d5ee3e8c-2528-448b-af2f-c2c3d5207de5","resolution":{"observed_at":"2026-08-07T05:19:21.854664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.824544Z","title":"Mediainfo","venue":null,"work_id":"22960f89-382d-4727-9869-595025926d5a","year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:12.769469Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:19c6514233d325ff6f4a20f1f933c13220596dac910a83fbe16ae0f5312cbc9e","observation_id":"34e496ba-41d7-4d82-8d5a-c7d3ab9e877f","resolution":{"observed_at":"2026-08-07T05:19:21.833136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.802187Z","title":"Medina, D","venue":null,"work_id":"2bd4cd79-6d9f-4f06-861e-ff82f738e1f6","year":2022},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:12.867704Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:0a10e1e1b2eac847d5cb25215a315063464c4247a1d8c0fa1a60ed407931a2cf","observation_id":"2b3d3b07-f94e-4650-b4dc-7494be04e222","resolution":{"observed_at":"2026-08-07T05:19:21.812843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.779219Z","title":"Mittal and B","venue":null,"work_id":"e3f6afce-c015-49ad-af15-b64c45292bd7","year":2020},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:12.939743Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:ea90bc68227895b55b8da982b570d82d202f6da20f3e11e136bd3ea298f2eba5","observation_id":"1533de57-410f-49e2-bb13-564421c1a0d0","resolution":{"observed_at":"2026-08-07T05:19:21.786185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.040105Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:13.040105Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:9dfa47cf47345072f1cc013798a6bc13cbc0cfa6af78e50318a37b1148e37960","observation_id":"90fcfa84-3c52-4682-9f70-62513b818d9a","resolution":{"observed_at":"2026-08-07T05:19:13.040105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:19:13.238161Z","title":"OpenAI, , A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:13.238161Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:1ba25c314892d2d6565af4f5eb1be5ddac19605e4478002cf500bccd145d5103","observation_id":"dd9b1482-b690-410c-b491-d42b262dbe42","resolution":{"observed_at":"2026-08-07T05:19:13.238161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.732662Z","title":null,"venue":null,"work_id":"89743237-e9fa-4084-999b-b5f8916e690d","year":2019},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:13.310892Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:3177b3f5c272f51a7b7a7b4944eaf586ab0b5f2099e9797c0da9d72a353faf4f","observation_id":"7efe4e4e-ec16-4b1f-a78e-89ce91cb053e","resolution":{"observed_at":"2026-08-07T05:19:21.740396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.709386Z","title":"Paszke, S","venue":null,"work_id":"25281b7e-651c-435d-8e5b-6e8281f03e2a","year":2019},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:13.413929Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:2b4a52445a2c6bfe87386fc885571cf358a7401e217d4d16f9a28bc380906021","observation_id":"d499290e-161a-4f66-81e8-5b66868640ff","resolution":{"observed_at":"2026-08-07T05:19:21.715846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.687035Z","title":"Peebles and S","venue":null,"work_id":"c515a7a8-50b4-44ed-b492-94b83f439d26","year":2023},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:13.510041Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:cdc36b1f43f5669712b3a3ccf2d06a08adac6f4e425e28f375f37f8c0aa50436","observation_id":"9685c906-d6d9-41de-a81f-19cdaec8c9a1","resolution":{"observed_at":"2026-08-07T05:19:21.695457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.661164Z","title":"Pelachaud and M","venue":null,"work_id":"02c0a1bd-7aac-4806-b535-08923a0f8a4d","year":2003},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:13.577786Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:c614e8d481eb8869c56f5231ec4a85dc47030201bf45afff7b6004a4732d3c7a","observation_id":"2b54c2ea-76ce-4b95-be58-cef9497f4546","resolution":{"observed_at":"2026-08-07T05:19:21.670842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.772839Z","title":"Radford, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:13.772839Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:47bc9372c444d4decf6765c6f0daf377071b14d24b78cbba20bdc986f689dedb","observation_id":"eecd3c41-1912-46f7-9471-209f772b057e","resolution":{"observed_at":"2026-08-07T05:19:13.772839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.621690Z","title":"Ronneberger, P","venue":null,"work_id":"3dc6cd76-2445-4d71-b457-905a18ac3579","year":2015},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:13.846651Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:2e9cece791c59c096df74ec239ba5b3585da6a5b7b9fbdbf0da3730e075d72ba","observation_id":"be5c47cd-552e-40ac-92cd-973fea5a103c","resolution":{"observed_at":"2026-08-07T05:19:21.629109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T05:19:14.039893Z","title":"Schneider, A","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:14.039893Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:a2d5f3c44b29ba1c80b23a5e2d32fdb74a2b606b4bd98685e877fc3f102985cc","observation_id":"ad2f536e-d363-4745-ab5f-ffb2d3fc48e7","resolution":{"observed_at":"2026-08-07T05:19:14.039893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.521009Z","title":null,"venue":null,"work_id":"3c29d815-0f31-4483-90e9-b8eeabd861f8","year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:14.141787Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:0f0f5dc23405cb5522888d58799fdba403eae97fefe1da55afb35b74a70f5968","observation_id":"26357c1d-b8ea-4121-a34a-7f6bc708e467","resolution":{"observed_at":"2026-08-07T05:19:21.570180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.377312Z","title":null,"venue":null,"work_id":"dfcae56a-c257-4c55-9381-7eba32a9239c","year":2023},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:14.511566Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:bd9a9364225ddb5c3b38957d203f26609f24a50c957e6b759ca338f57bb10a81","observation_id":"79b8dc9d-0f51-4072-8ec4-879ce2b6f6bd","resolution":{"observed_at":"2026-08-07T05:19:21.443301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-07T05:19:15.101657Z","title":"Singer, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:15.101657Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:ac20636b7ebc66b2407ab089677c20df14735c9a48d90a5c37839ab33a6a64db","observation_id":"2b01a1e6-3cc4-4e07-a2cd-cfcabd0f8594","resolution":{"observed_at":"2026-08-07T05:19:15.101657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:15.624469Z","title":"Sohl-Dickstein, E","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:15.624469Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:c07949ee31d24c95c7f1df7f4f5998175a323e76f324791ea0cd61b22833dbc2","observation_id":"07438fd0-541e-4c96-8077-2e9e7054901c","resolution":{"observed_at":"2026-08-07T05:19:15.624469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.245380Z","title":"Stypułkowski, K","venue":null,"work_id":"142fc3dc-01ef-475f-ab8d-f34f4bbab3a9","year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:15.803481Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:615cdeff9ec8a76f41ffe33d53e3dcff3a32fe98c43af1c99e4566591602f67a","observation_id":"24d09071-d1bc-4df4-b4bb-b09fb6f55e95","resolution":{"observed_at":"2026-08-07T05:19:21.298206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.173806Z","title":null,"venue":null,"work_id":"66fac60d-3d71-4184-afb0-d159d41a5775","year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:15.920745Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:be3f4aaa48cd13ee92406ba639bf00659cc71c10439f6683d5074ba5c92ae88b","observation_id":"f18b04bc-37db-458c-871d-823eb0e55f42","resolution":{"observed_at":"2026-08-07T05:19:21.181286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.147897Z","title":"Taylor, T","venue":null,"work_id":"d41f54c0-d45f-4ada-a01b-7707b996d14d","year":2017},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:16.023236Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:ef3ac95cbd567333af0824beb3c97a6f397aa755d5e5e6882321618800b2079d","observation_id":"19498493-67f5-497a-89d9-8576a6deba37","resolution":{"observed_at":"2026-08-07T05:19:21.158392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.123333Z","title":"Taylor, J","venue":null,"work_id":"73d393ca-7ed4-4358-81ce-e89844e563a6","year":2021},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:16.110000Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:9ca8545ad1e5e4c32344ce7971e5dbea012fe63320879aeb18786d601d76250d","observation_id":"2002fd45-fd3b-424b-b0c2-e73f5ad530ce","resolution":{"observed_at":"2026-08-07T05:19:21.132041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T05:19:16.189131Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:16.189131Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:26bb8db783f17646163fa364ceed4b88c7686bd704031bbb6be4f8eddee92478","observation_id":"1b1ff98b-866d-4329-a41b-168f2b5a4a53","resolution":{"observed_at":"2026-08-07T05:19:16.189131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:20.977929Z","title":null,"venue":null,"work_id":"4960158c-cd16-418d-af68-d92648db598f","year":2006},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:16.475208Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:3cbc5eb72771b6da3013303cae31b8e95f3f7fb381cc960b78741de5d9b4c8e7","observation_id":"e59562a4-4e66-4270-a486-b351355a116b","resolution":{"observed_at":"2026-08-07T05:19:21.041883Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.650110Z","title":"Tulyakov, M.-Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:16.650110Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:c63249d226764e1cbf479e92f7045b3fabac134bf9c89936b65d5b9438d7da2d","observation_id":"f658389b-816c-4a63-8661-39297cebc424","resolution":{"observed_at":"2026-08-07T05:19:16.650110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:20.622357Z","title":"V ondrick, H","venue":null,"work_id":"f8199c45-9076-46da-8c6d-9d9dea116fc6","year":2016},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:16.751757Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:c470a2b7483a51a651a3bfd5d3a0a59ec8c55794b8892f9e9745bf01c7de7ed2","observation_id":"65598d5a-bfd2-4a9e-b3da-104ccd832cad","resolution":{"observed_at":"2026-08-07T05:19:20.693485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.844609Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:16.844609Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:c17f0b1eff9fc3e2e2cd0aa5a03a98225ce1f0ee29c89d339da5d60cdba67c57","observation_id":"13359a1a-4381-4532-9db6-0d7d618520b7","resolution":{"observed_at":"2026-08-07T05:19:16.844609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23307","last_updated":"2025-03-30T04:22:09Z","snapshot_observed_at":"2026-08-17T18:53:50.853973Z","submitted_at":"2025-03-30T04:22:09Z","title":"MoCha: Towards Movie-Grade Talking Character Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23307","snapshot_observed_at":"2026-08-07T05:19:16.914776Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:16.914776Z"},"links":{"cited_paper":"/paper/2503.23307","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:ee41c88f5d3d83246b98a62bfc3d80042e4989f2e1d3e89c10b4af1a1dac5f62","observation_id":"ec5c9838-5c65-4c45-b545-a00c7f0754d3","resolution":{"observed_at":"2026-08-07T05:19:16.914776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:20.536427Z","title":null,"venue":null,"work_id":"89913c56-0d66-49ce-b7a0-b15dd860747b","year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:17.015173Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:e224a494597c619e526f8af0683ab9b2fb531387f14457b56db465400a8887ba","observation_id":"341851db-b649-44ee-be27-d6fc450cb898","resolution":{"observed_at":"2026-08-07T05:19:20.557638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:20.510308Z","title":null,"venue":null,"work_id":"a4514c32-c2a2-4703-a32d-c9248b33a6fc","year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:17.114137Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:f0a0d7975218a5152eb0b8eaa06ff9596d698bd4de854e2b114c28cceb4e5c35","observation_id":"943adf6d-32f4-42fc-9f42-8af433ab393e","resolution":{"observed_at":"2026-08-07T05:19:20.523179Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:20.379816Z","title":null,"venue":null,"work_id":"49f7fd3a-0072-49d7-9663-363b9ecf2c77","year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:17.209597Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:f92043e879b7f5303ff91d43d1597e8f8230a8c6c851febb56fbd29cf3028d29","observation_id":"ab85eb5f-5ffb-4e27-b581-832d9eb262c9","resolution":{"observed_at":"2026-08-07T05:19:20.470571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-07T05:19:17.315457Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:17.315457Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:148ce6d50a6b5b550825dd8c8c962f3507b7cf5091e3daed3dbea2ad15121b08","observation_id":"9bbfc163-4a27-4b6b-b23b-59f3f1d90b1c","resolution":{"observed_at":"2026-08-07T05:19:17.315457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03059","snapshot_observed_at":"2026-08-07T05:19:17.425943Z","title":"Yariv, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:17.425943Z"},"links":{"cited_paper":"/paper/2501.03059","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:7c19d87f129aae539ecf9cacdd55b35dcbb1da034ab8907cfe281f52b7db8029","observation_id":"988a81d2-fcf8-43f8-b760-b76e2c8df26f","resolution":{"observed_at":"2026-08-07T05:19:17.425943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05978","last_updated":"2025-03-07T23:21:11Z","snapshot_observed_at":"2026-08-16T12:52:01.999974Z","submitted_at":"2025-03-07T23:21:11Z","title":"MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05978","snapshot_observed_at":"2026-08-07T05:19:17.534455Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:17.534455Z"},"links":{"cited_paper":"/paper/2503.05978","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:66fee356df03f7b2e1b18fce2c37210508810ed4afc31da7601a16a968778527","observation_id":"d8eff338-c07e-4a39-b709-472974970474","resolution":{"observed_at":"2026-08-07T05:19:17.534455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:20.170867Z","title":"Yoon, W.-R","venue":null,"work_id":"721f097b-2bef-4e7b-a664-3d48fff36a34","year":2019},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:17.663294Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:cd9eea9fd8666dc7c6bd6fc4ac1bd30f3abcae4e496d286f4bd2c2cf67d6437c","observation_id":"90aa0465-b655-4193-94ef-758f0e5a73f6","resolution":{"observed_at":"2026-08-07T05:19:20.271425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-07T05:19:17.744633Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:17.744633Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:8f53b09e56a7b486e480f58873ff5a9c54e8fc763729fb1090bc34ddb34c75b4","observation_id":"3ac56d0d-5bd7-4717-b057-c78183e93111","resolution":{"observed_at":"2026-08-07T05:19:17.744633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:19.987401Z","title":"Zhang, L","venue":null,"work_id":"ec079e30-b6c2-4157-904e-fe87a430f33d","year":2022},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:17.838158Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:46a7c57bd0099367a4369093c04dc72853effe9654ce6840da0fe374bea45745","observation_id":"2df73381-35b4-462d-8d33-cb545a7f63c7","resolution":{"observed_at":"2026-08-07T05:19:20.056731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:19.749425Z","title":"Zhong, C","venue":null,"work_id":"5160eca7-93d9-4379-b281-39b79d13e90b","year":2023},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:17.911045Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:89a7fbd44e00157438bbf9dd8eafb0a99912408243d9f06b938497194452bfd2","observation_id":"7c85a925-8014-453f-8dfd-3c0d08153050","resolution":{"observed_at":"2026-08-07T05:19:19.840290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:19.551012Z","title":null,"venue":null,"work_id":"e88b5e27-7577-4ec0-9b29-c3578201551c","year":2020},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:18.020547Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:76eaac452dcd1397e138265b6ebac3f714d2afab9bf5e33f6da340a5e39c0a4c","observation_id":"85b93bfa-7774-4d1e-a07c-6a79c2664ac6","resolution":{"observed_at":"2026-08-07T05:19:19.631332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14781","last_updated":"2024-06-01T08:27:23Z","snapshot_observed_at":"2026-08-18T08:53:24.734837Z","submitted_at":"2024-03-21T18:52:58Z","title":"Champ: Controllable and Consistent Human Image Animation with 3D Parametric Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14781","snapshot_observed_at":"2026-08-07T05:19:18.112043Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:18.112043Z"},"links":{"cited_paper":"/paper/2403.14781","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:912ac7ca5f9aa70ad753d1689f207a7797911fddfab98aa1192fa13c1d2dd811","observation_id":"49cb1e50-5b24-496b-8607-b1213b6e4f08","resolution":{"observed_at":"2026-08-07T05:19:18.112043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:06.762428Z","title":"Cassell, H","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":1986,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.762428Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:c6b707c01fd7f4b3a15fcf92f2249afc160316ec9056e77cd4931e895623a8df","observation_id":"c014fa06-efe9-48a1-8a49-48a28c89dfea","resolution":{"observed_at":"2026-08-07T05:19:06.762428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.141232Z","title":null,"venue":null,"work_id":"0cf23679-d8d5-44e3-b342-9229016a3c30","year":2021},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:11.050309Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:35643e2ed3261f059c158d88c18ac6360b9f602470c256b752e8ccc54b2169f7","observation_id":"b5a19570-607d-4007-892e-c932d4f66244","resolution":{"observed_at":"2026-08-07T05:19:22.146163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:06.929145Z","title":"Castellano","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.929145Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:2b105c2702e6c06e65390c368c8eba6900d74543f33eec5969db88744418e3fc","observation_id":"c21b8877-5d3a-45d3-80f9-39ed452c281e","resolution":{"observed_at":"2026-08-07T05:19:06.929145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-08-18T10:30:20.725493Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-07T05:19:08.242965Z","title":"Cudeiro, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.242965Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:afd0b620bcd4ef21b241e0e317cdda8e6e572ad65195be422dcbabc32d2435e1","observation_id":"6ab8f872-6a90-4bdd-b6ee-a89e061ba897","resolution":{"observed_at":"2026-08-07T05:19:08.242965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.641427Z","title":"Prajwal, R","venue":null,"work_id":"ae4e26ba-5852-4cfd-ab72-923c7655dce3","year":2020},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:13.692972Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:d6b4db76765ed57fbc385ccbf5b3bec201626255175df3c0fb54f3474a95fa88","observation_id":"60088117-150c-4527-a622-d4317e75ceab","resolution":{"observed_at":"2026-08-07T05:19:21.648316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.988259Z","title":"Lahiri, V","venue":null,"work_id":"32dc5fb6-8ade-46c4-a8ba-3d51b9f4eeef","year":2021},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:11.930770Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:2f22570973326de709441b19a2b38143b747847bfde63569e3042f72213c60d2","observation_id":"3fdcc2c5-79e1-48b3-9d67-b5de9aedce56","resolution":{"observed_at":"2026-08-07T05:19:22.018170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T05:19:11.753007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:11.753007Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:eac75419d11b49bd542ad4727accd239377abbdd0075d5284b579cccbf096a7b","observation_id":"8ace822a-ef8c-4b31-acbd-c49d2ef41fdd","resolution":{"observed_at":"2026-08-07T05:19:11.753007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:20.785371Z","title":null,"venue":null,"work_id":"98cb631c-905c-45c2-8393-cbef93305099","year":2020},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:16.574492Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:cb4683ddeb9a09ad6abe28976578e05ed46f1d7f4edd1863561cf23704f5d693","observation_id":"7d8a01cb-fb2c-4832-9249-fdbbcaa086ac","resolution":{"observed_at":"2026-08-07T05:19:20.910102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.756063Z","title":null,"venue":null,"work_id":"9d062c4f-a5ae-4767-887d-e071a1481904","year":2015},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:13.124096Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:53b1de76d48ebea79522e4695df3ddab9ab7bee832a12a68f21ee9a0b2115d68","observation_id":"d3cdffe2-207c-49b7-a742-fd1fe7c42619","resolution":{"observed_at":"2026-08-07T05:19:21.764030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.070893Z","title":null,"venue":null,"work_id":"d2b708b3-b328-4110-912b-a810519ea307","year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:16.359928Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:32763cabc46ded2706e5013414fd69147991727c7c6c89db9de0c098e20f4010","observation_id":"d2cf3a36-aead-4c27-a2bf-52946f5781d5","resolution":{"observed_at":"2026-08-07T05:19:21.080355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.242041Z","title":"Grassal, M","venue":null,"work_id":"d68c382b-75b8-4be2-9895-126c46585a6a","year":2022},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.765730Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:8fbccfff608241e5d4207db519264594283f7d5d69364129a766896a97e8535a","observation_id":"501bbbf9-5dd0-4c41-a187-e269997d1302","resolution":{"observed_at":"2026-08-07T05:19:22.246793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:21.600259Z","title":"Rybkin, K","venue":null,"work_id":"73e3b44c-6999-44f2-bee5-e4b9d31ebb0d","year":2019},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:13.945432Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:7df0acaf0e7312cf6ae32dc2bd0f4a668b6334f546ef73cfc13566c2061bd43b","observation_id":"7bad90ad-aa90-44e5-9d96-960f6ac9734a","resolution":{"observed_at":"2026-08-07T05:19:21.607100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06571","last_updated":"2019-09-25T16:37:55Z","snapshot_observed_at":"2026-08-15T04:08:33.157509Z","submitted_at":"2019-07-15T16:27:04Z","title":"Adversarial Video Generation on Complex Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06571","snapshot_observed_at":"2026-08-07T05:19:07.819670Z","title":"Clark, J","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.819670Z"},"links":{"cited_paper":"/paper/1907.06571","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:0c95b72b7ddcdc45f68d9a0b9b1920a6896eea8cb6cc235b9f9ea0f9aa9a8d67","observation_id":"80ccea7b-fc8c-4e78-894c-970b023e7f81","resolution":{"observed_at":"2026-08-07T05:19:07.819670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:22.097398Z","title":null,"venue":null,"work_id":"cba2adb0-e2e7-4bbe-a3b9-4c3bd859a998","year":2005},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:11.656027Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:63c7f2d54601ba5cb7253a802dafad1e348cb0dbdce4b9887558a18491cd95db","observation_id":"980e2477-aa5a-4bb4-9e04-8a78458d0b49","resolution":{"observed_at":"2026-08-07T05:19:22.101764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:07.226167Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.226167Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:093849e46c144a7cc0fcd37eb9f84916aaee9a6746132b0e7f3d7f0571ed7592","observation_id":"7f0bd453-472a-49e6-b7f0-2a2e698ea93f","resolution":{"observed_at":"2026-08-07T05:19:07.226167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:06.593651Z","title":null,"venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.593651Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:bc7235e279659ddae5460e7683ea74c7022e13d262d7b0c25163f552a45ac6b8","observation_id":"d5425e6a-0e89-4e6f-b0ce-489a688bc994","resolution":{"observed_at":"2026-08-07T05:19:06.593651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-08-16T13:53:11.380164Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-07T05:19:08.778129Z","title":"Fang and S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.778129Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:68f4d711571ce341bc0a833a513db0dd4192656d35d489fad7013458371fe48d","observation_id":"cd9d87ce-c8b4-4b73-ba5f-23a2495d644b","resolution":{"observed_at":"2026-08-07T05:19:08.778129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:06.322687Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.322687Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:822570d30ada7b6642143a55946e207b6a0d7093241e1f69de9028da0e5291f8","observation_id":"bbc20ff4-58db-4328-aea5-b896e60d1354","resolution":{"observed_at":"2026-08-07T05:19:06.322687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:07.397094Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.397094Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:b9df7b00df0c098139b90fdc0f3af9e0bbdbcf4654cd8f1abd1746783a0c6c76","observation_id":"b28a19ff-1414-45b6-922e-fb1ea600bf0e","resolution":{"observed_at":"2026-08-07T05:19:07.397094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09760","last_updated":"2018-03-26T18:00:07Z","snapshot_observed_at":"2026-08-17T08:34:43.542365Z","submitted_at":"2018-03-26T18:00:07Z","title":"Predicting the Future with Transformational States","version":1},"cited_work":{"arxiv_id":"1803.09760","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.09760","snapshot_observed_at":"2026-08-07T05:19:18.897092Z","title":"Predicting the Future with Transformational States","venue":"cs.CV","work_id":"dd87dbf8-9372-43ef-a043-23e15670497f","year":2018},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:11.274307Z"},"links":{"cited_paper":"/paper/1803.09760","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:a2cc0ff99f08e550670ae4d2e6472a296e084434ec5211033219bce3cad15183","observation_id":"e5d41eab-78dd-44b2-8245-753e708ec722","resolution":{"observed_at":"2026-08-07T05:19:18.988773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:07.071477Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.071477Z"},"links":{"citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:6ef187350b0b7b5334d41fcfb80149cbcde43a0b9494dc2020857fc2666ddfd8","observation_id":"085815bb-ea49-4869-94b8-3c36e73fe6c9","resolution":{"observed_at":"2026-08-07T05:19:07.071477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T01:09:51.854911Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 0 inbound Pith citation observations for arXiv:2506.08279."}