{"as_of":"2026-07-24T22:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a94613e86435f785e95a633644d08e65fb0c97881bffb2fd3f8aa92f5cf7b56","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T06:59:35.258176Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-24T06:31:00.690269+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02799/citation-record","integrity":"/paper/2607.02799/integrity","json":"/paper/2607.02799/citation-record.json","paper":"/paper/2607.02799"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:0d7c26322118d2d5709d0c2a34f1e1d6342c3be12ded26a0a60a9aa82fb48354","observation_id":"16231457-b9c2-4edd-b904-4b1aed054137","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:4a400ad246c7c4d4f221903ab1aac1ec01fb154ba9b3c4fb71313a89d0b25a60","observation_id":"29c164ec-6152-4ef6-b0ec-ac56669ac259","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: 2024 IEEE Conference Virtual Reality and 3D User Interfaces (VR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:0b6fef23082a48ff89c796db086582252509ea92ec2e05ad6b31e7ecf1f6b1c4","observation_id":"5debd6bc-45d1-4133-be40-861b3a56d09b","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-07-06T18:27:07.473039Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2406.04904 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:80e537f1e33839cba4ed86d2c78aa4925b629c5679505dc9d1e14f08107fccb9","observation_id":"469e6569-08bc-43f5-ba0c-b09e242ddf96","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Pro- ceedings of the IEEE/CVF International Conference on Computer Vision (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:a1ebca49f96df13ceaf301605887eacf7cfe18742b11afc4f4c48c731b157aec","observation_id":"a7f7f58f-2276-4993-a45a-fe34458d55a7","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Image and Vision Computing p","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:31800be28a279130dbeede527c9750ddbe7c5e355eba0a854fd0ddead15a78a8","observation_id":"fc640013-45d0-4fca-bdbc-f3c8a9f11b3f","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: 2020 twelfth international conference on quality of multimedia experience (QoMEX)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:345f652daf583c0ed94166b1809b05f47e918502ab7c578825b9b848301c7bd0","observation_id":"9dfefea7-030c-4933-9c7f-f671bfe6718f","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:5aab238420c6f5f3f65137892dbda5ad3e73f5a38ef4f93aa0e36a9e830ee8e4","observation_id":"2b418585-7b48-4fe3-b487-ea1318105f20","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the SIGGRAPH Asia 2025 Conference Papers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:b73eb03c57982e400f41493bfb8f0cb113df16c980de07b13b5ce5ee0365e613","observation_id":"c1657afe-ac24-47c7-adab-cbe1f0605ad4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:d58dffbeb205ccb9b19d39e37c363418ad3d27619caade0481aeeeef917adc63","observation_id":"3f2554ed-d8a0-466d-b23a-381973ee498d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:6cf70e563d92572e3b72a7469ebad24cc8a5f03e45c5267656323784ef5610b0","observation_id":"c930a273-6912-4c87-8546-06952f4f07f6","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:53f1381d1bdecd00e3fa41a7c7362d1213322563b4a99446af7d4014067da297","observation_id":"c2fe8359-3656-4955-b889-c8b296cf79da","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Nature Eye39(2), 215–216 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:e86aa3db47de96efb2ceec401876f547529b34e61ab2416f41a0e634eec87da9","observation_id":"5cd87e4a-f0a7-454f-89cb-aa1c0354218b","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2407.21783 (2024) Conversational Human Audio-visual Talking Dialogue Generation 17","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:1d3670437e2cb205dcd1b6e7e3cc66add1d1eb62aa4ba8629b349cefb5f76485","observation_id":"301cca55-37dc-43b5-8fb5-271bf9b856e4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceed- ings of the 63rd Annual Meeting of the Association for Computational Linguistics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:5f50fcacb21ff6521c3999490e247eca2034b2d717f2890bd2c7162dfb301a12","observation_id":"a0fabf44-0b21-48bc-9eac-910af9b4a693","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2507.06261 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:43b4a54c72181f119e97a2ac25dc4ebd427508d087658d3e325d022f706634e1","observation_id":"6c1ee824-e5e9-4088-b3d1-2191d4c8a2e0","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:7135b0cd6f52b441007889af810085286ad2325b008ca20ac5e10da42a2b32c7","observation_id":"e465180d-23bd-43cc-8b24-ac00f20a25f4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Nature645(8081), 633–638 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:b2b68ab4604ba6ce2f5dad0b75948f1e90fa87ca7d9464745b1b86223e98a177","observation_id":"ad94245c-ba64-4d58-8a6c-5cb0932d121b","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: European Conference on Com- puter Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:2a13ea3a7a49cc802e4914714687c42885cbed6e27532bfc15f987c1d9271083","observation_id":"3abec7bc-cbd9-4dd9-a6ba-f9d4cfe8db44","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"International Conference on Learning Representations (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:9a988e9624de61eff421a25cac02c4358f6d39f9ac3a6cdc5c4bfb75617bc0e5","observation_id":"429fef16-52a0-4093-9df4-a5669481f262","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:3494a70975bd130e9df4a4b080cce4d6b310349a178099831ba6ae937092b901","observation_id":"eeb403fa-eefe-42e8-96b6-b38bbe6d108d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2208.01626 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:86cb331599037429cfbacd65c8efc4de6727d904ca9c87860ac2e325861f43fc","observation_id":"c091924a-8d13-459f-9c99-07c4419519d0","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Ad- vances in Neural Information Processing Systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:2ef257cd675f410e776c66e843587fc118a8dbef988ca1a2b66b7ed4503d43dd","observation_id":"3e802df3-334b-4288-bc80-586de0bcca99","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 33rd ACM Interna- tional Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:ad1d8f650515f84043651f0a3d01768ab993e514e42c263f351b0a7e3f919c21","observation_id":"7779227b-8250-4dc7-a3a4-64047774830e","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2506.17298 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:12f8e1506db85d8a332207ebf3912ecfe2db2eeaaede004284201e14fe67723b","observation_id":"be5ce976-1c56-44c3-9604-c43441071750","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:97a65baa6082f2f806381aa7adbcf6249fb07394651602f24e851f7ceee96c50","observation_id":"c59a32e7-7a47-4de1-9318-3a6c93eab075","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2512.20296 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:698a7f2b335f0775afaa536a810cf3d03e1a7f17343ed54b5b77edc2daa35aef","observation_id":"e570bf38-84fb-464e-be63-76a1ee5b5d18","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:c98f709289b822d088c7538b0e40c8c35353c287d4c40d1881721c7fde3ac814","observation_id":"7a707019-3222-4338-8485-3bb3c1524174","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Song et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:19845075133eb3fa10ca5da365a1df56767ea597b022f3572afa5a09fe464822","observation_id":"03287d08-d986-4b1f-854b-1a90e352b0e8","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19978","last_updated":"2025-05-26T13:37:10Z","snapshot_observed_at":"2026-07-06T21:30:37.657153Z","submitted_at":"2025-05-26T13:37:10Z","title":"DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19978","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2505.19978 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2505.19978","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:1dba142c113aa424985816f6199b35d27a2bcb8a6450793b2cca846f3a949eba","observation_id":"4c03c341-584d-49d8-96e2-1f86307a08dc","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies8(2), 1–36 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:b222cd370814a0e259ea6a7314eff823bf5ef9e1ed4d6ab8244ab33e9849505b","observation_id":"cd3fe4f5-3f6e-43e5-b142-49030ccc0451","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of IEEE pacific rim conference on communications comput- ers and signal processing","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:294c147f22e3dcffd20aa31ccd9aafb18f64fa1a9224a34996567daaa9507e82","observation_id":"b88fd506-9c9b-4134-87af-ad780be052da","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23552","last_updated":"2026-05-15T04:47:28Z","snapshot_observed_at":"2026-07-06T21:49:33.849898Z","submitted_at":"2025-06-30T06:51:40Z","title":"JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23552","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2506.23552 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2506.23552","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:d3958120e0c847f04ea5c9125c8b5f110092899f11a1644c0285932c4c44ff95","observation_id":"edb16883-9a58-4305-a172-7b37268a11d4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-07-06T20:05:55.982214Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2412.09262 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:e82463dce35b8ae58ccfe3793c596f9b564a1dbed541f64f4222eddaed87a0a8","observation_id":"a55db7b3-04b5-4057-a81b-560e4ef632c3","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Advances in Neural Information Processing Systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:2d613c16c623bebb0b8ca0cf5b8c44ae6b9e57b048c1f3a063edbf0f60eef61f","observation_id":"87973081-0baa-4911-961b-76c824bf4102","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Artificial Intelligence308, 103714 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:e3a49b68ef4a5a10eccb89554f97c0314329488ee9ec58fba7f806653b488fa0","observation_id":"a4306348-1389-4a61-b369-4f3e3c3274c8","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: 2024 IEEE 18th International Conference on Automatic Face and Gesture Recog- nition (FG)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:7ec96d4bc619c4c20d5de7eaa0ce3a06ced84e3075c7b24727819f56ea6858c7","observation_id":"e8e8c560-45ef-46df-a7dc-0e1001ccd65c","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2502.04328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:256ce9b9dc004fae6ff02575abdae8b5daea98ed0fe99eb04e921b1e6c8e684c","observation_id":"367c2df0-13f8-499a-b7d2-0f7a77a9917a","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"IEEE Transactions on Visualization and Computer Graphics (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:8485c81256bf1958f3f565c24b333dcafcb704ffea6ddc4aa83c9367ecb9d3e5","observation_id":"22755e79-115e-414f-87be-571aa0a7e6a4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 33rd ACM Interna- tional Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:1ff69ef7cc7c5632bd6c03f2f14247d8e2b8615c116a15a2e9074c945b20e394","observation_id":"9edea1c7-818c-472a-b600-73b0f09452ee","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01900","last_updated":"2024-06-07T02:57:36Z","snapshot_observed_at":"2026-07-06T18:24:52.604412Z","submitted_at":"2024-06-04T02:05:57Z","title":"Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01900","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2406.01900 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2406.01900","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:693a6c20c5ddf67dfa4a12d9bfe4d63f74197c64928345e02d7117aba81e03c0","observation_id":"a5c68731-bcdb-4a43-9d72-00d6cc501fa4","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:9c1acda6ff4aae08e8494064df242bf06e0c6ef1b404f9e6ccd213399d5cfe14","observation_id":"839f2359-8d28-441d-a7ed-55bec0a699f2","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:0e78d04d6541f114e4389fc478a020408b3e5a40afc00a8a16880a08b0d23ac6","observation_id":"72749509-e10d-4090-9f81-d1867f3c5e0b","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: 2024 IEEE 18th International Conference on Automatic Face and Gesture Recognition (FG)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:3c9a1f839ed136b99f4b75a6fd7efb302d34f8167145df300c64756061dd97ea","observation_id":"6f305d61-f7aa-41d1-91c4-75be7ed9329f","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceed- ings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:6384dc29746808be5b9ed2c710bca6022f86c050de51d009b32341fbd674e300","observation_id":"ebe74958-f498-4595-ba5b-da33a3d5d276","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:4e015e651273274d0dc363af759e44d34a09fb5ebe6909ad5b13f5f949f0e093","observation_id":"935abe57-e289-4b00-9ea4-06ad18a28d89","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: European Con- ference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:532821109698f66184a57fb8d67fff951142c3746f0d4ce2aeff7c8d3f7fd8bb","observation_id":"1763cd38-7e5a-473a-8421-edf50e53fc42","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:f04ddde5ecaf5baa9403b2d8012bc18476259ab323556b48c90391d8490a9d0e","observation_id":"d38e47b7-68d5-49c2-85b9-c038e3121311","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 28th ACM international conference on multimedia","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:91a6ee4d530b09caf9d7bdb6aeccba05a22fc3ed8ee21725df15caace80aa054","observation_id":"7da31929-0993-4755-aff7-1c2d7fdfc869","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21144","last_updated":"2025-03-27T04:18:53Z","snapshot_observed_at":"2026-07-06T20:59:27.162712Z","submitted_at":"2025-03-27T04:18:53Z","title":"ChatAnyone: Stylized Real-time Portrait Video Generation with Hierarchical Motion Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21144","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2503.21144 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2503.21144","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:59794fae72fd217e25ab0c0af259fd949e1c26ae2c93ee86df8f494c80fa70b4","observation_id":"d09e33ef-922d-4587-af53-1289a0c9e8fc","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2505.09388 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:a2f5d8d7c00d3761cd2220634b4a8b7c565a59bf4e8d5eddf26a5cb268aaf4ca","observation_id":"996f768c-7235-46f8-bb64-4e448b3eac3d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-07-06T11:17:18.147074Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2106.04624 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:b1e5ce17bafac9e061ac4ab8aeec7353697903c65bfaaf2d813dea9566ca8f13","observation_id":"f1a3da29-8750-4303-98f5-833a79ab54ee","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:344eb2fbd6a3fb39c175b2ba22730ac1a9bd0d9f46dc27a55d7e0eed8128e1ce","observation_id":"46d1033b-ef3e-4185-87c2-5c896a3c70cf","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (Oc- tober 2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:fd9a4d0e60ed896ed495c80fc0e418432bd428055006f22cf171ac41143fbd36","observation_id":"9fdc273b-e58a-45d3-b932-1b5e34f278e1","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"IEEE Transactions on Affective Computing14(4), 3048–3065 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:aeb0f1fe6f2da3691d82cd578779740e32fc7046091c8b2f775a5096f5426fda","observation_id":"9a3e8360-1d76-477b-b4a5-598e1fcfea0d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"ACM Multimedia 2025 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:bf97d8e3af6b177c8037475c7fb038f789b3765a8eefe55cf084a0365f855762","observation_id":"7664d177-6ab0-404d-8575-cf0278b9b708","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 31st ACM International Conference on Multimedia","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:8e9be8d6e474f4448ff3c67669f1a9cc3d23fec5762a543e40077a72b65d9f5c","observation_id":"900e048a-05bd-425b-ae8b-be00b0d047b0","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: 2024 IEEE 18th International Conference on Automatic Face and Gesture Recognition (FG)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:fc7783191d95106997a621f231869a7571ceb750956656e9acb797331b90ae11","observation_id":"466a5fd1-4d97-4337-963c-de8c039a8a47","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"IEEE Transactions on Visualization and Computer Graphics (2024) 20 J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:1577735bf2b0d7cc5736419a810def2f6ae3df34b7b968767b53fc8448114e35","observation_id":"0a2642a2-8fd2-4734-921b-8719fd409f4b","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:b61e1fcbc90da40335d2177fa2fc708a5999d40fdbdcfda79b93735a13bb80c3","observation_id":"f759af64-f4f5-41a5-b1d8-bbac14338408","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:849d96d34c86caede2fe9ba690c7a65b68bae8a071b73eb4983b1f244983e5c5","observation_id":"d8bf0cd6-b995-46dc-8403-2ecebb77b7df","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:1812.01717 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:998108f08a5c1f77d2583bc7378d7e1c073b0b3b2f9d6b1eaced748738fec692","observation_id":"347ad915-a80a-4f29-88ab-67fa58ceb9bd","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02490","last_updated":"2024-03-26T03:41:26Z","snapshot_observed_at":"2026-07-06T14:58:44.419522Z","submitted_at":"2023-03-04T20:08:57Z","title":"Diffusion Models Generate Images Like Painters: an Analytical Theory of Outline First, Details Later","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02490","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2303.02490 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2303.02490","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:30a06f2fedae91870f08ae5e7981afa5ea67415b89aa93b2929a0b7323bbcece","observation_id":"b2da9b1c-cee5-4825-8063-ad06e0a83be1","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:38c03ab7fabcce5540da16b7ca9742684e95a926adcbbccf26b3ce9c5e8407d2","observation_id":"477671db-9fbb-4bc1-b8e1-0fa8d8db0177","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03017","last_updated":"2025-01-26T01:52:22Z","snapshot_observed_at":"2026-07-06T19:27:25.061335Z","submitted_at":"2024-10-03T21:58:39Z","title":"Tutor CoPilot: A Human-AI Approach for Scaling Real-Time Expertise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03017","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2410.03017 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2410.03017","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:639556dd3ab0f4b56bcfc8764501e488b7a831bb33e58f83079f9a102475515d","observation_id":"7f87a648-6256-4115-8cf7-89675874cb52","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Advances in Neural Information Processing Systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:c3d99dde44da8529725ef407b7fd6497859907c132ce385e4a6fc98b48b40fd0","observation_id":"e1ecd6ee-19bb-44e7-b3f3-c2b5ff528ea1","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:d332282d1ce632548554f6fec656a4463e3f133ee34d194b28fa5ead24ee0bc3","observation_id":"b5b1bab0-e2a0-4b0f-8fb5-20cf7b73186a","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2404.10667 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:a8a023bb5526b23246748eba5f180c0cd6a8510fab58874e449df3b2e70b2cc7","observation_id":"34c30995-038f-4a29-9c72-3de725794378","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"IEEE Transactions on Affective Computing (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:0588989bcb1200701e9dfe0b04822994a370336ed72b29e3a95b997d0e1b4124","observation_id":"b94a50aa-7b85-4af3-8c77-a02b229cbf99","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"Visual Intelligence2(1), 24 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:f547c8c52da969fe81db4f8424c859ec07bad57fd24d403489be715618021c99","observation_id":"14e72780-1807-42e0-baa0-cf49d2c3546d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2406.12793 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:cdcf7c932feed5da251549dde7df5b3aef6ec368a158950d277225e0e2d5dc71","observation_id":"e38f7226-db7d-4521-aea7-b9656f02248d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:a3ddc1618bf037adacfe68ca4386ee2856ad1fdf73eb301b9fc64cbd8313e9c3","observation_id":"f0ba440f-6fb5-415a-8602-68c282edcd80","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: International Conference on Learning Representations (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:24ab4a6deebaa578e51c3eb8d42b3821330926a49341061f751d9783ee767cc5","observation_id":"cf0597de-9447-4aef-8c2e-5e8271cc473d","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:2d67dcf3341dd45c214ad234107accca6c5ee40a84242fbcf582a807ff16f502","observation_id":"36e5e9a7-c810-4786-96eb-2c3d4fba3e8f","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:82eb082208f574d2669752f3dccfc5181b6b664e0dbbdfa07ecd7409d0e8c386","observation_id":"00dc2844-9437-41b9-808f-b8aaac57df9a","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:f6af02a54475b290c3d7958d30b4987bffe26d9b374e419a36de4ba2efbcadf8","observation_id":"a9c5af27-da19-4da2-9cfb-96b0ad46aa31","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the 32nd ACM International Conference on Multimedia (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:bfdef2699a252d614db567b6177168f0d2b67ee352a97b6bab7f2010642c5f8e","observation_id":"e9a61f71-f202-4fdf-9de3-3e8d278c5902","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:d99c005b7186c5e1c10ad6f12c3e7f6041f064e7f8bef8811ab862cfac444e89","observation_id":"0ec7758c-fb42-4344-a5c3-5d62a71b1344","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-12T06:59:34.657102Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":78,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"thesis":"As of 24 July 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2607.02799."}