{"as_of":"2026-07-21T21:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7d99c1297213d3b6983e2fce076d1a448f8be4cd9394a7643cbbb87f5120c52","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T07:00:53.496569Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:09:44.572116Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2602.09534","last_updated":"2026-05-10T13:50:44Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T08:45:51Z","title":"AUHead: Realistic Emotional Talking Head Generation via Action Units Control","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T05:49:15.734418Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2602.09534"},"observation_digest":"sha256:38a4c8169fffa9573b55b2943388f095bc85fa463e37663fc7fc555f28bfec03","observation_id":"e141d963-46eb-4e0b-9dd4-a4da10d6e3bc","resolution":{"observed_at":"2026-05-16T05:50:40.255880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:7d7253f6cd320eda05c72b8866d7b27b63a34267385978dc48c32a7e550b404b","observation_id":"8a522e79-6f7f-40c3-9027-d8ac000648e5","resolution":{"observed_at":"2026-05-11T11:06:05.818834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2604.14580","last_updated":"2026-05-05T22:56:58Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T03:19:29Z","title":"TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T11:13:27.689539Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2604.14580"},"observation_digest":"sha256:15af0bcc981ba33465c03734025838d7fa064ce6b17c5a4948831e68baa0655c","observation_id":"f203a03a-a1d4-41f3-8e1a-4be122b0e434","resolution":{"observed_at":"2026-05-10T11:15:10.341482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:c5a36b9b1aad9b80ee8d5034856145065c23d91eba6688c3aff10ef08418e2f5","observation_id":"e91fb8d3-1b09-4292-9d6b-8aa21c96918c","resolution":{"observed_at":"2026-05-13T02:32:06.441607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2605.25488","last_updated":"2026-05-25T06:45:29Z","snapshot_observed_at":"2026-07-06T23:35:26.687529Z","submitted_at":"2026-05-25T06:45:29Z","title":"Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T22:36:53.138354Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2605.25488"},"observation_digest":"sha256:f81c40006d399c197fa16b2ec99a432e139f8576b947a719d5d32591e13842ec","observation_id":"4465b051-f896-42db-a793-18df0d46d9ca","resolution":{"observed_at":"2026-06-29T22:44:01.724087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-07-06T23:57:42.632111Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T09:09:06.925645Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:4e9b8e72d771317db5580a504533fe343412b8dffd9b13ece837bfc29d3ec36a","observation_id":"4373d6ea-fa3d-45f8-8968-bf36cdb2981b","resolution":{"observed_at":"2026-07-04T10:09:44.573639Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-07-06T23:57:42.632111Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T07:00:53.496569Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:1f54d2e57c2cb03a495d50b6ded2032a535c7d93a07d5553be3534f0095e21bc","observation_id":"5b418ee3-d410-4682-877f-e5aac23dcbe5","resolution":{"observed_at":"2026-07-01T07:05:29.129385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2606.31088","last_updated":"2026-06-30T03:27:23Z","snapshot_observed_at":"2026-07-07T00:04:48.748126Z","submitted_at":"2026-06-30T03:27:23Z","title":"Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T06:26:20.283349Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2606.31088"},"observation_digest":"sha256:3a95cf09dc3bd88847b863739303a67e96868d6d95cc9e22b4d83bfe0ed37b60","observation_id":"46353343-5273-4f76-8a0e-0cb7f3a567fe","resolution":{"observed_at":"2026-07-01T09:35:40.311712Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22647/citation-record","integrity":"/paper/2505.22647/integrity","json":"/paper/2505.22647/citation-record.json","paper":"/paper/2505.22647"},"outbound":[],"paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 21 July 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2505.22647."}