{"as_of":"2026-08-09T03:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f436f42011dc4bb99e4301ce90f5e0ed2cd091bb743af1add239acb9494ebaa","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:07:15.011660Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:16:26.572604Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":"2403.08764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-07-02T02:16:26.572604Z","title":"Vlogger: Multimodal diffusion for embodied avatar synthesis","venue":null,"work_id":"f75aa125-10a2-4437-812d-c6f81b1c69ca","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-08-07T12:05:21.397143Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:1bb347084f0d93e312cf9546008dbba1c80671311ab63a73a13558ebc6c002f7","observation_id":"477d88a1-bf97-4697-8fbd-6fd9f95d32fd","resolution":{"observed_at":"2026-05-23T17:03:12.574515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-08-07T05:07:15.011660Z","title":"Corona, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08797","last_updated":"2026-07-24T09:02:20Z","snapshot_observed_at":"2026-08-07T04:59:22.282816Z","submitted_at":"2025-06-10T13:45:00Z","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:07:15.011660Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2506.08797"},"observation_digest":"sha256:3489afde41d1eea4000652d04dbc7caf8deb5449ef92af7be69f8f86f6444137","observation_id":"b1686fa9-01dc-4ba4-91c5-e233b32bcb2f","resolution":{"observed_at":"2026-08-07T05:07:15.011660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-08-06T22:15:06.874990Z","title":"Vlogger: Multimodal diffusion for embodied avatar synthe- sis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:06.874990Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:cab7cc7f032372da130394155e603c98cd7812fb2d13cc2b293a0bf60fbbd314","observation_id":"2a41ba8e-4dd0-466a-969b-6a826e4cb14e","resolution":{"observed_at":"2026-08-06T22:15:06.874990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-08-06T19:00:03.193055Z","title":"Corona, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-07T20:49:57.189648Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.193055Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:b148f5fae674bc1c0266d4777796a286761be670e2b1933e4733a33ce709e522","observation_id":"55ba466d-8195-47bc-870d-cab19cd2a9c5","resolution":{"observed_at":"2026-08-06T19:00:03.193055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-08-05T10:36:52.868747Z","title":"Vlogger: Multimodal diffusion for embodied avatar synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.868747Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:83280352ad1c65882209f3b65ba5f1f02337b4432eb6a5853b247b45673fe803","observation_id":"75aff3a9-89ae-4ee7-82fe-024be2d77f6e","resolution":{"observed_at":"2026-08-05T10:36:52.868747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":"2403.08764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-07-02T02:16:26.572604Z","title":"Vlogger: Multimodal diffusion for embodied avatar synthesis","venue":null,"work_id":"f75aa125-10a2-4437-812d-c6f81b1c69ca","year":2024},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:35adfa43f3b243069b076de53742730b1b274525e9e15b6fa50d42c6e8c91528","observation_id":"87fa9fe3-c486-4f36-99f3-de57c8131ef1","resolution":{"observed_at":"2026-07-02T02:16:26.574247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-08-01T05:27:16.036956Z","title":"Vlogger: Multimodal diffusion for embodied avatar synthe- sis.arXiv preprint arXiv:2403.08764, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22241","last_updated":"2026-07-30T03:34:42Z","snapshot_observed_at":"2026-08-06T04:16:05.161328Z","submitted_at":"2026-07-24T12:17:57Z","title":"AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T05:27:16.036956Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2607.22241"},"observation_digest":"sha256:4ed9e48404e8c7bd1ca1c59e0e1469545490f83eb67e25a52fb745f5e6154f35","observation_id":"05028948-7764-44fc-8935-07aa5a4baf34","resolution":{"observed_at":"2026-08-01T05:27:16.036956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.08764/citation-record","integrity":"/paper/2403.08764/integrity","json":"/paper/2403.08764/citation-record.json","paper":"/paper/2403.08764"},"outbound":[],"paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2403.08764."}