{"as_of":"2026-08-11T09:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd3520687692d22970aa17ee3393293f16a7fe8059fd57b4ad4485cafda350f5","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T13:40:21.868428Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.02941/citation-record","integrity":"/paper/2604.02941/integrity","json":"/paper/2604.02941/citation-record.json","paper":"/paper/2604.02941"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Deep speech 2: End- to-end speech recognition in english and mandarin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:790dbdd80012a1af323ff3c320dec58b891a7909eb1763fec663d0d64b32e7eb","observation_id":"955f449a-a4ab-47fd-8c0c-725c6ac113e1","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Uncertainty-Aware Weakly Supervised Action De- tection from Untrimmed Videos","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:2670ea87d6041a61ebd2208926bd6cd26dac3e5207ad0424e0629efe43eb9186","observation_id":"a5039727-dee9-4396-96f8-a3f265e42d16","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:d8923f55dc99f5ce48bdd45d2e36f8001e67bc521d3ff6ef3208e7a0cb2e3f50","observation_id":"2e01c389-bd6f-4579-aef5-0093b4edeb58","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"SCM: Spatial Continuity Modeling for Weakly Supervised Object Localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:adf6ba5606ea13cff335cfc5e87eff979700f01bb9c6bef2711e46ebf0151fab","observation_id":"542add47-c248-483b-8dcd-0798dae528b8","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:f3fd01988a8dcaf5b313ddc3b7474955ca148b7f70138bf2eb3cd4b8d6fd8716","observation_id":"a671660b-9c74-483c-9303-104917d93623","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:76a71822d6df7cea168a666510a4da5f0075eedc4de756a2e128d184a39a6742","observation_id":"159b2e5a-75d1-4a28-afd1-7ad38f70741e","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"A flexible model for training action local- ization with varying levels of supervision","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:626d6a205151138c56024cce03190fc3817c28fa4ca16e02201c8300e8e5740f","observation_id":"bd4c7419-7755-4b66-9514-5b9d2eeae97e","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Evaluating weakly supervised object localization methods right","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:1d395315b34debe540df1cc7f19d05d0e67db3312a8ca976cb75b18eaec940af","observation_id":"6e81054d-ea57-41b4-9b22-fb78f65c1543","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:efd99dd9381df1587d348124ab3b58e9f013215e35db0b6eff1fd19d71a86a2c","observation_id":"d8d60310-b36a-4b8b-b08c-d2c1e2035e82","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Gonzalez, and Trevor Darrell","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:c6faf9aeb026a7c1e507123f0689879b1dd6226119d13c9b7a05379e89661c2d","observation_id":"c0861cf4-fe86-4490-a1ac-e8aab2d95a36","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Scaling laws of synthetic images for model training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:dc48d4eb884002f4bbf84f345e0c7b6050d6e82af921d6f2418b8b6d1787db0c","observation_id":"5ad1b318-e4f1-4005-909a-8f131ebdbea5","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Attention branch network: Learning of attention mechanism for visual explanation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:a22eb4d0aaba94f902bb23698c0e33f6c9de131668ab9fa8a4a3f1f930389891","observation_id":"ed9ec79a-95ea-43e6-b80a-5d47c6ec379b","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"TS-CAM: To- ken Semantic Coupled Attention Map for Weakly Supervised Object Localization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:0ca21e8242130421790586504f21b35baca992b0de2636264babcf7ded37b3b1","observation_id":"f70fb42f-15b7-4a8a-b19b-1554a91a45f5","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Wichmann","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:5e5ba3f016792423e8cfe9e1ce1cfa2c64385d468badb65de6679a85a61ad7a6","observation_id":"f8e0ffe8-6c8a-474c-a53e-80e0175679d2","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Unified Keypoint-Based Action Recognition Framework via Struc- tured Keypoint Pooling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:725de612e888502746d72fe672141915514d837ddda1f21236b79391b6266afd","observation_id":"95e694c1-68d2-4659-b267-b19247193194","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:3779b28b5e38392d583634a5df66ebcd65e6e4b89cbfc46797d4257020675c7a","observation_id":"2fb9318d-44e4-49ba-aa79-fe378ad54d02","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"On the Unreasonable Effectiveness of Last- Layer Retraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:f6a007e96ffb9ddb8f8cdd89abd2dcc606c39576c20030501f9a9a5e9e14c5ba","observation_id":"e8e752a5-ebbe-4f15-baee-6108714c4c63","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Mitigating Simplicity Bias in Neural Net- works: A Feature Sieve Modification, Regularization, and Self-Supervised Augmentation Approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:f1a222d1b1ba2267a63efb5d3af417b4f74e67d1302753eadc31b0e357efedb2","observation_id":"1d362c31-c3b3-43d4-bb75-78c30b6298af","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Puz- zle mix: Exploiting saliency and local statistics for optimal mixup","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:9148becaf8ff9371bfe7077ac2136489a9577884763884531366052103c0955a","observation_id":"a27dcd5c-169a-477b-9759-07345b3552c5","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Wilds: A benchmark of in-the-wild distribution shifts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:74fbbc18354984c883307b4b166316ef0812b5e9743ea04703771e7f29313eab","observation_id":"694beee3-7df1-456e-b921-ba2879d6c81e","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:7b4fef249f236d954135ddc9333b19d9231b5ca82c2ece90fa1a28853a3c4308","observation_id":"c8a3ae1a-eb1d-4416-8438-dd39cfcbfacf","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"A threshold selection method from gray- level histograms.IEEE Transactions on Systems, Man, and Cybernetics, 9(1):62–66, 1979","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:7f80f76e77219bc97dfca8b7d4d528907c21c62582a4206ffb48b0b0f8c78d21","observation_id":"315904c5-5989-44fb-bf93-11b5e65c4376","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.11101","last_updated":"2020-12-21T03:43:13Z","snapshot_observed_at":"2026-07-06T10:26:22.536691Z","submitted_at":"2020-12-21T03:43:13Z","title":"ResizeMix: Mixing Data with Preserved Object Information and True Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.11101","snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"ResizeMix: Mixing Data with Preserved Object Information and True Labels","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"cited_paper":"/paper/2012.11101","citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:137469da5e33e4af0865c0495be02d48fb71401f3b6984404c8e931189edbe06","observation_id":"28cfd5a3-9b78-45ca-8c36-460b28f9593e","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"You Only Look Once: Unified, Real-Time Object Detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:7b42b20e400fe9f769cda470d5e1221a9b6dc456d269ad3b14b9ec7219668d1d","observation_id":"27f8395a-ba30-4e6e-8581-10e96286a9e7","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:0355c35543d0aba8cb43fff25c7b79cacbceba58d7a0c304df3caf16b018a6bd","observation_id":"28c7b39c-04b8-46c3-845b-cb479b3a146d","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Why Should I Trust You?","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:22514832b2fbfd9f031f5aed0538dba803cd0705afca98b8872a2c9473f94d24","observation_id":"583d00d8-bf38-4483-ac7d-e99cf51fcf88","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Richter, Vibhav Vineet, Stefan Roth, and Vladlen Koltun","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:d420d089808f1fe45b758d8d4e6c98faa3883f4a410b6771c89b57c2d5db44e6","observation_id":"eddffb0f-c213-4a8e-bfd5-ffd8eb135976","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:7eabb3246b51aaf2394488af35383bd4371b6a095cffba036a0bec3a1ea184d0","observation_id":"185b8d5d-bfbb-4f51-b00e-f75be0c89dae","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Hughes, and Finale Doshi- Velez","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:85a40ffc373963f6077cdbc8dfa5b9475359a1d579b7b6e780c75d516875d4ff","observation_id":"25e6075b-5b74-49a0-8ff6-aee61d96adfa","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:162a1a7ef3b140ba85f4e1cf4a3e0c684c478150ea831cb064cae762d126ac2b","observation_id":"808261c6-0132-49bd-9160-ead7de148c9c","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08731","last_updated":"2020-04-02T05:40:29Z","snapshot_observed_at":"2026-08-02T19:28:48.954133Z","submitted_at":"2019-11-20T06:43:41Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08731","snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization.arXiv:1911.08731, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"cited_paper":"/paper/1911.08731","citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:30de43d90bdc895c6ed05405923be1f017a93c6bedacf0825103f55c6823b76f","observation_id":"761c3ec0-8040-43b6-be89-45800a370b04","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Fake it till you make it: Learning trans- ferable representations from synthetic imagenet clones","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:2872408d6f341c713727c9eee0017f46db32844d6f0f4fd39464fdc9737a13a6","observation_id":"37bd9596-2a70-4c96-b466-2e575d708ee2","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Grad-CAM: visual explanations from deep networks via gradient-based localization.IJCV, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:bae098bbf93f35a3816b33233c1c6f7c83caf7a5047fc4e8befbb81b7e5c9db6","observation_id":"019481a8-db7a-44d1-80c6-94858853ca4e","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Counterfactual Co-occurring Learning for Bias Mitigation in Weakly-supervised Object Localiza- tion.IEEE Transactions on Multimedia, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:611428a08593ddc96af41bc1b9f3146a12a9024e91839570a2cc5e920acbda52","observation_id":"4ce575b6-a68d-470e-abaf-1fa315b44328","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Very Deep Con- volutional Networks for Large-Scale Image Recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:a0cc0630f570e53d6dc59f4637f1a1374d84876d27f0d74bb2684fbed141f769","observation_id":"e5823782-5fa3-45d6-b9dc-36cf1c35eefd","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Singh and Y .J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:3fa1f18e7db9246b8d0b1f97c279fcb86748604668f2d7761703aec562ba77ca","observation_id":"c744f365-8a81-47cb-83ef-8a5ce6438929","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild.arXiv:1212.0402, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:e38738abe490fa84c0187a74d8228a9599273eec30e7839afc1d214d90cd74f2","observation_id":"b3d8ebf4-2c01-4701-a86f-c746f982931a","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Deep High-Resolution Representation Learning for Human Pose Estimation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:2f508a714e4ce2edc4460961628445477ba84d1965cad17d24f3ac52d485d375","observation_id":"65d08dee-e502-43bb-b162-ef51f492a404","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:c29a843245f8790af17da9f33751cad037ab027b31c3af455a664129b45ac72c","observation_id":"5913bedc-8b28-4797-97a4-3fdd92123730","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Training Data-Efficient Image Transformers & Distillation through Attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:4be7c452e9805b1e2b2fbbb24709230d6ade4410aa6625ca7047015d6f4739d7","observation_id":"7914bf73-9fd2-47b9-ade0-f32af419a22e","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Black, Ivan Laptev, and Cordelia Schmid","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:485d1d6fba50711916160cf82aabf7a5947796ecfd17a064cf9ae61a576cde92","observation_id":"f6e18546-9b10-4162-a30c-fdf902958c04","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"The Caltech-UCSD Birds-200- 2011 Dataset.Caltech Technical Report, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:6bd3d6d393aeecb701fbd646bfd14f290261598974055b06f3536c939c6c65cf","observation_id":"bd870079-2859-47bd-987a-c1829f99d15a","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Spatial-Aware Token for Weakly Supervised Object Localization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:4aba4592ef259c7a5aa4ddad3381c354091581fc9426ea75b326a92b28eaa81d","observation_id":"d795d151-f84f-4972-805d-a2c220b8c27d","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Pro2SAM: Mask Prompt to SAM with Grid Points for Weakly Supervised Object Localization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:7f30723653251b9dd48cf101480c298b6ccd84f7e4f7999c359d0b5721110d7b","observation_id":"294f640f-8ba0-44f2-8803-85addc3044a2","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"CutMix: Regular- ization Strategy to Train Strong Classifiers With Localizable Features","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:28969395d8e398f632dc020e62747953491f2bad66c1195dc663dd49f4ebabc5","observation_id":"e7ef1230-51f2-4107-be61-0286465dcfca","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":"Dauphin, and David Lopez-Paz","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:817ac4cdb1918778535339f3ceb5338e2bfa8e9c22f146491069e24ea4f30d3d","observation_id":"1034c450-46e5-4a69-9e75-5ee9cdef4603","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:40:21.868428Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T13:40:21.868428Z"},"links":{"citing_paper":"/paper/2604.02941"},"observation_digest":"sha256:94297e3fbcabdfbedc41504c4d0ae7e47235506acadaf2e2431293f338b9d270","observation_id":"9e24ef8d-11b1-4384-88bf-7e9dda6d887a","resolution":{"observed_at":"2026-07-13T13:40:21.868428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.02941","last_updated":"2026-05-31T06:18:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-13T13:40:21.415451Z","submitted_at":"2026-04-03T10:17:39Z","title":"MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2604.02941."}