{"as_of":"2026-08-15T22:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a33d148b906376d59aa2c0e63d24ec05f41b67bd69bc5ac46e2dcd4648e2f4b","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:54:27.753449Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:54:25.077226Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T21:19:53.890089Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17002","snapshot_observed_at":"2026-08-07T14:54:25.077226Z","title":"Multimodal learning and face-voice association","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.077226Z"},"links":{"cited_paper":"/paper/2505.17002","citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:d198a34ceead503527872fe07ad4371ccc823ebb51891db1ad69eccaf00f7984","observation_id":"19de554e-2010-46a2-95f3-8195cab4a911","resolution":{"observed_at":"2026-08-07T14:54:25.077226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"cited_work":{"arxiv_id":"2505.17002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17002","snapshot_observed_at":"2026-08-06T21:19:53.890089Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","venue":"cs.CV","work_id":"007a814b-b543-482a-ae7e-324570921cfb","year":2025},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-15T19:07:42.982701Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.555712Z"},"links":{"cited_paper":"/paper/2505.17002","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:885b5d1015e471de946678264e575b8983e2a2e0aa69b42afbf9cd4614790da4","observation_id":"cd2426c6-f426-4597-933d-b22d65292576","resolution":{"observed_at":"2026-08-06T21:19:53.919077Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17002/citation-record","integrity":"/paper/2505.17002/integrity","json":"/paper/2505.17002/citation-record.json","paper":"/paper/2505.17002"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:32.686218Z","title":"This task is brought into the com- puter vision community by Nagrani et al","venue":null,"work_id":"7d645b40-684d-482c-9a4a-07a44c51535a","year":null},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.037032Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:00934af1c40839a32c6ab61b3039da81e1da5bb9945007e5972684e6e2a05aa8","observation_id":"5e2ae54f-a40b-4385-8d13-ed1353858144","resolution":{"observed_at":"2026-08-07T14:54:32.745213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17002","snapshot_observed_at":"2026-08-07T14:54:25.077226Z","title":"Multimodal learning and face-voice association","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.077226Z"},"links":{"cited_paper":"/paper/2505.17002","citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:d198a34ceead503527872fe07ad4371ccc823ebb51891db1ad69eccaf00f7984","observation_id":"19de554e-2010-46a2-95f3-8195cab4a911","resolution":{"observed_at":"2026-08-07T14:54:25.077226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:32.560421Z","title":"Baseline Approach In this work, we adapt a two-branch framework as our base- line method to establish face-voice association [10]","venue":null,"work_id":"f38c8b77-cc0d-4cdc-a817-faab733618b8","year":null},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.132483Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:1e47d290fded019c765f70d7c7c6cda88e76c4540a582786d9e5ec74467097e9","observation_id":"5c261a68-bb76-450d-8130-d6c5bc61429d","resolution":{"observed_at":"2026-08-07T14:54:32.620254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:32.440422Z","title":"We set the initial learning rate to 2e−5","venue":null,"work_id":"d01fd2e7-9f78-4728-961f-7762dec44f9b","year":null},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.222063Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:af782d14e2da10da87318aef0d0d306bec408764a8424e836c5a6c06fa24ed79","observation_id":"e793fa15-e583-447c-9324-f5f824f2889c","resolution":{"observed_at":"2026-08-07T14:54:32.494309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:32.261832Z","title":"We demonstrated that the precise alignment of features is a crucial step for obtaining better performance in the face-voice associa- tion task","venue":null,"work_id":"d0b91626-c462-473f-bb9f-4650d241e1f8","year":null},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.287207Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:93f04f2de86ba93c70378cbf886a8d20abbaa68a3dbcb42110400cebe1a19b6d","observation_id":"72f4a298-40dd-4618-9576-a26a70d3aca1","resolution":{"observed_at":"2026-08-07T14:54:32.321517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:32.165526Z","title":"Putting the face to the voice’: Matching identity across modal- ity,","venue":null,"work_id":"39d1aa28-8da9-423b-abbc-e33f83f33bf4","year":2003},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.352083Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:6ae25a348f4b7d69c80b3131b3e751ac78ce905cccc0d694f9f79a15db6f8e1b","observation_id":"ac889a9d-04df-4567-bd1f-ddef20f445d7","resolution":{"observed_at":"2026-08-07T14:54:32.203762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:32.058903Z","title":"Thinking the voice: neu- ral correlates of voice perception,","venue":null,"work_id":"ae7d1123-a4c3-4033-8bf2-528d02af8fb5","year":2004},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.412953Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:694e68865064079334fddf3b9cf8ec372d5f5d9b5669e7d2b79352e1b2545e30","observation_id":"233bfe72-400b-4ffc-bab6-85b60553e5c8","resolution":{"observed_at":"2026-08-07T14:54:32.107457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:31.945313Z","title":"Hearing a face: Cross-modal speaker matching using isolated visible speech,","venue":null,"work_id":"69dbb8e3-ee85-4277-bf23-ec21cf07bd9f","year":2006},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.480176Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:2b8ce6aa9747b4db6890892f76d5e034d44f95433b0383df7fddc53170188a6a","observation_id":"6f673626-0f95-41d2-8f85-942fb463e984","resolution":{"observed_at":"2026-08-07T14:54:32.004254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:31.802130Z","title":"Seeing voices and hearing faces: Cross-modal biometric matching,","venue":null,"work_id":"4af96a3b-2544-429d-b55a-9e6827693eaa","year":2018},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.558164Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:6643da89d573bdecf7e9d45a6f44b1f8631b633b322da0bd786c4db91f82be5d","observation_id":"ec56badc-d388-4900-9932-f68574137239","resolution":{"observed_at":"2026-08-07T14:54:31.874448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:31.671187Z","title":"Learnable pins: Cross-modal embeddings for person identity,","venue":null,"work_id":"e829d533-e204-4a6c-bed0-53a1cc323f8d","year":2018},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.648218Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:9da82196f1a1cdaa3476eeeede2d6e93cc195676e5e7652c16471622c942cb95","observation_id":"ff51b706-4729-4a51-9570-56c018c7c215","resolution":{"observed_at":"2026-08-07T14:54:31.722720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:31.526182Z","title":"Face-voice match- ing using cross-modal embeddings,","venue":null,"work_id":"293c165f-f9c5-4694-95c4-666c749a0b9d","year":2018},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.764855Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:a31d171fdc69e41eb3aa76f694f305dfcf406edbba67a2ebd281d0d25eb79626","observation_id":"72b7d7d3-5283-470d-b23a-49e7a3758935","resolution":{"observed_at":"2026-08-07T14:54:31.597629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:31.399665Z","title":"Dis- joint mapping network for cross-modal matching of voices and faces,","venue":null,"work_id":"dc46f21f-41a0-45ec-857f-4730a4e4ccdf","year":2019},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.840801Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:1a1af017c2a0db465fddb103826851a7851e51dae19cf60c94311a59f7c54c3b","observation_id":"d4f0024d-0421-45e7-aba6-d40763571db6","resolution":{"observed_at":"2026-08-07T14:54:31.453554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:31.240002Z","title":"Deep latent space learning for cross-modal mapping of audio and visual signals,","venue":null,"work_id":"ab2c3d8a-5fe6-47c2-82c7-9c362d27c65b","year":2019},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:25.935750Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:37080fe0cec8e13de0026543600458324009be9c0d2be4ab26f9196ffab7c4a8","observation_id":"ebab6516-4788-4cc0-9ff9-5f605be841bf","resolution":{"observed_at":"2026-08-07T14:54:31.307401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:31.108616Z","title":"Seeking the shape of sound: An adaptive framework for learning voice- face association,","venue":null,"work_id":"01eaef9c-7241-4660-b7dc-4e467c6e2e83","year":2021},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.025224Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:4577cf1717ee041ea6c578e2213b42647f47bf1087b02e0cb648f05505cbfba8","observation_id":"3c8af93b-5831-4b11-858a-b3d426a1dfe3","resolution":{"observed_at":"2026-08-07T14:54:31.166456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:30.983329Z","title":"Fusion and orthogonal projection for improved face-voice association,","venue":null,"work_id":"81574ac0-7892-49b0-a79e-a8ab02662ba1","year":2022},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.068768Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:97476f32ddaba6ee675cff0e3d07ee9958c512e9944c8031e66c5921bf1d17f4","observation_id":"a3d21471-1f8e-4080-b265-87d36b223760","resolution":{"observed_at":"2026-08-07T14:54:31.023319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:30.845132Z","title":"Single-branch network for multimodal training,","venue":null,"work_id":"248a5afa-f47d-4d2b-8eed-9d2da64f2e33","year":2023},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.157777Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:b71ec28bacb721f7eae727a19c77ad9516f5e9a9e12b67451b42dc2ea9567c69","observation_id":"52758eb0-4474-4369-a6a1-72beea0779e6","resolution":{"observed_at":"2026-08-07T14:54:30.910744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:30.700911Z","title":"A synopsis of fame 2024 challenge: Associating faces with voices in multilingual environments,","venue":null,"work_id":"95d8f0df-b541-4b1c-910d-dc47467cd944","year":2024},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.227767Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:cdca014880199421911d6d9b231a2e90de8a9f782d583310add8f911a06beeba","observation_id":"c3175f51-5922-4e1a-b149-4b48c2235a84","resolution":{"observed_at":"2026-08-07T14:54:30.793467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:30.554873Z","title":"Speaker recognition in realistic scenario using multimodal data,","venue":null,"work_id":"7d820faf-d870-43fb-8147-218aedd2b0e1","year":2023},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.300480Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:dd6aa82fbdda9c6bd76e776b984680fb1cb51bd1939550bccc4d2ae7696b1583","observation_id":"bee28be6-c930-4fb7-ab16-e6a128b0ec48","resolution":{"observed_at":"2026-08-07T14:54:30.632867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:30.413819Z","title":"Cross-modal speaker verification and recognition: A multilingual perspective,","venue":null,"work_id":"2da7a955-e685-43ff-a193-143c3213472a","year":2021},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.358285Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:7aef5fa9247011c555c8ec266a04765f5b5502abab22fffb883e9a51b2a6822d","observation_id":"be741695-1fa3-484d-ab92-e8a30bc31676","resolution":{"observed_at":"2026-08-07T14:54:30.482701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:30.229480Z","title":"Local-global contrast for learning voice-face representations,","venue":null,"work_id":"7a19414a-2859-4452-8d8b-0bcbbc5bfb28","year":2023},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.422008Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:fd925329ef6ae1c64406490b6268d3ad8a7545c38fb65b8ab346b65f751758ba","observation_id":"cb6b7d32-c97b-4194-9bf6-791f98ea4829","resolution":{"observed_at":"2026-08-07T14:54:30.303470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-15T18:36:10.637306Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-07T14:54:26.487729Z","title":"V oxceleb: a large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.487729Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:241f33a5b189d00b82b9a1a72c4ff3edef75c58561dc6740873a2ef91b835d4b","observation_id":"1cf49cc9-ab3c-4a68-90f8-058a2ae7cbec","resolution":{"observed_at":"2026-08-07T14:54:26.487729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:30.077099Z","title":"Multimodal ma- chine learning: A survey and taxonomy,","venue":null,"work_id":"0f944438-d977-4b86-b145-fb204976971f","year":2018},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.570882Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:e8663d0b2d712b1dcd189421189e3c3c781dfd1abdfcc2db46269f7b3ed25c4a","observation_id":"2b34aa0b-a7fb-48ad-b253-ea3c6c0b0b1c","resolution":{"observed_at":"2026-08-07T14:54:30.135954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:29.905741Z","title":"Multimodal intelligence: Representation learning, information fusion, and applications,","venue":null,"work_id":"e5b4c43f-5497-452a-b99b-57b4161ead6d","year":2020},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.641126Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:5051b76bec4d789050f3181ae64396c7fabc92173144925ae86d2ee0165a9066","observation_id":"589af4a3-9fdb-44e6-b4eb-68879e93630f","resolution":{"observed_at":"2026-08-07T14:54:29.959366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:29.777845Z","title":"Multimodal learning with trans- formers: A survey,","venue":null,"work_id":"238540f1-476c-48b8-a684-c3f92457f7f5","year":2023},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.729811Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:3a8b664dcd4e269c989cd67149a6ef8c4d6f646b7036668c8e3caa0fd2f98c0a","observation_id":"c14a2ae2-b950-441e-90be-eb4de3dcdc5c","resolution":{"observed_at":"2026-08-07T14:54:29.832815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:29.594011Z","title":"Guiding at- tention using partial-order relationships for image captioning,","venue":null,"work_id":"c712ad24-edbc-4fca-bba1-88df8f5655d2","year":2022},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.797790Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:6f3c979b040106225d90e701edf667f4c66d1a149e98707bf3fed584f84dde3b","observation_id":"68f3fafa-8144-4449-80fb-db3481cf8276","resolution":{"observed_at":"2026-08-07T14:54:29.691377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:29.441746Z","title":"Dctm: Dilated convolutional trans- former model for multimodal engagement estimation in conversa- tion,","venue":null,"work_id":"1c49f097-9541-4f5b-a770-5d0577f5771f","year":2023},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.868920Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:8ba588dd7dc55666a9d5f471efa7fa8b99feef918be21d34c134b5c43c92d642","observation_id":"47864025-a6ca-4e75-9956-f2b81e1292dc","resolution":{"observed_at":"2026-08-07T14:54:29.518762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:29.283021Z","title":"Representation tradeoffs for hyperbolic embeddings,","venue":null,"work_id":"f23010a5-293b-4b07-8b09-57dbd9dd9dec","year":2018},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.921999Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:d6fb9f8ff356a7ed1f2dc18d8b719a9bd3e34d6ed7b7a3d0a62dbbba3d1325c9","observation_id":"a85c331a-8e54-4a6b-94e7-3ada0045d66c","resolution":{"observed_at":"2026-08-07T14:54:29.355771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:29.133833Z","title":"Hyperbolic image embeddings,","venue":null,"work_id":"91dc8a17-c5af-4823-86d5-01f13918dff0","year":2020},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:26.996811Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:f3a2203ca48e4e77ba8265fccb26415382036ed661c5c8a8d2d0acc81f66089e","observation_id":"efb3c120-12e7-442e-8279-7b6e2066fa5a","resolution":{"observed_at":"2026-08-07T14:54:29.194944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:28.989626Z","title":"Accept the modality gap: An exploration in the hyperbolic space,","venue":null,"work_id":"6a7957c7-5e40-4ac4-91b8-51527332b197","year":2024},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:27.070214Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:ddc6db3a233199c2d1d95a9efc95a4d1867f86b5d48a65c4add2142b5534a913","observation_id":"cc9f730a-504d-4322-8f00-5fa3399829ce","resolution":{"observed_at":"2026-08-07T14:54:29.039703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:28.793984Z","title":"Cross-modal scalable hyperbolic hi- erarchical clustering,","venue":null,"work_id":"049ccfc0-46ff-4871-a022-4eb927d25805","year":2023},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:27.140338Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:7b9e18f06b49ca4512b49716a05ac6daa059108ec41a50cb346f1701e1782b22","observation_id":"d829e900-f005-4403-bc6f-61b185f9c551","resolution":{"observed_at":"2026-08-07T14:54:28.861382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:28.632373Z","title":"Intriguing properties of hyperbolic embeddings in vision- language models,","venue":null,"work_id":"66dae98c-30ab-4600-929b-5dc4b4f11145","year":2024},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:27.205584Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:4c4151f05732a449f5e73f8b82ee324c008477abaff9d785d292d768fb3e9bf9","observation_id":"61720031-4bc4-458a-a54c-c18f927f7c26","resolution":{"observed_at":"2026-08-07T14:54:28.706939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:27.252201Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:27.252201Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:eeec35ccea86ebc41bdd660159f24fc520cd3743550e1c52bf633d87eb7bc654","observation_id":"6ce148ab-c7d8-418f-8e2a-f609ee34b9a6","resolution":{"observed_at":"2026-08-07T14:54:27.252201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:28.528529Z","title":"A multi-view approach to audio-visual speaker verification,","venue":null,"work_id":"65d215cb-0458-401d-b03e-bf01abca6664","year":2021},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:27.321773Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:ee966d637de5af22639b8b8161377b91a72dbaebcad8106bc4cfa7a382fbbfbc","observation_id":"e5313521-7af0-41fe-880d-2896a9bbec65","resolution":{"observed_at":"2026-08-07T14:54:28.547974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:28.373718Z","title":"Adversarial-metric learning for audio-visual cross-modal match- ing,","venue":null,"work_id":"e66cb0c0-9bc2-416c-98f4-2e9c15f44208","year":2021},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:27.402068Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:5bd7f27941ab4527559c0f35a12e122800791868bd42b5a3b39fe2323ba5b1dc","observation_id":"cb1096bd-df33-4d6a-a6f3-bb053b37cf37","resolution":{"observed_at":"2026-08-07T14:54:28.443312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:28.237602Z","title":"Disentangled represen- tation learning for cross-modal biometric matching,","venue":null,"work_id":"7284e80f-bfc3-47c7-943a-2820f138043c","year":2021},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:27.509218Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:4114717341a95f228bf808ce64866a8f10ad7b0d988dcaf16ea7a38edd7f5b02","observation_id":"2f57c013-e2fa-4993-b782-ec536781d88a","resolution":{"observed_at":"2026-08-07T14:54:28.300220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.01992","last_updated":"2017-02-07T13:05:19Z","snapshot_observed_at":"2026-08-15T17:40:07.652333Z","submitted_at":"2017-02-07T13:05:19Z","title":"Gated Multimodal Units for Information Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.01992","snapshot_observed_at":"2026-08-07T14:54:27.571280Z","title":"Gated multimodal units for information fusion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:27.571280Z"},"links":{"cited_paper":"/paper/1702.01992","citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:8788d2e53f5cb10b963b9a05f00998217121b30abe776c025888f72aaa0292aa","observation_id":"b1625b69-dfc8-4933-943d-b34dbef6a299","resolution":{"observed_at":"2026-08-07T14:54:27.571280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:28.095054Z","title":"Deep face recogni- tion,","venue":null,"work_id":"dd1dff9c-1ed3-4090-b524-84965f4525b8","year":2015},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:27.672172Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:0eb49682cc0b63b443dd93a3506d6a0778079be7274bc14f5e4af1ae69364134","observation_id":"9ea7d362-61ee-41b7-853c-99a71acc5cec","resolution":{"observed_at":"2026-08-07T14:54:28.163281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:27.938537Z","title":"Utterance- level aggregation for speaker recognition in the wild,","venue":null,"work_id":"6b806de3-9824-4c65-a366-280dd9cd2a17","year":2019},"citing_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:27.753449Z"},"links":{"citing_paper":"/paper/2505.17002"},"observation_digest":"sha256:f3e213f325e550c3ca854fcb73e6eb5a785f76392f7769393fcad944c6574d03","observation_id":"bb7f9a44-e7d4-4fd1-bd9c-efa36bfdf944","resolution":{"observed_at":"2026-08-07T14:54:28.007269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2505.17002."}