{"as_of":"2026-08-09T08:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d5d823121a9a4c405858849000884d74d6709348ea86c8e55a97f82f4ba113d","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:28:04.024662Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.18055/citation-record","integrity":"/paper/2506.18055/integrity","json":"/paper/2506.18055/citation-record.json","paper":"/paper/2506.18055"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:11.701459Z","title":"Active Speakers in Context,","venue":null,"work_id":"0f25066e-411e-4fac-82a9-b047dbd4a979","year":2020},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.161274Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:e336c229470c6b7f3196646002c0c06df5523ea827db8d34bde2cc6175e0d496","observation_id":"3d519f9d-1d03-4f53-ae21-48a237127be6","resolution":{"observed_at":"2026-08-06T23:28:11.966029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:11.424799Z","title":"Ava Active Speaker: An Audio-Visual Dataset for Active Speaker De- tection,","venue":null,"work_id":"11d1e8e5-32d1-45ad-a3c0-0d125baecdfb","year":2020},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.211659Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:475133a77f49f5f233365a05dd57e3ab2797d97cb3941d0f51e80009f92cb321","observation_id":"595f5d18-6525-4a29-b1ee-497625d96228","resolution":{"observed_at":"2026-08-06T23:28:11.526572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:11.136233Z","title":"ASD-Transformer: Efficient Active Speaker Detection Using Self And Multimodal Transformers,","venue":null,"work_id":"f6a8301d-f3e2-4296-a686-3ccd70c86e74","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.334739Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:ef16e86f1cbc7f60b54972b2887d3f82847955ea2b1a5a04021949167d8fdf59","observation_id":"675e0db4-f8b4-45d3-8e6a-fde1299fe0ce","resolution":{"observed_at":"2026-08-06T23:28:11.244934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:10.906092Z","title":"Hello! My name is... Buffy","venue":null,"work_id":"43c122f5-2fdd-431e-ab8c-bd4622558259","year":2006},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.395980Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:0833e8a6460bab8bf693ada99699128f4a9199f639f656de1e5c8a2437a80881","observation_id":"01600124-09ba-4662-8c9c-f10ea044203a","resolution":{"observed_at":"2026-08-06T23:28:10.993651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:10.680390Z","title":"Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection,","venue":null,"work_id":"c5b0407c-8f3d-4086-b51f-81439d4ffb56","year":2021},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.502763Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:336ca8f187a9b331506958da26c79892e84e26b0e13fc30f8477d7e36a639860","observation_id":"1d152d5d-2af3-4d3b-b54c-3a4bd1ae02d4","resolution":{"observed_at":"2026-08-06T23:28:10.769025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:10.465611Z","title":"A Light Weight Model for Active Speaker Detection,","venue":null,"work_id":"dce7f2a9-ec81-4071-bc2f-530a85ceb097","year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.578729Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:d2c7ac278526f5a95cd461cf3c36cd8a44be4aff0fcf6f22932f1935fc133be6","observation_id":"c9c5a4f2-537b-4f30-82e8-5af3a23ccf49","resolution":{"observed_at":"2026-08-06T23:28:10.599063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:10.205599Z","title":"How to Design a Three-Stage Architecture for Audio-Visual Active Speaker Detection in the Wild,","venue":null,"work_id":"4579fea4-e889-4f13-b4c4-bb587e716cf3","year":2021},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.661110Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:e5998a93d5a91e4b1ffd4e8427e6d5f5831a6cae4ef6fc40894d74376226c159","observation_id":"0a1d72ee-4f06-4b28-84fb-db88ad03bbe5","resolution":{"observed_at":"2026-08-06T23:28:10.352982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.896603Z","title":"Rethinking audio- visual synchronization for active speaker detection,","venue":null,"work_id":"7d006403-3b5d-42a1-bd91-d059491625e9","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.743867Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:c8fcf63ec1749cf9e9d48cc40137f1e1a5960c81eeba46a11614c07b500d74fa","observation_id":"560f2392-93ce-4dd9-8852-7e5e5e6e0f87","resolution":{"observed_at":"2026-08-06T23:28:10.001902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.688122Z","title":"Look who’s talking: speaker detection using video and audio correlation,","venue":null,"work_id":"27dea6b5-816b-4afa-9301-dbe9be142d37","year":2000},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.830166Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:1fb786d1858f1d66c6b3f9f7c3a8cd149524281fb432755163ad9aa41cc910fe","observation_id":"a6840b8f-f578-4718-8d99-81eb95934fba","resolution":{"observed_at":"2026-08-06T23:28:09.792847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.456463Z","title":"End-to-End Active Speaker Detection,","venue":null,"work_id":"2064a700-2a96-4bdd-b07b-8a55b71e915f","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.907466Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:b4c826f94da6f4360a33113cf0f7a6e2cbd88ea5fa4a99461689f4a59b350090","observation_id":"c24fe963-85d5-4720-890b-e6b43059b1c9","resolution":{"observed_at":"2026-08-06T23:28:09.581114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.258607Z","title":"Learning Long-Term Spatial-Temporal Graphs for Active Speaker Detection,","venue":null,"work_id":"fbae0c62-36b9-470f-9cd6-ed66e3cfaa9e","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:00.958946Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:b164faa30a42b0075b19aa9b36c894bf10e4a82dfdf58ab65ea4255306b68c4b","observation_id":"fdd7f602-0b28-4fbd-becd-a953dd51785a","resolution":{"observed_at":"2026-08-06T23:28:09.351206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:09.026761Z","title":"MAAS: Multi-modal Assignation for Active Speaker Detection,","venue":null,"work_id":"50ece476-2149-45ad-bae3-c595182a5b42","year":2021},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.097316Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:f10e071faa979eb31f8032e520fbf6ea639ad8338b6aa750b03122f4c6e452e7","observation_id":"485f6188-833d-4be2-ac95-f5721ce9ff00","resolution":{"observed_at":"2026-08-06T23:28:09.128276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:08.794982Z","title":"Improving Audiovisual Active Speaker Detection in Egocentric Recordings with the Data-Efficient Image Transformer,","venue":null,"work_id":"0bfab214-4554-4622-9f6d-5a6adf8abf97","year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.251608Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:585096459d535fe45fcfafc081ff7dec7d95bac56928f05199e51d93ae9b61df","observation_id":"39561c4c-958e-44df-873b-cdad5357f4d1","resolution":{"observed_at":"2026-08-06T23:28:08.895941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:08.646041Z","title":"Target Active Speaker Detection with Audio-visual Cues,","venue":null,"work_id":"69dd74ac-b747-4217-a145-430997f4c4f8","year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.401263Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:95463b18d8ae9621f65ec7e8f29c520ca8becb131b8a2047d876351e443fc6fb","observation_id":"7c1b49ea-fa35-443d-b6f4-ad6f9019017b","resolution":{"observed_at":"2026-08-06T23:28:08.743478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:08.406280Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings,","venue":null,"work_id":"0654abea-4acd-4562-bacd-3ca64b9efceb","year":2025},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.510834Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:377ef4d48dde6022de6ecde8fdb436c43a67208398a857450ec950605796e973","observation_id":"6934f742-1c5e-4600-a4e2-622a37b09024","resolution":{"observed_at":"2026-08-06T23:28:08.516435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:08.201953Z","title":"Ego4D: Around the World in 3,000 Hours of Egocentric Video,","venue":null,"work_id":"d90bdad0-8114-46ac-b277-88982d7ebbb4","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.613046Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:45f0501bb8b034e5fec1a5cc2dc090bcaf3e5af4d5b024b5749d19105fab0a4a","observation_id":"6b46b576-648a-42dc-9e1b-bc703fae9e9f","resolution":{"observed_at":"2026-08-06T23:28:08.272269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01467","last_updated":"2023-07-04T04:12:49Z","snapshot_observed_at":"2026-07-06T15:49:58.951341Z","submitted_at":"2023-07-04T04:12:49Z","title":"Technical Report for Ego4D Long Term Action Anticipation Challenge 2023","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01467","snapshot_observed_at":"2026-08-06T23:28:01.668716Z","title":"Technical Report for Ego4D Long Term Action Anticipation Challenge 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.668716Z"},"links":{"cited_paper":"/paper/2307.01467","citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:8473834c8cb1312be780f9c4fb7101ed08303cadcc5642317d0918cc8d982794","observation_id":"3ff72ce4-a91e-44ca-8841-3d3cca488ac6","resolution":{"observed_at":"2026-08-06T23:28:01.668716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.966875Z","title":"Seeking the shape of sound: An adaptive framework for learning voice-face association,","venue":null,"work_id":"2059f993-a598-4466-9bde-5ca21167429a","year":2021},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.716049Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:9cd2c193ebb86ee9399fafd5f0ed05d9f7b3d33182d2ba5119d699d94a97e241","observation_id":"3c85c3c6-8f4e-470d-8fcb-67259ac708cb","resolution":{"observed_at":"2026-08-06T23:28:08.058693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2527.35313","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:04.426390Z","title":"Self-lifting: A novel framework for unsupervised voice-face association learning,","venue":null,"work_id":"9da96315-88b6-4010-897e-3cc692572491","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:01.837550Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:24916ff6123f80b54ab4f9620f5b745273978b709db13aeaf476ad0eddb27046","observation_id":"03f7becb-6ffe-425f-8532-08d88f4dccff","resolution":{"observed_at":"2026-08-06T23:28:04.554745Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.801093Z","title":"Learnable pins: Cross- modal embeddings for person identity,","venue":null,"work_id":"6fac8e24-3e8b-4b35-b7e0-1fddb97d9090","year":2018},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.082727Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:c34cbacfe1d9d7e327b1bf64d0ca86edbdbd222486c2fb8a9e8f3405e4ebafd1","observation_id":"c818b741-5277-4e16-abd0-a8d1291c9357","resolution":{"observed_at":"2026-08-06T23:28:07.868774Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.573924Z","title":"Single-branch network for multimodal training,","venue":null,"work_id":"d847ee2c-bfbb-4c1c-aad1-ff7d28b8ae2e","year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.239663Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:7c960796cb9a1e356d4bab2529b5890a235b44562a5fccd5eea4ec7d8e7294b2","observation_id":"6877f71c-2b62-4c0b-ac45-67030f6e342c","resolution":{"observed_at":"2026-08-06T23:28:07.663855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.337447Z","title":"Disentangled representation learning for cross-modal biometric matching,","venue":null,"work_id":"e24f0f37-b1d4-4a9a-840a-d1c93b3e1370","year":2022},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.377727Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:072a65ca2d163dbde1baadaadec2b1cdeb8d5e5e55c4a866feb7435ccd0a2a38","observation_id":"45f549bc-58ed-4e08-901d-8064243fca8f","resolution":{"observed_at":"2026-08-06T23:28:07.467614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:07.174207Z","title":"An efficient momentum framework for face- voice association learning,","venue":null,"work_id":"ea0cbaa4-f38a-45cb-a58f-49fd28c66973","year":2024},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.488724Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:75935ad53c22091bd3cc5df5b1a3167e9d61124aef7b33d04f7d59272b1dc700","observation_id":"a7cf0fa6-e9bc-4d58-81ee-4a56267393e8","resolution":{"observed_at":"2026-08-06T23:28:07.247169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.988550Z","title":"Audio-visual activity guided cross-modal identity association for active speaker detection,","venue":null,"work_id":"e7cd43bf-04fd-451c-8701-b6f8ab168e75","year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.572698Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:8bdd57c4614d8c93bee7ae276dc9dae6f46dc2811e79b661c2f8d8413c882afc","observation_id":"a5379e78-54f8-44f9-b109-a007618e45a8","resolution":{"observed_at":"2026-08-06T23:28:07.078961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.794737Z","title":"Favoa: Face-voice association favours ambiguous speaker detection,","venue":null,"work_id":"0a020357-4ebb-4bf5-9190-24f5de22c145","year":2021},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.704753Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:16bd1d01decdac242b753ee218228d5abb9760fa9f45e96b6b60603ec3e9de77","observation_id":"4b0cb8aa-1595-430f-9381-c9c9d544d02c","resolution":{"observed_at":"2026-08-06T23:28:06.912665Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.656868Z","title":"What in the world do we hear?: An ecological approach to auditory event perception,","venue":null,"work_id":"1a1399b9-0a30-42bb-a3c9-be4fc98facb2","year":1993},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.819345Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:01c2090d3fbaef3aeef0504c7562af5ca9c37def873a97ec661e0627f5178c78","observation_id":"94448a55-3457-4788-9073-46b186ac08be","resolution":{"observed_at":"2026-08-06T23:28:06.692666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.359424Z","title":"The development of infant learning about specific face–voice relations,","venue":null,"work_id":"80256797-3604-48cc-910a-f286406bed67","year":2005},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:02.931958Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:b86a0134a6bc7387b57c8a6cdec8890ad672a0a0754aee276cd7adc3ea24f919","observation_id":"678a8f40-55c7-4a93-949c-da8d2397e8fe","resolution":{"observed_at":"2026-08-06T23:28:06.518843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:03.064751Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.064751Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:9e6e35fc1bf993557933fb844165752b99d71e64afa1a24e6b2afb0b6e4c9a8c","observation_id":"bfe23d5c-abdf-4b35-9598-368caf1b438d","resolution":{"observed_at":"2026-08-06T23:28:03.064751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:06.143606Z","title":"Going deeper with convolutions,","venue":null,"work_id":"583de5b4-00b7-44c4-8c37-51a9f64326ab","year":2015},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.181816Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:2f080da611ac967bffa26ba7cbb86b7e26b4dba01fc82bb450e84bb0da471db7","observation_id":"49998520-39b3-4c4d-980d-52b78574f43a","resolution":{"observed_at":"2026-08-06T23:28:06.213326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:03.287092Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.287092Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:d6a69c235b7739a88dd0acabbf11f4f04129130c1d47e7afe439e2b7952dbf7d","observation_id":"84a012c6-bd7f-4fe3-a822-1043f0ddb7c7","resolution":{"observed_at":"2026-08-06T23:28:03.287092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:03.413480Z","title":"V oxCeleb: A Large-Scale Speaker Identification Dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.413480Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:c6d175d0581849a95d7e99b668cf1af5e1110e26d6bc1913efb86110ca1d8c15","observation_id":"372c41aa-29c2-48f0-ba07-06083b3c28ce","resolution":{"observed_at":"2026-08-06T23:28:03.413480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:05.921152Z","title":"Silero V AD: pre-trained enterprise-grade V oice Activity Detector (V AD), Number Detector and Language Classifier,","venue":null,"work_id":"80482dab-8b53-4c29-bfa8-d2b89301cf86","year":2024},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.514567Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:650379ff0995369928d630ad9f15d30f09ec31ebb42e44e5afd741c1b9e25595","observation_id":"bd9368f2-295d-43ba-94b1-9dc87ed33b03","resolution":{"observed_at":"2026-08-06T23:28:06.010040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:05.671864Z","title":"Speaker change detection using support vector machines,","venue":null,"work_id":"b3a92abe-20ed-44b8-aa7c-36f280b52d21","year":2005},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.617037Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:8e66f44dd7fc55622f4aeb4a2a6bfb96201e7d0954f9a0211f31a5322ed83451","observation_id":"1c82e53b-dd44-43cb-8d11-e1060c2a9caf","resolution":{"observed_at":"2026-08-06T23:28:05.791533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:05.459731Z","title":"Robust Object Recogni- tion Through Symbiotic Deep Learning In Mobile Robots,","venue":null,"work_id":"de7ec6fa-61f5-4460-8846-d7d848f06c0f","year":2018},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.722890Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:1a68d8b4726ad600d6a4d2aa5207461d0989cef290bbfe163a424bdcb495a920","observation_id":"01524bdb-3042-4b5f-98d8-9487ec8a63ab","resolution":{"observed_at":"2026-08-06T23:28:05.513645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:05.160877Z","title":"The PASCAL Visual Object Classes Challenge 2012 (VOC2012) Results,","venue":null,"work_id":"f3c8b48e-107a-47e3-ac34-d5c73345e980","year":2012},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:03.826961Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:177ffe4ba873b137bfd32776b7f8795121e9788725f2b298950efb8aab08c52b","observation_id":"d9dcd20c-c5f4-481e-bd08-0a81574c4e69","resolution":{"observed_at":"2026-08-06T23:28:05.334738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:28:04.705799Z","title":"LoCoNet: Long-Short Context Network for Active Speaker Detection,","venue":null,"work_id":"8ffe3b7c-05a1-417b-b6bb-82ccc84c087e","year":2024},"citing_paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:04.024662Z"},"links":{"citing_paper":"/paper/2506.18055"},"observation_digest":"sha256:ffddc5b0f939126bb18808d3daa69894b699c04ab37b93894583dbc46cf592ed","observation_id":"dc7409f3-f4be-4f02-b059-3ca6b14fc596","resolution":{"observed_at":"2026-08-06T23:28:04.953889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18055","last_updated":"2025-06-22T14:43:37Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-06T23:20:50.660007Z","submitted_at":"2025-06-22T14:43:37Z","title":"Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2506.18055."}