{"as_of":"2026-08-09T07:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50b1f79a1095770092a3e5afb4abfe4aa914150b36f7b32bb43c43b44cec92ed","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:09:18.680337Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.06012/citation-record","integrity":"/paper/2502.06012/integrity","json":"/paper/2502.06012/citation-record.json","paper":"/paper/2502.06012"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:19.085744Z","title":"Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection,","venue":null,"work_id":"a7c15937-1231-4484-911d-fc67c94d2fe3","year":2021},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.540723Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:de449a18218042241bb1e901bb30cc4a7ba54713deb16536e06b2416be9637a9","observation_id":"c9307a56-36dc-43b4-add9-feb4284afeb0","resolution":{"observed_at":"2026-08-08T17:09:19.091720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:19.068564Z","title":"Combining Residual Networks with LSTMs for Lipreading,","venue":null,"work_id":"332c58c6-bbdf-45f8-9fea-322a86e3bb2f","year":2017},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.547355Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:5682bb197973b83f6c167959b95381cf2bd5249cd7c523a0688acf9710e65865","observation_id":"47ddadcb-d087-4eb1-86d6-06434784b766","resolution":{"observed_at":"2026-08-08T17:09:19.074488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:19.052499Z","title":"Active Speakers in Context,","venue":null,"work_id":"693378f5-8735-4334-b724-5c81a701007d","year":2020},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.552428Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:7857b6f961d926dda02e2fd7ba374827842ab3c3a26f57bc17a01028900c65c5","observation_id":"4b4a39e7-a127-4a86-8281-b656e5e37680","resolution":{"observed_at":"2026-08-08T17:09:19.056810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.557553Z","title":"ASD-Transformer: Efficient Active Speaker Detection Using Self And Multimodal Transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.557553Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:4ebcfe6b924800fa0eff6d941bed6c7071f57cd4bbb39b62b700b6bafd635c98","observation_id":"c1136810-d3a3-402f-819d-de2d8f289c8e","resolution":{"observed_at":"2026-08-08T17:09:18.557553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.564019Z","title":"Hello! My name is... Buffy","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.564019Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:f01a20fffeafa83a0305d2e82c943a3dd027239dcba3c0fb5cc60ee2c37a75cb","observation_id":"68a840b7-088d-4d2b-8965-d29d9c87d898","resolution":{"observed_at":"2026-08-08T17:09:18.564019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.569695Z","title":"MAAS: Multi-modal Assignation for Active Speaker Detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.569695Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:df191d37806b8224d8cc893cab3f1a7814cf444eced27718d965bbfd1e0b06ce","observation_id":"09db0d23-3d42-46be-82b3-4652a159bc36","resolution":{"observed_at":"2026-08-08T17:09:18.569695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.576552Z","title":"Target Active Speaker Detection with Audio-visual Cues,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.576552Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:d4d4b39a5b3862005be043b1b2947537e14556f197e2df7b80692733b0f22530","observation_id":"d87e82d8-2b51-441b-bd18-8c5834c0465f","resolution":{"observed_at":"2026-08-08T17:09:18.576552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.581381Z","title":"Ava Active Speaker: An Audio-Visual Dataset for Active Speaker De- tection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.581381Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:b056afa42759b9f818973027db17dcf87909806ea8275156c59add1448ff9a23","observation_id":"6f99e09c-4b40-4109-b829-75bf046371a9","resolution":{"observed_at":"2026-08-08T17:09:18.581381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.981833Z","title":"Improving Audiovisual Active Speaker Detection in Egocentric Recordings with the Data-Efficient Image Transformer,","venue":null,"work_id":"a2d6069b-1fbd-4da9-b293-51a09217d6c7","year":2023},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.585590Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:4162a3565bd9a3b511c63d9c479c2213b33a11b32676022caf1d9b3ce794ee3c","observation_id":"ac4f4dfd-872a-45dc-891f-bf0e2010181a","resolution":{"observed_at":"2026-08-08T17:09:18.988225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.590424Z","title":"Ego4D: Around the World in 3,000 Hours of Egocentric Video,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.590424Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:959c0235cb2a2264b53f1298be6d606fbcf66f79efdcb5bc648cf8f00543c981","observation_id":"21ef0601-6f5b-49da-a5f2-e9ad0d680dfc","resolution":{"observed_at":"2026-08-08T17:09:18.590424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.956095Z","title":"End-to-End Active Speaker Detection, author=Juan Leon Alcazar and Moritz Cordes and Chen Zhao and Bernard Ghanem,","venue":null,"work_id":"04abbf20-c4ca-47ef-a71a-4b88b1960924","year":2022},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.594992Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:a7fedb17436f6e2e2e9773bbf55679fd617984b4987a6694749316c8424ce930","observation_id":"36daf742-d0ff-45dd-9b53-f0257df901ad","resolution":{"observed_at":"2026-08-08T17:09:18.962200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.600233Z","title":"How to Design a Three-Stage Architecture for Audio-Visual Active Speaker Detection in the Wild,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.600233Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:497968602f2853a55bdf17c009dd69c51d0d265fb6e9935c74f8385d0af4167d","observation_id":"04974023-5009-4843-8fbd-f24c2d8d0f4f","resolution":{"observed_at":"2026-08-08T17:09:18.600233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.605275Z","title":"A Light Weight Model for Active Speaker Detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.605275Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:b03caf9681577c2f7968462b7ced52eaf9b02f7b25de531f531ea0823b851bcb","observation_id":"eb15f594-52b5-4eb8-a1a7-cfaff91a8646","resolution":{"observed_at":"2026-08-08T17:09:18.605275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.609862Z","title":"LoCoNet: Long-Short Context Network for Active Speaker Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.609862Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:9fd533f3c42fcae306c436d99a88fec955c32d14ba7f7ba72ac6e34ea385dd99","observation_id":"672bc6f7-3ec5-4460-969d-ccaff54edcc4","resolution":{"observed_at":"2026-08-08T17:09:18.609862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.615111Z","title":"Learning Long-Term Spatial-Temporal Graphs for Active Speaker Detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.615111Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:25229bd5d0846db85ffccbd2a644859724c5c9c2b309087ce3e987725f6276f7","observation_id":"1ba33c77-cfdf-4790-afb3-92d924c42c6a","resolution":{"observed_at":"2026-08-08T17:09:18.615111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.619710Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.619710Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:424fb07ebb13f4858c33abd6148ee2237a0d2af283c91ca57863247a94ade70f","observation_id":"7985d78f-7386-4bc4-bfe9-64a21de0d797","resolution":{"observed_at":"2026-08-08T17:09:18.619710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03793","last_updated":"2022-06-25T02:12:45Z","snapshot_observed_at":"2026-08-03T10:48:27.819209Z","submitted_at":"2022-04-08T00:49:19Z","title":"Personal VAD 2.0: Optimizing Personal Voice Activity Detection for On-Device Speech Recognition","version":3},"cited_work":{"arxiv_id":"2204.03793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.03793","snapshot_observed_at":"2026-08-08T17:09:18.758845Z","title":"Personal VAD 2.0: Optimizing Personal Voice Activity Detection for On-Device Speech Recognition","venue":"eess.AS","work_id":"87ed1c65-7900-4b5a-af00-cd95def8e01f","year":2022},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.624973Z"},"links":{"cited_paper":"/paper/2204.03793","citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:1511acb4e61e9110af5e5c22b03def876e9478df953a29574e97dacd24caa1b4","observation_id":"a9c9d624-29e9-44ae-9f97-53500061f0d5","resolution":{"observed_at":"2026-08-08T17:09:18.766401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.899595Z","title":"Efficient Personal V oice Activity Detection with Wake Word Reference Speech,","venue":null,"work_id":"9ee244aa-f85f-4423-8c03-820da403dafa","year":2024},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.631171Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:c2ac9b12da92931ab053a075ca85e58207d76686520283b18ba7b74f1c4416e3","observation_id":"7eda9495-fd1b-4522-bbbf-c9191089d911","resolution":{"observed_at":"2026-08-08T17:09:18.904791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.636126Z","title":"V oxCeleb: A Large-Scale Speaker Identification Dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.636126Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:ef9d19adf08bea12b85b07997b8737890d28a8a86e7f1b1025b0e9a80720d422","observation_id":"9fe9b316-a7de-4906-a1bf-4b9883193f88","resolution":{"observed_at":"2026-08-08T17:09:18.636126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.881871Z","title":"Ring Loss: Convex Feature Normalization for Face Recognition,","venue":null,"work_id":"46ebb4a1-635a-4184-bcbb-6a0d80b1cf49","year":2018},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.641060Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:4c5454433e93593d67d6d62110295dfcea78200bb7658522341e89212e5cfe84","observation_id":"b8792db4-8364-4ab7-9d03-35e7e6946e63","resolution":{"observed_at":"2026-08-08T17:09:18.887481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.864548Z","title":"ArcFace: Additive Angular Margin Loss for Deep Face Recognition,","venue":null,"work_id":"af2c4a1a-14e7-4dd9-bfe8-17680ff8e5f0","year":2019},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.645922Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:133f5f404a89597ae7a85e1aa6370e2b3d24ecaa5ca400720209618d5bd8c350","observation_id":"1c34fe6a-207f-4beb-a411-a14f2c7ce986","resolution":{"observed_at":"2026-08-08T17:09:18.870149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.847732Z","title":"SphereFace: Deep Hypersphere Embedding for Face Recognition,","venue":null,"work_id":"3beaeff4-6e32-4d95-88b7-3765c83f280a","year":2017},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.650052Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:a04e7139476401c324493b60877bf822faf96d47290a3f1937b2e1ad1abed22d","observation_id":"786bcc82-f5bf-4bc3-acaa-a9ff2a5cfed2","resolution":{"observed_at":"2026-08-08T17:09:18.853270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.830151Z","title":"CosFace: Large Margin Cosine Loss for Deep Face Recognition,","venue":null,"work_id":"bc7ee9c6-0126-42c0-9900-09e0ca0ef476","year":2018},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.655038Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:27416698ed7cfbe774916f3af4b8e3faf10d5d87cea95950b8cca2399ba58075","observation_id":"e72199d4-0acd-4d42-85b9-72cdffc84cec","resolution":{"observed_at":"2026-08-08T17:09:18.835514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.814494Z","title":"Partial FC: Training 10 Million Identities on a Single Ma- chine,","venue":null,"work_id":"16723f0a-3eb0-4b95-9690-d544c49dde86","year":2021},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.660952Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:0be4f511d3dec25415e028720350542c11e12f2508215eab53af6e92ccfbaa36","observation_id":"599cbf32-1274-4f73-a393-10805583039d","resolution":{"observed_at":"2026-08-08T17:09:18.819850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.798707Z","title":"Attention is All you Need,","venue":null,"work_id":"106e2a1f-a64a-44ed-9531-b74381c2653b","year":2017},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.665695Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:53ccc56352f5f890711dda721286a9d22299f44a6266249fb2fc209b0822c3a6","observation_id":"72c51122-fd47-4229-8770-65d107bced6b","resolution":{"observed_at":"2026-08-08T17:09:18.803865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.670905Z","title":"Robust Object Recogni- tion Through Symbiotic Deep Learning In Mobile Robots,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.670905Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:7a3297a4728521c0dce66315b1debd02b159883020f96b2e63ced0d9aefeb2e8","observation_id":"497d1872-2ede-461d-b85a-85a0398a7510","resolution":{"observed_at":"2026-08-08T17:09:18.670905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:09:18.675378Z","title":"The PASCAL Visual Object Classes Challenge 2012 (VOC2012) Results,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.675378Z"},"links":{"citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:8b161ae65276f39f9dc50c55f14c80f3ed39fc40f1d1019e28c909d9b1f0a45a","observation_id":"a683ce62-4341-4bca-9986-5edeae446089","resolution":{"observed_at":"2026-08-08T17:09:18.675378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01467","last_updated":"2023-07-04T04:12:49Z","snapshot_observed_at":"2026-07-06T15:49:58.951341Z","submitted_at":"2023-07-04T04:12:49Z","title":"Technical Report for Ego4D Long Term Action Anticipation Challenge 2023","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01467","snapshot_observed_at":"2026-08-08T17:09:18.680337Z","title":"Technical Report for Ego4D Long Term Action Anticipation Challenge 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T17:09:18.680337Z"},"links":{"cited_paper":"/paper/2307.01467","citing_paper":"/paper/2502.06012"},"observation_digest":"sha256:9231760234a68f51d2bcf0cf995a947109558147c1e75b82afe97b57a35dc117","observation_id":"23a06e36-1d2c-49dd-80aa-aab1d90798dc","resolution":{"observed_at":"2026-08-08T17:09:18.680337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06012","last_updated":"2025-02-09T20:06:42Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-08T17:00:04.051319Z","submitted_at":"2025-02-09T20:06:42Z","title":"Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2502.06012."}