{"as_of":"2026-08-08T17:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2139ecafdc8b97882fd2355dd429370719b1a4f12cf43bc5fafcfd89afdc5ea1","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:22:33.855186Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:22:33.800538Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:22:33.897531Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"cited_work":{"arxiv_id":"2506.02621","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02621","snapshot_observed_at":"2026-08-07T11:22:33.897531Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","venue":"cs.SD","work_id":"2d75fba2-7101-4ce3-9c0f-c4519ea14e1a","year":2025},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.800538Z"},"links":{"cited_paper":"/paper/2506.02621","citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:c335da61d3389750ecefb87dc73d660176d60caf9ce1f4c3b1b2b2ea9ea42f28","observation_id":"d29ae572-290a-4af6-a04e-b49e96285b6b","resolution":{"observed_at":"2026-08-07T11:22:33.902143Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02621/citation-record","integrity":"/paper/2506.02621/integrity","json":"/paper/2506.02621/citation-record.json","paper":"/paper/2506.02621"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:34.051409Z","title":"who spoke when","venue":null,"work_id":"36ae85a1-d139-4604-b5e8-0c2fa7bb642d","year":2025},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.797631Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:8de08560663a93a8f0bb6ba99a27e2eba5259db176cde5c1ac829318c17dbfb6","observation_id":"fab3ca24-502b-419c-9be1-38fa1a349c64","resolution":{"observed_at":"2026-08-07T11:22:34.053819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"cited_work":{"arxiv_id":"2506.02621","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02621","snapshot_observed_at":"2026-08-07T11:22:33.897531Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","venue":"cs.SD","work_id":"2d75fba2-7101-4ce3-9c0f-c4519ea14e1a","year":2025},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.800538Z"},"links":{"cited_paper":"/paper/2506.02621","citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:c335da61d3389750ecefb87dc73d660176d60caf9ce1f4c3b1b2b2ea9ea42f28","observation_id":"d29ae572-290a-4af6-a04e-b49e96285b6b","resolution":{"observed_at":"2026-08-07T11:22:33.902143Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:34.043633Z","title":null,"venue":null,"work_id":"f30178fb-0f50-4d67-87ba-3814e253d2f9","year":null},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.802860Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:f29da90e2756fc51a8364429408952168ad7f0f30be1a36b36dc6c88ccc0518a","observation_id":"6efa947d-af13-4159-a609-e8f6928a1cb3","resolution":{"observed_at":"2026-08-07T11:22:34.045971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:34.035567Z","title":"The following section details the experimental process","venue":null,"work_id":"39a0473f-eb2a-4da4-87cd-10f857285d58","year":2025},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.805196Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:a29d010f05d8855a84b0704ae7eb0bce713aa7d50ebc544f74083250dc5ef239","observation_id":"813eb818-8e8c-4040-8e41-3095ef776a03","resolution":{"observed_at":"2026-08-07T11:22:34.037967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:34.019535Z","title":"As systematically sum- marized in Table 1, the experimental results reveal critical in- sights about the structure design of our proposed system","venue":null,"work_id":"11ba01f4-7fd3-41bd-b7d3-f221663d4237","year":null},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.809658Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:5d7da393c45bb62bc8d8884af3d8d838bee16efb9b2ddbcf5fedb0e06b0b0ab0","observation_id":"b8a5e896-bc1a-4e2c-a079-45b94f9b97f2","resolution":{"observed_at":"2026-08-07T11:22:34.022230Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:34.011480Z","title":"Our system employs a CASA-Net based architecture to effectively address the temporal misalignment between audio and video streams","venue":null,"work_id":"2da416b1-526e-4caf-9b29-f9ab69029a3f","year":2025},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.811872Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:7ed03514e5a7d7d9a43772be134bde5393539e6d5e53f0ecac2bea9a5ce3089c","observation_id":"d93551e3-2a44-4c97-9b49-4d99905b864a","resolution":{"observed_at":"2026-08-07T11:22:34.014100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:34.003590Z","title":null,"venue":null,"work_id":"36dfd86c-a15f-4014-9153-a93070d1bb20","year":null},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.814050Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:d68bd0c3578d29ab48c876bee9f43db039c3456138faad79e894635a59d1b5de","observation_id":"dde30f6a-bb72-4ad5-b9c4-b2c2cd10e08a","resolution":{"observed_at":"2026-08-07T11:22:34.006241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.966754Z","title":"Lip-reading with densely connected temporal convolutional networks,","venue":null,"work_id":"00ebd7e2-450f-4dbb-81f9-0f69889067f2","year":2021},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.831767Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:f4f6c6c8e325cffaee27324488b02a7aeb9ce46a513f4be23782a6cfe03fffef","observation_id":"005ecd68-fbdd-4013-88f9-7576ca35d92a","resolution":{"observed_at":"2026-08-07T11:22:33.968967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.816145Z","title":"A review of speaker diarization: Recent advances with deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.816145Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:efbc593518f50d2cb3ecffa4ab81d4bc8ebda1546eb1e7e507139d08bf958381","observation_id":"c3375b31-1f74-4659-90cd-4c88c0e9799a","resolution":{"observed_at":"2026-08-07T11:22:33.816145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05815","last_updated":"2020-12-02T20:14:57Z","snapshot_observed_at":"2026-07-06T09:27:40.943546Z","submitted_at":"2020-06-04T22:23:10Z","title":"Third DIHARD Challenge Evaluation Plan","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05815","snapshot_observed_at":"2026-08-07T11:22:33.818144Z","title":"Third dihard challenge evaluation plan,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.818144Z"},"links":{"cited_paper":"/paper/2006.05815","citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:c9bef94ec3d4ff973c74acfdaae820581319a1c7c038aed7d9f36492829ae52d","observation_id":"729bffa0-15a4-4d6b-8083-8929c0a0f430","resolution":{"observed_at":"2026-08-07T11:22:33.818144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.820620Z","title":"End-to-end neural speaker diarization with self- attention,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.820620Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:3d7f359e698db70b573504423e36c68dabb2ed9ba9c9d746ce11fe7f86f0432a","observation_id":"3d7e0728-8464-4173-9aa1-3292d319f31a","resolution":{"observed_at":"2026-08-07T11:22:33.820620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07272","last_updated":"2020-07-27T13:28:20Z","snapshot_observed_at":"2026-07-06T09:20:29.047590Z","submitted_at":"2020-05-14T21:24:56Z","title":"Target-Speaker Voice Activity Detection: a Novel Approach for Multi-Speaker Diarization in a Dinner Party Scenario","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07272","snapshot_observed_at":"2026-08-07T11:22:33.822865Z","title":"Target-speaker voice activity de- tection: a novel approach for multi-speaker diarization in a dinner party scenario,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.822865Z"},"links":{"cited_paper":"/paper/2005.07272","citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:4461222433f886090fa63e00c139c8c5b1a4d5cf0c157aa561a903d2f4872aef","observation_id":"000ba6c1-e9ef-40b0-bc81-df1e95be6660","resolution":{"observed_at":"2026-08-07T11:22:33.822865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.986034Z","title":"Quantitative as- sociation of vocal-tract and facial behavior,","venue":null,"work_id":"81448669-05a9-4358-b7dc-e3a9bcbc016a","year":1998},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.825337Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:34748c0ff4611e0a9874c0d2ae10840175157eea825cd759cf88ec604b0fffac","observation_id":"4e15dd08-a109-4f45-b0a3-7b454f95b7b9","resolution":{"observed_at":"2026-08-07T11:22:33.988487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.827666Z","title":"Hearing lips and seeing voices,","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.827666Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:c71c5c4c93e168afb1589440899b1e2ddac431044906edc6937f1bf9bc8c7d2c","observation_id":"e46eb867-0dd9-4300-8a41-dd47fd5b8344","resolution":{"observed_at":"2026-08-07T11:22:33.827666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.973344Z","title":"End-to-end audio-visual neu- ral speaker diarization,","venue":null,"work_id":"2b30c002-c8e2-4925-b72c-3137fd827e53","year":2022},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.829796Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:a6f993e94ce6a85b62644589ccfd667f68c5fc9a58b927d77363b2165c58f291","observation_id":"8826359e-a9c4-4804-bc47-996bda482777","resolution":{"observed_at":"2026-08-07T11:22:33.975941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.927455Z","title":"Two-dimensional digital signal processing ii. trans- forms and median filters","venue":null,"work_id":"9a45790b-17b0-4196-92d6-37124dff642c","year":1981},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.849115Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:867f7ccbcbe5d39357af01b02817093278192835946c28ef92d48e89d33695af","observation_id":"e7d8a6d7-d312-4255-b5d8-a321eef0a2c4","resolution":{"observed_at":"2026-08-07T11:22:33.929994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.960097Z","title":"Effi- cient video transformers with spatial-temporal token selection,","venue":null,"work_id":"ad25dda1-9a39-42e2-b6bf-484804255235","year":2022},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.833814Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:1799fc8673c38b21367d79d2b0599981d885f5d8e239631b65a1f1be21fd0d0d","observation_id":"a792821e-9f4e-4ce1-adfc-6a40bfff133e","resolution":{"observed_at":"2026-08-07T11:22:33.962692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:34.027667Z","title":null,"venue":null,"work_id":"d18daf38-3451-44a5-9984-dd8366489336","year":null},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.807428Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:e7a18fe441753ba7e584bd23b5cb852dc3681ef693fed2a4477f0e205a9372ad","observation_id":"38799ece-1203-44f4-92b3-1388b51d7da3","resolution":{"observed_at":"2026-08-07T11:22:34.030114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.953315Z","title":"Spatial-temporal transformer for 3d point cloud sequences,","venue":null,"work_id":"5b94b725-f2cb-47b3-a482-0eddef1e8095","year":2022},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.835810Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:627d600839abe283f26dc78a84c67c8803cff7c10b4f184e03395c717ac22c38","observation_id":"f67cf190-a492-4898-9b9c-fd1d4aed0bbd","resolution":{"observed_at":"2026-08-07T11:22:33.955635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.947179Z","title":"Casa-net: Cross- attention and self-attention for end-to-end audio-visual speaker di- arization,","venue":null,"work_id":"416bcc92-5a7c-437c-9c4a-f950fd253b89","year":2023},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.837806Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:b52be979c73cce45de0abe6371f53bef31ef847e2b6eb12c5a29af69cfa1a325","observation_id":"35e3fe57-538d-4bc4-9419-50ad2c8b995f","resolution":{"observed_at":"2026-08-07T11:22:33.949219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.941298Z","title":"Cn-celeb: a challenging chinese speaker recognition dataset,","venue":null,"work_id":"d60a94f7-4a0d-4263-815a-58b373180fc9","year":2020},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.839631Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:527564fc8743a199755f79ba2dc71f2e6a145068d83601e84dcdff07df2d40db","observation_id":"61685412-a2f1-4718-bd43-e6e713595bb6","resolution":{"observed_at":"2026-08-07T11:22:33.943457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-07T11:22:33.841668Z","title":"Ecapa- tdnn: Emphasized channel attention, propagation and ag- gregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.841668Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:e536c0ca3f5378852b1516088626b49a2f500a35aa12579acd1aeb3004772db2","observation_id":"319d2cf7-7e97-44a8-9d20-e8b7dc036938","resolution":{"observed_at":"2026-08-07T11:22:33.841668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-07T11:22:33.843913Z","title":"mixup: Beyond empirical risk minimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.843913Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:9928df5cb0c4d404aff9e562c88199298e7872561bdb849c09bd7b8565f7a3d1","observation_id":"ff073869-f20e-474a-998a-6f2ff1fa2a6d","resolution":{"observed_at":"2026-08-07T11:22:33.843913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.934566Z","title":"Augment on manifold: Mixup regularization with umap,","venue":null,"work_id":"97137a08-0426-4e50-969a-486368004101","year":2024},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.846607Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:251671a248e677ea59b5aedaf02d0175040f5b976f04c85baa0d08cebdf8f4d7","observation_id":"14c6b715-6782-4aa0-b566-8a7a65f08f94","resolution":{"observed_at":"2026-08-07T11:22:33.936894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.920589Z","title":"A quan- titative comparison of overlapping and non-overlapping sliding windows for human activity recognition using inertial sensors,","venue":null,"work_id":"5067c2c1-11b5-4572-a177-39b6c391effb","year":2019},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.851034Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:a2a17c8a1f83a2effd40c71cee02fc6b3c4bc03bc44f3ec461d47a73945b2064","observation_id":"862fc651-a6be-4aad-af1d-23f422f6e317","resolution":{"observed_at":"2026-08-07T11:22:33.923158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.913774Z","title":"Nara-wpe: A python package for weighted prediction error dereverberation in numpy and tensorflow for online and offline processing,","venue":null,"work_id":"8e19e359-e73f-4ac3-9681-f780c9d9f8f3","year":2018},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.853114Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:ce87598837fe68862078d5a002e85a0ac608a3a24778d97b6a1089f5a09d2f2b","observation_id":"76dcd54b-2d2b-4b58-a013-9563d114801f","resolution":{"observed_at":"2026-08-07T11:22:33.916141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:22:33.907148Z","title":"The kaldi speech recognition toolkit,","venue":null,"work_id":"d292099b-3aa2-40ae-a6c8-d8f9aaa14943","year":2011},"citing_paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:33.855186Z"},"links":{"citing_paper":"/paper/2506.02621"},"observation_digest":"sha256:8d43f7ec0b2b5d26ce0c1ea249635fd3b3e6f58f6462e13a669e2c02abdd335a","observation_id":"6e023b80-e3bb-4422-8979-b031308f83fa","resolution":{"observed_at":"2026-08-07T11:22:33.909403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02621","last_updated":"2025-06-03T08:38:05Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T15:21:59.759970Z","submitted_at":"2025-06-03T08:38:05Z","title":"Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2506.02621."}