{"as_of":"2026-08-08T13:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dad6605369b505fbbe1fa6f4e8a1705eefa382d27fba9e768ab7a7c447e7aa84","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:30.416983Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12972/citation-record","integrity":"/paper/2507.12972/integrity","json":"/paper/2507.12972/citation-record.json","paper":"/paper/2507.12972"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:42.679221Z","title":null,"venue":null,"work_id":"34b3b39c-fe1c-4ac8-8523-c692aa29e44f","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.292465Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:6a15ba5e05654805db74aa588bfb2dc22e125d60b6887b578c7852cee16be11a","observation_id":"13db9811-5019-4320-bacd-715bcdb928b9","resolution":{"observed_at":"2026-08-06T16:39:42.808432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:42.423884Z","title":null,"venue":null,"work_id":"a7b57e05-0b76-4dca-ab04-7d571aa835b4","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.422134Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:b53949caa22b00df255d43127586883a26181fc5dd3a966cc34d11b053d14c15","observation_id":"4c4bd378-f56a-4b3c-8d08-4b78d5210fe0","resolution":{"observed_at":"2026-08-06T16:39:42.486362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:42.236715Z","title":"Chandrakala, S","venue":null,"work_id":"78069662-8ab0-4344-b6b7-1b445e9268b5","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.565716Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:04c51747096458b15648d352f578c910e7e535cc12e1caef7b0a0092f96d3968","observation_id":"b481f230-b287-4cec-adfa-bae3222df5de","resolution":{"observed_at":"2026-08-06T16:39:42.315057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:42.095672Z","title":null,"venue":null,"work_id":"d7867e86-ce1d-4403-b222-3a79a9ffe49c","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.694830Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:be70bd3befcbe1a005cbe3bb4898c8d4d437734f78cb62e2b3bc05f067954eb6","observation_id":"c24eb212-5f7b-42c4-bb0f-117a35d7dc06","resolution":{"observed_at":"2026-08-06T16:39:42.161682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:41.922555Z","title":null,"venue":null,"work_id":"2f709bae-c01f-473e-b8b9-70ae129aa3a1","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.832403Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:194f5b338382a04139f24739bfe23e48a3781b69882ce15f30f12c55e6a613b0","observation_id":"a812640c-9f7d-411a-9514-7edbffc8ce41","resolution":{"observed_at":"2026-08-06T16:39:41.992774Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:41.660077Z","title":null,"venue":null,"work_id":"d8822b43-aac5-4396-97ce-b289f4dbdf8f","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:23.969878Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:5d6e059dc12d141f20cf1bd6e8807bea85d507a0c34e388b9e81ef1d36c87d75","observation_id":"523d4da3-75c3-4ff8-8fb2-24808cd255d2","resolution":{"observed_at":"2026-08-06T16:39:41.807829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:41.489747Z","title":"Subakan, M","venue":null,"work_id":"cf5c7370-6191-4671-acec-d9de8f8294cc","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.112678Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:e7a6aaeb116575bc766836dd80df1beddfb2b2115eed41cbe7d00ec8ca34f8c3","observation_id":"a193ad77-88ae-46dc-b8b2-11d92b3d4ce2","resolution":{"observed_at":"2026-08-06T16:39:41.584746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:41.324830Z","title":null,"venue":null,"work_id":"547b5ee1-c730-4577-8e1e-91e5973f0031","year":2024},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.236125Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:f0e63b999b3f82b37d4052588cfbe095d7ba40652f060ad3df8b0cd8e271dec1","observation_id":"0295f807-8ad9-4646-83be-4ec091bde6f5","resolution":{"observed_at":"2026-08-06T16:39:41.396084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:41.170752Z","title":"Subakan, M","venue":null,"work_id":"cb33eec6-7c48-4344-965e-35c575a0cbf2","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.362454Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:d2d2e6e90c5d2c2395089cd621d9b2d660e272c4315187d13ec75407259e7093","observation_id":"627fb8ec-95e4-4623-bd39-17cfc74c8349","resolution":{"observed_at":"2026-08-06T16:39:41.244947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23212","last_updated":"2025-06-02T05:22:31Z","snapshot_observed_at":"2026-08-07T12:48:33.153516Z","submitted_at":"2025-05-29T07:54:07Z","title":"Interspeech 2025 URGENT Speech Enhancement Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23212","snapshot_observed_at":"2026-08-06T16:39:24.509900Z","title":"Saijo, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.509900Z"},"links":{"cited_paper":"/paper/2505.23212","citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:d89e62b185c97ba5bcc85248e67c3163fa0c766d497592a9e9617a0d45e5354d","observation_id":"d356d095-3c46-4204-af21-f40e91bee614","resolution":{"observed_at":"2026-08-06T16:39:24.509900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.888103Z","title":null,"venue":null,"work_id":"5eb63411-e86f-45c2-8dce-302d2b73a295","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.642132Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:9b4a924ceb8810da6b592001dce75bc32d37e70a97c572354551cab1ef6e3b13","observation_id":"26df92ea-9931-41d0-a738-e0d957c2654e","resolution":{"observed_at":"2026-08-06T16:39:40.983053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.744316Z","title":null,"venue":null,"work_id":"5651c30c-e4ae-4973-b4f4-0bc068bf66aa","year":2016},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.807794Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:e28294c1cece113990010416a43700349a42874ed282d7ee6a8346797181ce64","observation_id":"d183db5e-05c7-4ea0-883f-214d28055f5d","resolution":{"observed_at":"2026-08-06T16:39:40.815330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.605880Z","title":null,"venue":null,"work_id":"1b90343e-4721-44bc-9294-8ee295e935db","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:24.960813Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:47c7b1202b5da366fcb8d6d07b99caacb6223af67face3e1fd402443c326a0b0","observation_id":"4ed9b517-61ab-4d1b-9fba-2c188e1a1667","resolution":{"observed_at":"2026-08-06T16:39:40.665168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.477745Z","title":"Martel, J","venue":null,"work_id":"7c95615d-0645-40fa-9a85-51bf7cff8c9c","year":2023},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.128777Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:329634d513f0ccddad945c031c8f58f406dda3106015deb29f7a020a186381ee","observation_id":"2a4a0964-70c1-4c00-8fba-2efe31cec9d0","resolution":{"observed_at":"2026-08-06T16:39:40.528451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.333625Z","title":null,"venue":null,"work_id":"e0213fc6-573d-4f64-90e8-6275fb0560d5","year":2024},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.280041Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:021d9a6ae7df53d66aa46f215e7fc5dd33fb0ac91428c52321adf5d92f96e4d2","observation_id":"b9e4faef-a416-4992-b5d0-c325ec7ffb00","resolution":{"observed_at":"2026-08-06T16:39:40.397577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.200986Z","title":"Vasantha, B","venue":null,"work_id":"e1dcedfb-acee-4906-ba98-5c3a50bca9b3","year":2023},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.482813Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:390408e36935d65b38ac0290a8b859af07e025dc503c57f0a73cc39576907f93","observation_id":"7512a799-4c86-4996-bbcf-f446b8199daf","resolution":{"observed_at":"2026-08-06T16:39:40.266496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:40.055940Z","title":null,"venue":null,"work_id":"9812d7f0-1b07-4401-aeeb-2e6addeecc81","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.682663Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:504b97a6d1322e9262897a6d48848cf989819effe69fa4c99983f29701cc7fdd","observation_id":"f5ac9de3-4e55-48cf-9c5d-97f45693efcb","resolution":{"observed_at":"2026-08-06T16:39:40.113315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:39.872073Z","title":"Nachmani, Y","venue":null,"work_id":"864f77bc-917e-4480-ac8c-9d34dff7902b","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.844324Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:4dae3171ac447fde44dfc7889b52041e6015477cf66ac855c62d918f5087c654","observation_id":"f7ecc4df-ff7c-4f41-b52d-5db362db1d8f","resolution":{"observed_at":"2026-08-06T16:39:39.960410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:39.652502Z","title":"Kinoshita, L","venue":null,"work_id":"5d7610c0-592b-4338-bab4-f40ad37637cd","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:25.941030Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:f3938c75232019f5e24c32854a2b47d8266fdf61beb2c3f4f242c50c147058e3","observation_id":"85c60829-c943-4c1a-9b36-4eaccf9bacd7","resolution":{"observed_at":"2026-08-06T16:39:39.775851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:39.396021Z","title":null,"venue":null,"work_id":"3fe8f1e3-639e-4232-a4cd-55ad1e67ebc5","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.087979Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:f1a0d072bd06d5d827876d2897cfb5a181af3e5a62fe7af8cc1f14ee4f7d1396","observation_id":"312f4232-3c17-4011-a33c-87537f049147","resolution":{"observed_at":"2026-08-06T16:39:39.520180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:39.205131Z","title":null,"venue":null,"work_id":"29a39dec-7979-4034-b8b3-1f2fffdd74c2","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.286640Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:1e59baaaf9cb4091fc315d9b70ef7c3de8cd16fcab22ee95d937f1e759707eab","observation_id":"a3b376fb-1cc7-4318-a5ad-710567894d89","resolution":{"observed_at":"2026-08-06T16:39:39.325696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:38.963035Z","title":"Takahashi, S","venue":null,"work_id":"10524892-fa09-4e03-b75f-0e5896a939cc","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.414258Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:08b833dc299ab444dc5ee75cb93112820b4ff2e91845c46ee7135ef9a7850e4c","observation_id":"d4f5deb6-e3c1-4c78-b4d5-e9dba5c2e3dc","resolution":{"observed_at":"2026-08-06T16:39:39.091124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:38.688397Z","title":null,"venue":null,"work_id":"3d272184-1054-4242-9886-9e7b4fe750ce","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.513462Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:3e13a9486a8b6fa36cdc2ac5813b99b6e9345e47b0443398ce69f9918e3fa59c","observation_id":"2d40a766-91a0-4bcc-be80-c21facb48983","resolution":{"observed_at":"2026-08-06T16:39:38.789085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:38.395211Z","title":"Maiti, Y","venue":null,"work_id":"3f158169-ad9d-49a8-a40d-0fccfa7eebe9","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.591126Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:734bc1975bd86b16053a36cffee72b4666d95a4d523dafb381f0422821c5de62","observation_id":"e6222d8a-e207-44c9-bfc4-ed363d15e8b2","resolution":{"observed_at":"2026-08-06T16:39:38.549581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:38.104554Z","title":null,"venue":null,"work_id":"795d2a95-7eaa-437a-9b95-9a52b459dcbf","year":2024},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.764311Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:d5e968e7be2822f4937596cdd6c5f94d6aa6235a51d2572dcd2aad0a045bbb2c","observation_id":"722fd7fb-1513-4dc7-808f-730906f87e31","resolution":{"observed_at":"2026-08-06T16:39:38.254977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:37.864767Z","title":null,"venue":null,"work_id":"a406c945-409e-4667-82f8-39a6f8860ca0","year":2023},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:26.950587Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:9889796a1e4ef17eb1847286ccdca493476a115fd8a3f470546ca3c7834b38b5","observation_id":"51fe5d4b-3ce3-4696-9a61-9ab4f1e71b9e","resolution":{"observed_at":"2026-08-06T16:39:37.957518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:37.561349Z","title":null,"venue":null,"work_id":"02e0d95f-002c-4f60-81e1-3ac8664ca496","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.085101Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:68ff0b767db0687bc37afc941b3b4685eda755297197cd860c8c345457a03af7","observation_id":"a2128611-1b83-46e1-a3bb-1b13fffe3fd3","resolution":{"observed_at":"2026-08-06T16:39:37.705890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:37.289559Z","title":null,"venue":null,"work_id":"65d8366a-a0a6-43e2-b4a6-1b71379fcea7","year":2023},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.204907Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:680839225ce3efaa706571670e390ca210434cc13ea5c5dc3c00d67e3dbba3a5","observation_id":"829d4c2a-aa41-4678-9d7d-988f4b347af8","resolution":{"observed_at":"2026-08-06T16:39:37.413831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:37.049732Z","title":null,"venue":null,"work_id":"1f6f1225-0b27-4ef1-a359-881ea2d4f77f","year":2025},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.366696Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:3f0bfc7e4c64d678bced2f6158d19b190f7d29081baa69a54ceac408d43e06a8","observation_id":"476d379b-e17b-4416-bb48-2c74ff1036af","resolution":{"observed_at":"2026-08-06T16:39:37.161955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:36.738121Z","title":null,"venue":null,"work_id":"d203b3e7-e750-480a-9b64-9ba6c6a16366","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.526114Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:bd1b280f1939ff50251f1a3626bd43c9fff24b64daad78efd393b554582a51e4","observation_id":"1875d8f8-2e6d-4f8b-af5a-6291b53e01f6","resolution":{"observed_at":"2026-08-06T16:39:36.859971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:36.468470Z","title":null,"venue":null,"work_id":"21451382-3073-4e9d-b0d1-dae4a34030ae","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.633720Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:a5eae04bfe9d4d60b7539de61b5598c01d0de31b9a9de7b29cff4e232926c244","observation_id":"307158e5-d9f7-4351-abea-b75f5f5d27cb","resolution":{"observed_at":"2026-08-06T16:39:36.595850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:36.149547Z","title":null,"venue":null,"work_id":"538506c8-36ae-4a70-bdb9-e151ffeb08fd","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.791840Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:306b8315b5cd084d5ce0a0bce00544dc5b3130091dbeb172eed6e02e89461f0e","observation_id":"e637f8c9-ce16-4a64-b13f-1a8849168926","resolution":{"observed_at":"2026-08-06T16:39:36.304600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:35.822767Z","title":null,"venue":null,"work_id":"b8b59866-1724-4c27-8ccf-1b59db7aa187","year":2024},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:27.938320Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:48dd3d0de60e3ccf8d137db95a2bf130c8dc8fa2c7fdfdb2eabef7a2314ad096","observation_id":"746430cd-cee3-4f55-bdd0-fd91da99de33","resolution":{"observed_at":"2026-08-06T16:39:35.979750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:35.550904Z","title":"Gulati, J","venue":null,"work_id":"41245f11-505a-42fb-bf66-743418f8c949","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.053643Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:72885ea4d45f7d22f0423e57e168d41bcedfb046937ae419121c500a17bbaa50","observation_id":"6cae72b4-2796-4489-ad49-d831a3482932","resolution":{"observed_at":"2026-08-06T16:39:35.678840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:35.217694Z","title":null,"venue":null,"work_id":"09819b0b-52ca-489e-a016-c35b676b1f66","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.176004Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:425d96b81d0bc0a088868fda80b73d8db4a9a994ef11e7caaa517402521d7232","observation_id":"0b2cda85-bc35-4ac8-9f0b-e0e0ecadaf0c","resolution":{"observed_at":"2026-08-06T16:39:35.406720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:34.871302Z","title":null,"venue":null,"work_id":"65944e73-9116-4cfd-803f-d213dd90dca5","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.368762Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:34dfdb0a7b2b5dde2a6e817b6ba7655134633fabdec3f2c3337b6df8b94134d7","observation_id":"f2241cca-996b-4dfa-8544-72bb7b4d8626","resolution":{"observed_at":"2026-08-06T16:39:35.031389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:34.609284Z","title":"Stenzel, J","venue":null,"work_id":"cd50251b-b2c5-46da-a35e-685d93f0f21f","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.517462Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:05203161c97713c91fdf8a2fbe6c9efe4cba4a3b7f9edb2ce88c4010fcbdf608","observation_id":"a465dc02-1c7f-40ef-8462-3d4ef894187d","resolution":{"observed_at":"2026-08-06T16:39:34.739409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:34.290858Z","title":"Lee, S.-W","venue":null,"work_id":"d3caa728-7941-47a1-af64-fc0420818e4d","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.633891Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:5ab8f0d130c2939026b8769505be1a293d9dbd202d22449d0b39d209df2d5c76","observation_id":"939a3825-8c7c-4fab-af36-92f170559fd6","resolution":{"observed_at":"2026-08-06T16:39:34.477770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:34.001831Z","title":"Ephrat, I","venue":null,"work_id":"3c73b934-75a5-465b-a788-9a15b714bf42","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.857285Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:b93477818aaf59d1aaa9979863a1d813a567051c813bf4898953bbd64e3058f7","observation_id":"9771d9c4-2b40-48ef-9350-e6c39a0548cf","resolution":{"observed_at":"2026-08-06T16:39:34.152073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:33.714736Z","title":null,"venue":null,"work_id":"2fec3a01-2c3a-4b7e-8dc5-04c07d09bf78","year":2021},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:28.976719Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:4919cd1b58ceea73537ac13ea5972cf7dad1561126183470397ecc7583e259e7","observation_id":"7e073eb0-fd0a-43dd-ac68-7564b09619a9","resolution":{"observed_at":"2026-08-06T16:39:33.845693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:33.449804Z","title":null,"venue":null,"work_id":"3a323f9f-96b7-461f-ac86-c93c0b037ed2","year":2022},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.147172Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:a695ec1c9d2f55654986fe74d19a97cc1639e3c32b681b8396ca8c5fcf4af029","observation_id":"0648571d-485b-4b2c-a681-70a976098eaf","resolution":{"observed_at":"2026-08-06T16:39:33.572830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:33.126118Z","title":"St¨ oter, S","venue":null,"work_id":"c4d8a59c-2372-4f91-ac35-ea871489c3f5","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.283361Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:d209a992521f10072c1f6406548f6ccd20a2323e00c97b65eee0599661073ec3","observation_id":"ea2f45e1-687e-49fe-aa0f-46d3b9f8d3bb","resolution":{"observed_at":"2026-08-06T16:39:33.291130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:32.798191Z","title":"Horiguchi, Y","venue":null,"work_id":"36c27050-18f1-47ef-ae3f-cc3b52364474","year":2020},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.388936Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:6211abaafaf337c38ac89c70464ab21e5f70e00ff9037dd092569afdd51a3f58","observation_id":"2703c658-5631-437c-bb7b-634bee467cbe","resolution":{"observed_at":"2026-08-06T16:39:32.919221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:32.427174Z","title":null,"venue":null,"work_id":"de747449-6001-491e-9338-921448489d06","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.521619Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:d9e469a157e108b9f44290b2ea0295ac93d737af634bec40fa78c87d6080bd72","observation_id":"d87fc097-f85f-4ef5-898d-97f46cb94f0a","resolution":{"observed_at":"2026-08-06T16:39:32.608825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:32.144451Z","title":"Afouras, J","venue":null,"work_id":"98b74b44-ee08-4d6a-a355-d25468b8ef51","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.723251Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:e0fee6990c9abb42157b7cc7a204be84d3491f58619b7e9f59ff37d795c7ca52","observation_id":"10360b23-f127-461a-b4d5-baf8994afe5b","resolution":{"observed_at":"2026-08-06T16:39:32.290734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:31.817760Z","title":"Le Roux, S","venue":null,"work_id":"d92af0cb-fc99-4425-9807-4d9de043c328","year":2019},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.845904Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:c1c93324f31785e8ec5c7d12a5ae29af268c9dee85be6f29cd08bf87ca5c3be6","observation_id":"43a4d791-8459-4f9b-8312-1a559045f7e0","resolution":{"observed_at":"2026-08-06T16:39:31.965617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:31.509862Z","title":"Kendall, Y","venue":null,"work_id":"5a8e3c56-8da4-482d-82ac-f01f856fda6c","year":2018},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:29.993154Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:858505e561315d1f2921ad88ae3525dd6c04ea5a3f7effad76b6badcbbb6a2aa","observation_id":"19052ed6-d406-4423-8c57-17fc5e7effb7","resolution":{"observed_at":"2026-08-06T16:39:31.666932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:31.205907Z","title":null,"venue":null,"work_id":"4b3bc720-f429-49fa-bbb3-c266529407e8","year":2025},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:30.163178Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:ea48c5dd1dc8e0b7b7d4c0477d6007b592b615bb2a9ee36aba18ca91ee7a2e60","observation_id":"30a0f8c5-0bb0-4671-ac8f-52ab585d6564","resolution":{"observed_at":"2026-08-06T16:39:31.336812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:30.931973Z","title":null,"venue":null,"work_id":"48689571-b8b0-4b20-bb03-7c6a8e47ebb3","year":2001},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:30.294530Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:2c377c078c53d61eefb2a7625361300433b92b72f384f679f3b703bbe767d3e4","observation_id":"136a992f-3ea4-4074-a4b3-1f596c717272","resolution":{"observed_at":"2026-08-06T16:39:31.053292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:30.645289Z","title":null,"venue":null,"work_id":"68064e8e-a8e2-42f0-a5bc-eaa0a184b8e0","year":2010},"citing_paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:30.416983Z"},"links":{"citing_paper":"/paper/2507.12972"},"observation_digest":"sha256:4c7741eea5624006196b39ea594a7a81c8b6ec26185884d1a7ed36f784e838a6","observation_id":"4d2d9edf-7aa2-46fb-ba4c-32d0035fe30c","resolution":{"observed_at":"2026-08-06T16:39:30.752031Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12972","last_updated":"2025-07-17T10:19:00Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T16:31:08.426551Z","submitted_at":"2025-07-17T10:19:00Z","title":"AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2507.12972."}