{"as_of":"2026-08-19T23:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e658d1fe0c6c488c2991f5650a892c49b092cfef060c533a21b26e9d6b02c89c","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:23:41.635307Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.01488/citation-record","integrity":"/paper/2412.01488/integrity","json":"/paper/2412.01488/citation-record.json","paper":"/paper/2412.01488"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.479791Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"dba527de-b919-4bde-b313-d306d714257f","year":2021},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.365557Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:a4aa125c0008172c7efa2068433397f1d6926bfe5cc8ba73e5efe274ccb9dc6e","observation_id":"e6e7773a-7197-48d7-94fb-c29b0d7da8fb","resolution":{"observed_at":"2026-08-12T04:23:42.485201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.463535Z","title":"Localizing visual sounds the hard way","venue":null,"work_id":"c9506096-fba7-4161-8284-92ff7422cfea","year":2021},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.371489Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:b7b8b4e1f6f25aaa6338fb660990112f1829023b1b47e909a97d34fc54d34668","observation_id":"2da26d9d-7167-467b-a525-caf0e041a8ed","resolution":{"observed_at":"2026-08-12T04:23:42.468994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.446437Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"2973c593-52ca-45ca-b2c7-fe89cd4bd4fe","year":2020},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.378005Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:cafb59eba55f1fa028c3b13ed82f03296b9567300a7424b115bb19d92e9ad2fc","observation_id":"67e6dbe0-b1d5-4eee-be42-36d42a8b93b6","resolution":{"observed_at":"2026-08-12T04:23:42.451434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.429734Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset, 2023","venue":null,"work_id":"2aff82b9-a082-4459-90e4-2596d0caa07c","year":2023},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.383816Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:c1973bd69ade8ee32c5465b651701e99211be89ca35aa0e9d219c1a15a92f986","observation_id":"8f790430-b373-4c93-a839-ff6924b20b6d","resolution":{"observed_at":"2026-08-12T04:23:42.434573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.412075Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"453d797a-84e3-4a5e-abfb-5de9cebee49e","year":2023},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.389017Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:160eda6e15cfdac0c1c499028b2047962ca9457dab04ce3a31b94d8dc7045ab6","observation_id":"be7389c0-8488-4d44-91d3-bbaa887a0bb1","resolution":{"observed_at":"2026-08-12T04:23:42.418177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.392230Z","title":"Meerkat: Audio-visual large language model for grounding in space and time","venue":null,"work_id":"bf2d406b-a463-4f55-ba00-931da5f5094f","year":2025},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.393789Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:5a8f4c2d91bb5170c50d1233552f3c852f113412bb4cb59ba64c57be75cc5ace","observation_id":"76edd49a-a693-4939-9fcc-f3d76e00b591","resolution":{"observed_at":"2026-08-12T04:23:42.397715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.374787Z","title":"Multilayer nonnegative matrix factorisation","venue":null,"work_id":"60e4afc0-07d4-4a5f-9969-8f422df90b71","year":2006},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.399495Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:55d4aa93fbf2f6b62d70d0a448a3a2d440776dd7be466048d41186f7139829e5","observation_id":"ac52431f-cea6-4b2b-85a6-6cc1bcd83f86","resolution":{"observed_at":"2026-08-12T04:23:42.379997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.358246Z","title":"Deep feature factorization for concept discovery","venue":null,"work_id":"d83be084-1bee-45c1-b324-418abdf1c9f7","year":2018},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.404938Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:94e377930db99058b45740f54b30886c87fb495dd0de7c8ff84f30e7755c473e","observation_id":"9bfa13ba-454b-4d59-a8d4-e989254fe9c9","resolution":{"observed_at":"2026-08-12T04:23:42.363505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06443","last_updated":"2015-12-15T04:29:39Z","snapshot_observed_at":"2026-08-14T22:22:07.038042Z","submitted_at":"2015-11-19T23:13:29Z","title":"Neural Network Matrix Factorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06443","snapshot_observed_at":"2026-08-12T04:23:41.411051Z","title":"Neural network matrix factorization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.411051Z"},"links":{"cited_paper":"/paper/1511.06443","citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:01cc2ff6820741a144091413da650a467c641ee04c56a6f4eee3eb991b787986","observation_id":"43db80ca-88b3-45ec-8b0e-0852439267b8","resolution":{"observed_at":"2026-08-12T04:23:41.411051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.339851Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":"a2c81ee8-5f15-410c-93e3-bc8d4b9e1f63","year":2023},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.416086Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:1f7612dc08823c3a631a9ac3301ae02e594b5485dbefa1d5cb8ce03ee7aa4e4b","observation_id":"2066cef2-5c37-433d-8131-9aae3db6beb2","resolution":{"observed_at":"2026-08-12T04:23:42.344663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.324872Z","title":"Avsegformer: Audio-visual segmentation with transformer","venue":null,"work_id":"a154e287-1a04-456b-9751-9e1871f8ddf9","year":2024},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.420719Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:281eabeea521959694ea14a7a548b9394c6020c1472298f2cbef843aec9b8e06","observation_id":"e77553b9-a849-4cd7-99f6-c81de089b320","resolution":{"observed_at":"2026-08-12T04:23:42.329719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.309546Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"02aa1ec6-196e-4ce1-9644-7855798d9e38","year":2017},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.425640Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:62f20967903390652f3f8f7a5b8f83d1bfadccc26515a82abb1ff3900fe086bf","observation_id":"f3cbbf35-8fa8-4d06-bc28-55fa4df9cf14","resolution":{"observed_at":"2026-08-12T04:23:42.314823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.291842Z","title":"The why and how of nonnegative matrix factorization","venue":null,"work_id":"13427dbc-6bf0-4944-bec5-b06f48cf9bfa","year":2014},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.431194Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:69a9a4fc5bd63dfd1145b3815352348d162e58727f9b1be5feedeef3ad6c877b","observation_id":"394d892c-586e-4ea6-92fa-e73e57718423","resolution":{"observed_at":"2026-08-12T04:23:42.297240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.435751Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.435751Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:4bd6b2524c014d5e24f66146e4cc92bd2ff8fdb0deb4bbd630b5a73c39d4a253","observation_id":"ab4b0125-4112-4438-8aa5-9e52508fe2c7","resolution":{"observed_at":"2026-08-12T04:23:41.435751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-18T11:14:43.411768Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-12T04:23:41.440713Z","title":"Contrastive audio-visual masked autoencoder","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.440713Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:c74611cfd487b12d5a56242182a21fcbeb95256b49ae848ca04f74ee94463e29","observation_id":"a983b572-ac08-48bc-a575-5ef48fcf5c18","resolution":{"observed_at":"2026-08-12T04:23:41.440713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.261702Z","title":"Single channel speech music separation using nonnegative matrix factorization and spectral masks","venue":null,"work_id":"b92821bc-c7d0-4eef-a7d3-607861a1dec8","year":2011},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.445696Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:a904dd718af10f3704033b93b848c2637b93cd191a90ff43552c4c8f0dc515f6","observation_id":"09c971e0-ce71-45dd-9998-ccf2ff70be83","resolution":{"observed_at":"2026-08-12T04:23:42.267080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.244828Z","title":"Non-negative matrix factorization for face recognition","venue":null,"work_id":"80695edd-c2ca-4378-b34f-120eeff7309c","year":2002},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.450214Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:3801deec276589dc9e98825764b009f07bc8459820bbaac65fd4620da6563117","observation_id":"a70468c1-e73e-4d8a-b01c-0f6802c3f190","resolution":{"observed_at":"2026-08-12T04:23:42.250748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.227298Z","title":"chirp\" from the","venue":null,"work_id":"ebe92146-620a-4f34-baa3-b247bcc39703","year":2024},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.455041Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:21e404e9fea12607503c46ab128c6729f9530e7b808093fc9f8e8a996af43d63","observation_id":"07f012fd-eed4-4236-9d3d-2f0d2baff75c","resolution":{"observed_at":"2026-08-12T04:23:42.233219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.211352Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"d0ce5222-f9ea-4440-92cd-d11aa9d14a99","year":2021},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.460373Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:ad25dd1759639a127cb89143e05e6137470987786f977dc6053c08993ae2c8a9","observation_id":"7e272c82-839e-4054-ac26-32fcd7b74da5","resolution":{"observed_at":"2026-08-12T04:23:42.216372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04355","last_updated":"2019-07-09T18:23:32Z","snapshot_observed_at":"2026-08-15T13:15:05.440895Z","submitted_at":"2019-07-09T18:23:32Z","title":"Transfer Learning from Audio-Visual Grounding to Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04355","snapshot_observed_at":"2026-08-12T04:23:41.465895Z","title":"Transfer learning from audio-visual grounding to speech recognition","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.465895Z"},"links":{"cited_paper":"/paper/1907.04355","citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:2d1b8b94cb2f5206cbef3eaf0e3b7e754261b838a12b1d1961936a814253c744","observation_id":"f537bdda-6134-4bdd-8480-0dd85db28d83","resolution":{"observed_at":"2026-08-12T04:23:41.465895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01020","last_updated":"2025-01-10T23:53:07Z","snapshot_observed_at":"2026-08-16T13:13:36.428683Z","submitted_at":"2024-10-01T19:28:45Z","title":"A Critical Assessment of Visual Sound Source Localization Models Including Negative Audio","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01020","snapshot_observed_at":"2026-08-12T04:23:41.473842Z","title":"A critical assessment of visual sound source localization models including negative audio","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.473842Z"},"links":{"cited_paper":"/paper/2410.01020","citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:28ba421f85270ea3fa6ad93f5d1fcd88cfc03f96fe8a2d7c6d2d8ea28dd5d096","observation_id":"cba18e4f-a2b0-4137-b677-8a65b7e2ad6a","resolution":{"observed_at":"2026-08-12T04:23:41.473842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.194407Z","title":"Algorithms for non-negative matrix factorization","venue":null,"work_id":"382815dc-3aaa-4061-983a-0049e9b8bcde","year":2000},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.478984Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:5c0ce561c489b5ed28929b47939307a4b9ad71f660f82b15247037c737442425","observation_id":"fd5de8c9-5f6d-4680-9409-9d29238e6539","resolution":{"observed_at":"2026-08-12T04:23:42.199422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.178301Z","title":"Unsupervised sound localization via iterative contrastive learning","venue":null,"work_id":"1af7406f-c049-4bef-ab41-a15d21d2a53b","year":2023},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.483918Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:52b92bbc334fa570b4a6effbc430305370d1c78990f3d701009103e8bad7f2e8","observation_id":"55ab5fa2-739a-4b4c-ba38-ce50bc4d74fc","resolution":{"observed_at":"2026-08-12T04:23:42.184269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.164041Z","title":"Audio-visual segmentation by exploring cross-modal mutual semantics","venue":null,"work_id":"cafe1755-447f-4b9d-b855-aebc055028cf","year":2023},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.489158Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:6fadc54aec27453eecbdd84eea96fded45f2258cfe32ce061cd153373c1e5d3e","observation_id":"c174fe3b-9ac8-49ea-9e27-4352b71c6c08","resolution":{"observed_at":"2026-08-12T04:23:42.168896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13236","last_updated":"2023-07-25T03:59:04Z","snapshot_observed_at":"2026-08-16T15:13:34.595814Z","submitted_at":"2023-07-25T03:59:04Z","title":"Audio-aware Query-enhanced Transformer for Audio-Visual Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13236","snapshot_observed_at":"2026-08-12T04:23:41.494188Z","title":"Audio-aware query-enhanced transformer for audio-visual segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.494188Z"},"links":{"cited_paper":"/paper/2307.13236","citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:29af73e6315cfe2b3d1160ef653e2f8f44d44669056f4c5fa457ed5d0ed43020","observation_id":"adea6297-dde1-4f77-ae3c-3ed2af783d06","resolution":{"observed_at":"2026-08-12T04:23:41.494188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.150382Z","title":"Exploiting transformation invariance and equivariance for self-supervised sound localisation","venue":null,"work_id":"1159b275-1875-4bce-a35a-28408093f826","year":2022},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.499270Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:541a60898a1454b56f0e66299db44b3d20382a944079dd0ec9d5b40fd58b9638","observation_id":"03102f43-292a-420b-836e-129cfb75311a","resolution":{"observed_at":"2026-08-12T04:23:42.154728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.136612Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":"e5dd312b-e76d-4157-9939-131364185949","year":2022},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.504042Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:03e875fb23caf0486ae00e0f7925ab46688ad014df3b2561be2556e7dc3b130d","observation_id":"dea00248-ac9b-4fdf-a823-d51478db0ec6","resolution":{"observed_at":"2026-08-12T04:23:42.141024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.122726Z","title":"An eye for an ear: zero-shot audio description leveraging an image captioner with audio-visual token distribution matching","venue":null,"work_id":"54be9696-03b4-4429-af93-2451b5ad657a","year":2024},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.509314Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:5f149b30eb6d5d2d57d9127321057997b9aff8d45427aad4ca5b27d3dca1b54e","observation_id":"a8cd910e-e30e-4e4e-a3c8-d8d16a8f0f6b","resolution":{"observed_at":"2026-08-12T04:23:42.127218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.107698Z","title":"A closer look at weakly-supervised audio-visual source localization","venue":null,"work_id":"5681d5a2-fbe0-4b75-b942-611da384b48d","year":2022},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.514798Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:f98476426c21e2afbf6fadc75ee78aa4f782089cce8dc023a018853d8e49237c","observation_id":"4eea906a-1d55-4d2a-9cb1-ffbf7d517a40","resolution":{"observed_at":"2026-08-12T04:23:42.112948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08074","last_updated":"2024-11-30T10:48:21Z","snapshot_observed_at":"2026-08-19T16:04:15.973593Z","submitted_at":"2024-06-12T10:48:53Z","title":"A Concept-Based Explainability Framework for Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08074","snapshot_observed_at":"2026-08-12T04:23:41.520270Z","title":"A concept-based explainability framework for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.520270Z"},"links":{"cited_paper":"/paper/2406.08074","citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:228c84baf7d473aa8632cd2e13ee9f0345a77ee8982ebd921c381dccb3e24d40","observation_id":"0e90062f-60ed-447b-97a6-977b09e920cf","resolution":{"observed_at":"2026-08-12T04:23:41.520270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.091571Z","title":"Listen to interpret: Post-hoc interpretability for audio networks with nmf","venue":null,"work_id":"854bdfaa-e24d-4ea0-9029-4d9868961da2","year":2022},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.526646Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:cfb91d7a0db14726a8012ca6a8cd553b4eda45f03c2f0eed19091a37e893cf13","observation_id":"aac9c43f-6969-48e9-89ad-4defc724afdc","resolution":{"observed_at":"2026-08-12T04:23:42.096290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.076270Z","title":"Guiding audio source separation by video object information","venue":null,"work_id":"82dbc343-1339-4016-a4dc-dad343b6436c","year":2017},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.532777Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:fcf8eb79043b5ce5e032cc01fa55bae94e898c6abfd073ff9890501a699ebd6f","observation_id":"b38c4eb1-38f8-459f-ba47-2a794b9aad4d","resolution":{"observed_at":"2026-08-12T04:23:42.081241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.059353Z","title":"Marginnce: Robust sound localization with a negative margin","venue":null,"work_id":"f5ab00f5-d9b0-4b5b-9987-e8c9eb550c03","year":2023},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.538478Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:2dc5309218218f8cfaf02e49ebc52799a0076d4b7cac233a4621643d8272b2a6","observation_id":"31bf4e73-ac6d-4ed4-b01a-842b831e4de3","resolution":{"observed_at":"2026-08-12T04:23:42.065183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.044645Z","title":"Can clip help sound source localization? In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), January 2024","venue":null,"work_id":"bb016cdd-3ad1-47fe-86c2-54f8e5c05c06","year":2024},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.543730Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:d0d130beedf4dde1f7bd8ab772b2c4f7b05d996bca00dcd9b6618fbd95112fc6","observation_id":"049cf943-4e67-4b62-b51c-603333264557","resolution":{"observed_at":"2026-08-12T04:23:42.049396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.030554Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"5973c615-9d8e-4a35-9dc8-dde346ea57e0","year":2021},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.548694Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:62c3ba27606984cf5fdc613d4764462695ee89bff6c6e3421ff8eeae5289a434","observation_id":"e1bd8688-db34-4e0d-b068-cd945dadc870","resolution":{"observed_at":"2026-08-12T04:23:42.035083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:42.015296Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"384e0a75-5246-454f-aee9-01c8121116df","year":2022},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.553671Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:c089d298c90b55cee334b68d01c6d538e38ef2e6216aa3b47799caa67214cd74","observation_id":"b96c824a-9c57-4100-ad82-ff70fedabe54","resolution":{"observed_at":"2026-08-12T04:23:42.020302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.997312Z","title":"Soft nonnegative matrix co-factorization","venue":null,"work_id":"fc6ee493-9b06-4a9b-854a-6d9d439ba136","year":2014},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.558095Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:5fa5598d0ab4941d051c0c18f8ff2fa2e498ed6fb441e8c756fec050fbd752dd","observation_id":"d2d773af-542d-4b50-8b11-ddbe30127d4e","resolution":{"observed_at":"2026-08-12T04:23:42.002528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.982267Z","title":"Learning to localize sound source in visual scenes","venue":null,"work_id":"77fc454e-bff8-4ced-8a5b-525f28cb1839","year":2018},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.563297Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:a997f679dcef7967b78a5ce793decac85ce37247f2871a35b2132106b60b44ae","observation_id":"ade26ffd-c0f6-48ad-9fb0-7d20d6860cfa","resolution":{"observed_at":"2026-08-12T04:23:41.987034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.963203Z","title":"Learning to localize sound sources in visual scenes: Analysis and applications","venue":null,"work_id":"38779e87-a719-4a25-a1f0-464948d7a386","year":2019},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.568327Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:b023a04c8f192de16fe57c7de2923d5d1f7744293233b72f8010916de1ba6cc8","observation_id":"ba10f421-b590-41a8-a293-dea8d5040411","resolution":{"observed_at":"2026-08-12T04:23:41.971619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.949576Z","title":"Learning sound localization better from semantically similar samples","venue":null,"work_id":"fb81b0b0-7145-4e40-a268-845afb0a3d8e","year":2022},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.573269Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:c54453dba5664fbc56bffe614dd3f00dd0b1ac7c0b51c41c131aaa7ad569542a","observation_id":"724eaf77-0934-4d99-847f-4bbdb6051a6e","resolution":{"observed_at":"2026-08-12T04:23:41.953907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.936109Z","title":"Sound source localization is all about cross-modal alignment","venue":null,"work_id":"1a780218-8071-4bd1-b0c0-567d5029dd02","year":2023},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.577960Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:149a61567641663a99826dea65fc37866967f9bbf7594e40f5b67c94208ab17d","observation_id":"6d4a439d-eaff-4ac3-b460-6904964ce2af","resolution":{"observed_at":"2026-08-12T04:23:41.940508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.921819Z","title":"Increasing importance of joint analysis of audio and video in computer vision: A survey","venue":null,"work_id":"cb3e3de8-3dfb-4930-9c35-94fc94d13972","year":2024},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.582017Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:3c7f59f6235d5e309c617ec6e1c258e6e310caf6067cc0a8105cbecb917e3ce0","observation_id":"6e811ac2-eba3-4bb7-a1c1-1576ac0e8b8a","resolution":{"observed_at":"2026-08-12T04:23:41.926479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.906466Z","title":"Learning audio-visual source localization via false negative aware contrastive learning","venue":null,"work_id":"ca6c2f90-571c-49d9-87cf-95e1f0081295","year":2023},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.591779Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:a969762a2f0892dc70a3226581e47b9bb2e9cc6879a02b69a221edfe53d58c25","observation_id":"bd27ecd2-f5e5-4248-a694-64ffe7e5c8c2","resolution":{"observed_at":"2026-08-12T04:23:41.911290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.889110Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"0f81c56e-bca1-4180-956b-b1bd92c1c80a","year":2018},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.596649Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:04924b7f5564ff56eb276652e0b3725bc4c717f87d8b6851c065ddaf6b42d7e2","observation_id":"affd8a84-9597-4234-8128-c7bf6f43aea3","resolution":{"observed_at":"2026-08-12T04:23:41.894808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.873649Z","title":"Combining non-negative matrix factoriza- tion and deep neural networks for speech enhancement and automatic speech recognition","venue":null,"work_id":"7b086d51-360a-4fa9-bb47-4b4e0506de5d","year":2016},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.602241Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:1c28b742b526c27bc8ac5ba662d68d435033564342a7a553c71611094c43bb9f","observation_id":"d5c4fbac-c93b-4f84-92c5-798058cb14da","resolution":{"observed_at":"2026-08-12T04:23:41.878827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.857759Z","title":"Document clustering based on non-negative matrix factorization","venue":null,"work_id":"d5669e8e-d35c-4be1-a84d-5655edef11d4","year":2003},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.606898Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:a2961ec68a0627c094e19e1d8878af0c57cbe21a8802f025e21f498f0e112276","observation_id":"d38866b8-2cd0-4dce-a59b-2038c55374e8","resolution":{"observed_at":"2026-08-12T04:23:41.862798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.840932Z","title":"Coupled nonnegative matrix factorization unmixing for hyperspectral and multispectral data fusion","venue":null,"work_id":"64f3e167-28a0-4daa-8008-3974eeda015e","year":2011},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.612291Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:3a6f8b4b7f9d2122fb9ddb937b46b790b32b0b4bc33b41964ffc7aabcc8a53ff","observation_id":"0bf2f4e7-82f8-4ff4-9c6c-21629b283753","resolution":{"observed_at":"2026-08-12T04:23:41.846293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.825400Z","title":"Matrix co-factorization on compressed sensing","venue":null,"work_id":"28ea9820-153f-4034-a999-354f7658fc45","year":2011},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.618257Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:bdfa8e33e18c87e97890cf714d7aee40fb3b18a9a73c5ca164c37f9e8d477cb9","observation_id":"cea3375a-ad04-4c25-8af0-163da9acb579","resolution":{"observed_at":"2026-08-12T04:23:41.830156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.810799Z","title":"Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip","venue":null,"work_id":"94c88217-cfdf-47b6-b800-cf0bd89fbd3b","year":2023},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.622563Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:8677b7fe9211b7ccbe9d2e46f05716a31fdafce010255954e23f423f06792c71","observation_id":"fad3c349-078c-4638-9a83-0e7c9a13e8d8","resolution":{"observed_at":"2026-08-12T04:23:41.815704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.795044Z","title":"Semantic understanding of scenes through the ade20k dataset","venue":null,"work_id":"51d91acd-831f-47e6-8619-25df7964db52","year":2019},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.627328Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:b60c71add56e94348c5cec16d39163a0e663ebb0e96198b076a4a94515227c14","observation_id":"d70059dc-7c51-4dee-8833-81b812226705","resolution":{"observed_at":"2026-08-12T04:23:41.799884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.779482Z","title":"Audio-visual segmentation with semantics","venue":null,"work_id":"095bdd6e-46ff-4a0d-8cd4-0ef56d177237","year":2024},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.631230Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:ca523f7fba0cecf150257ccc9854e46f1b5f33f1f387fd8cb74d648b68debad8","observation_id":"212c30af-bc19-468b-8a4b-0497ba2bbe45","resolution":{"observed_at":"2026-08-12T04:23:41.784862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:23:41.763151Z","title":"Audio–visual segmentation","venue":null,"work_id":"afb01327-3e27-4871-bcf5-1b156f5988d9","year":2022},"citing_paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:23:41.635307Z"},"links":{"citing_paper":"/paper/2412.01488"},"observation_digest":"sha256:7a7976a4ce94633eb22c5639aba4102b1ccaaa9187744b43dec5727ee406eca2","observation_id":"eadfaf95-d7b5-4b70-a9d6-2ed3f29471da","resolution":{"observed_at":"2026-08-12T04:23:41.768870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01488","last_updated":"2025-05-26T17:24:05Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-19T04:07:45.690065Z","submitted_at":"2024-12-02T13:39:49Z","title":"TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2412.01488."}