{"as_of":"2026-08-08T07:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75555eea988876ae0a9a6a30ca9d8649d56a5986b38aa311274417c410d635d7","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:33:04.329045Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24786/citation-record","integrity":"/paper/2607.24786/integrity","json":"/paper/2607.24786/citation-record.json","paper":"/paper/2607.24786"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.210067Z","title":"Localizing visual sounds the easy way","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.210067Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:fcc9fe665d37c46d439d6586a82d48d6c6ea291b3122a514247a8b21a70e6ab3","observation_id":"835c4629-c3d2-4f32-84ab-bee119b7687b","resolution":{"observed_at":"2026-08-02T10:33:02.210067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.247659Z","title":"A closer look at weakly-supervised audio-visual source localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.247659Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:7b4fe891205c5fa8cfc6134cfec33c3b75fac3fe8b8bd4af60292d1f345e7e00","observation_id":"2f1d469d-193c-4185-8c50-4c281b6261dc","resolution":{"observed_at":"2026-08-02T10:33:02.247659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.303952Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.303952Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:6409dcb21c55e62fbe1970e27589e221b4ddfbac5de1190307098b2fc069a314","observation_id":"5058dc0b-c6cb-4b7e-b9df-e479783d343e","resolution":{"observed_at":"2026-08-02T10:33:02.303952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.359248Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.359248Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:44e4f1961dd75483bbe4be48cbb86bcc73a35df7a743a72d26f69f88718966ea","observation_id":"962945e0-c51d-4de9-a9f3-08b09fba1d04","resolution":{"observed_at":"2026-08-02T10:33:02.359248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.396527Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.396527Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:da416a0166588272c38b4fdc123aa86dbe254b3f21abd8956be9cf5603f9ace6","observation_id":"674ee0e8-fa75-49ea-8d8f-564ae12addc2","resolution":{"observed_at":"2026-08-02T10:33:02.396527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.451568Z","title":"Pushing the frontier of audiovisual perception with large-scale multimodal correspondence learning.arXiv preprint arXiv:2512.19687, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.451568Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:5e3d52f94df51533dbb356b932d7a678114e15e617161a597eaa7c7c46687eaa","observation_id":"12b7909e-9f69-40c9-83e3-e2182c7e6571","resolution":{"observed_at":"2026-08-02T10:33:02.451568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.504059Z","title":"Learning audio-visual source localization via false negative aware con- trastive learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.504059Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:433bdc6444f7e00706dcdee2f9a16c9af0c2a432e610372d89a4fc0afb0cbe86","observation_id":"8b43dc88-62e8-43f7-a76c-02b8f432bbe1","resolution":{"observed_at":"2026-08-02T10:33:02.504059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.571128Z","title":"What’s making that sound right now? video-centric audio-visual localization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.571128Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:0ff4b14b923911a8c1bf311ff4832a91fa0a6a9eb3d396d237eb22469943d28c","observation_id":"1914a910-90cf-4540-9dec-4e7ed1c94bda","resolution":{"observed_at":"2026-08-02T10:33:02.571128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.624637Z","title":"Flair: Vlm with fine-grained language-informed image representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.624637Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:fa8d4364fa34270874cbc43cecb4b449e0c335df46c15618e8007bde7cb85941","observation_id":"3c334cf1-f7ff-4899-850b-595d1d4f0471","resolution":{"observed_at":"2026-08-02T10:33:02.624637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.662240Z","title":"Learning to localize sound source in visual scenes","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.662240Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:186f087e0d8402e6b3880b7e15289dd7cf41eb7409ca091aa882e80e59a5006e","observation_id":"8d9c5fc8-d090-4aa0-a83f-433f07159929","resolution":{"observed_at":"2026-08-02T10:33:02.662240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.729151Z","title":"Exploiting transformation invariance and equivariance for self-supervised sound localisation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.729151Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:79a8342cffd97c6bc5dfaf4ba65ef49861b9e035e5d4139b75d75203883b2f77","observation_id":"cc124740-8156-4d87-b69c-7ea9404c3c51","resolution":{"observed_at":"2026-08-02T10:33:02.729151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.822503Z","title":"Marginnce: Robust sound localization with a negative margin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.822503Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:ce1c0b355dca86c1785bd053e7b9baa234a445d09835617db2a6a1caf07a00a8","observation_id":"3dd7d787-5a65-4373-a33a-271be860b14e","resolution":{"observed_at":"2026-08-02T10:33:02.822503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:02.923850Z","title":"Sound source localization is all about cross-modal alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:02.923850Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:be80e345787550ffef11c5c2cc4db7ac0b11a9e98da7722c25d8d52cd9b64426","observation_id":"a8606333-4089-4702-b633-3409d51f09fe","resolution":{"observed_at":"2026-08-02T10:33:02.923850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:03.021479Z","title":"Audio–visual segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:03.021479Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:dc4c37de161402bc57001c6bd2ef3085baa231da800fa0c885d6455789d1c41c","observation_id":"56bc5e8a-24d9-4227-bc06-13b43f5116dd","resolution":{"observed_at":"2026-08-02T10:33:03.021479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01836","last_updated":"2023-05-03T00:33:52Z","snapshot_observed_at":"2026-07-06T15:22:36.624988Z","submitted_at":"2023-05-03T00:33:52Z","title":"AV-SAM: Segment Anything Model Meets Audio-Visual Localization and Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01836","snapshot_observed_at":"2026-08-02T10:33:03.127024Z","title":"Av-sam: Segment anything model meets audio-visual localization and segmentation.arXiv preprint arXiv:2305.01836, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:03.127024Z"},"links":{"cited_paper":"/paper/2305.01836","citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:1a4eefbee2c6fd4c9a32bb482a66b1d1634976bddf8b36dd99d65f4f5491bb89","observation_id":"8a061c02-1bc4-455e-9767-df5fd6890f55","resolution":{"observed_at":"2026-08-02T10:33:03.127024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:03.235286Z","title":"Audio visual segmentation through text embeddings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:03.235286Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:8525279e86e173735b40575cb0ca66ae2ba98160fedd6e0ff50edfda4b0b13c0","observation_id":"70302193-7606-46af-b827-b1f51e739d43","resolution":{"observed_at":"2026-08-02T10:33:03.235286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:03.328242Z","title":"Open-vocabulary audio-visual semantic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:03.328242Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:b31007152f160f315e4d04dcbfbea488b2a6a4a4038daf365a265011810e1f46","observation_id":"ed72577c-daa9-44b3-9e75-a2373db1cfd4","resolution":{"observed_at":"2026-08-02T10:33:03.328242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:03.409702Z","title":"Taco: Training-free sound prompted segmentation via semantically constrained audio-visual co-factorization.Transactions on Machine Learn- ing Research, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:03.409702Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:a9b3140da309ecff896cef2accf7887ed626f7c271481f42616005e8efdb19d8","observation_id":"7e8140a3-35d2-4ed4-ae5b-3128f75467c3","resolution":{"observed_at":"2026-08-02T10:33:03.409702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:03.539332Z","title":"Perception encoder: The best visual embeddings are not at the output of the network","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:03.539332Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:2f29ef1801f528289f5aa4edfef63c78742770b8a002edf72b63695c59cbc11a","observation_id":"44173815-9d10-4c8f-ae3a-b9b7237766da","resolution":{"observed_at":"2026-08-02T10:33:03.539332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:03.647463Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:03.647463Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:0ec6555d4fee051ea9c242af02a78c3b6eccb0847decbb956017c1f10f5b3138","observation_id":"dc16366d-6174-4812-a251-ea90bd3ecda2","resolution":{"observed_at":"2026-08-02T10:33:03.647463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:03.775098Z","title":"Gradient-based learning applied to document recognition.Proceedings of the IEEE, 86(11):2278–2324, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:03.775098Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:d8388a18d6694f073776f6fae8bcac215e9978377989312826d70e00a5b8f8da","observation_id":"96ae56ee-03eb-4b9d-8084-2d5b29dde6aa","resolution":{"observed_at":"2026-08-02T10:33:03.775098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:03.884963Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:03.884963Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:4393b0d5e66871985ba63a151cab35577de3953df6b3f319f7691e6de09db9e1","observation_id":"fcc6ce4b-0ca1-4088-a735-14e7aaab3e9e","resolution":{"observed_at":"2026-08-02T10:33:03.884963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:03.992678Z","title":"chirp\" from the","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:03.992678Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:55d60aac2ea240464f40eaef1dad0b93daab2418764d871da2e55e6c3278d242","observation_id":"0902e3d4-21db-44f2-9fc0-7c4032e3bb85","resolution":{"observed_at":"2026-08-02T10:33:03.992678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:04.059504Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:04.059504Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:7e3eb8041074b89ac07968efa8c65038bc559110701f151eafcafbbc3a6057d7","observation_id":"2faff45e-d3eb-48be-981a-02427295ff7f","resolution":{"observed_at":"2026-08-02T10:33:04.059504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:04.103719Z","title":"Transfer learning from audio-visual grounding to speech recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:04.103719Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:087d0f2650e6d8195bc7e59a1b3a81f5c4b17847bfcb16a62da00d140d7f5ffc","observation_id":"7ff947f8-7e51-45f2-818c-0293bc9479c2","resolution":{"observed_at":"2026-08-02T10:33:04.103719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:04.150073Z","title":"Contrastive audio-visual masked autoencoder","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:04.150073Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:996015de76d14cb2736da7824c24989e5a1d2b22e9a414784331a1461fedb3e4","observation_id":"e79ce49c-91aa-4a0b-9ee2-afc02c60a9d6","resolution":{"observed_at":"2026-08-02T10:33:04.150073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:04.186922Z","title":"Cav-mae sync: Improving contrastive audio-visual mask autoencoders via fine-grained alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:04.186922Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:1d4c33ec8381a793a5b893dbe8a9da2ac8a801c19e9a003031822624b229dd2f","observation_id":"6dcc3903-aa82-4f68-8eba-c72ec0734ce1","resolution":{"observed_at":"2026-08-02T10:33:04.186922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:04.220152Z","title":"Convolutions die hard: Open- vocabulary segmentation with single frozen convolutional clip.Advances in Neural Information Processing Systems, 36, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:04.220152Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:9370ae710f07f85794196b658fe5f10356ee0d85f4e57757f8494054dd08c6f4","observation_id":"740fd3d5-3be0-41bc-a799-88fc3db0ef27","resolution":{"observed_at":"2026-08-02T10:33:04.220152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:04.274503Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:04.274503Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:ea6608869500c1af0b35fd2f831ff8452006a222fdcb38264e3849e67d8a2d93","observation_id":"5844169b-cf35-4fac-99e3-629622c96a78","resolution":{"observed_at":"2026-08-02T10:33:04.274503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:33:04.329045Z","title":"LAIP two poolers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T10:33:04.329045Z"},"links":{"citing_paper":"/paper/2607.24786"},"observation_digest":"sha256:30a15b6fa0dc23d2cafa4b0688ffed3dac533d0a872d49aa06e42cb2e4b3b9be","observation_id":"5d0a6d57-062f-41af-a1f4-69d217dd6f40","resolution":{"observed_at":"2026-08-02T10:33:04.329045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24786","last_updated":"2026-06-22T11:13:25Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-05T01:57:10.235387Z","submitted_at":"2026-06-22T11:13:25Z","title":"Unlocking Spatial Grounding in Large Audio-Visual Retrieval models"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2607.24786."}