{"as_of":"2026-08-08T21:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b610b04baa7cc2818fb69d3f2833f286232f215181d44a92c5bafaa7b069d5cc","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:45:16.890460Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15265/citation-record","integrity":"/paper/2607.15265/integrity","json":"/paper/2607.15265/citation-record.json","paper":"/paper/2607.15265"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-01T23:45:09.832430Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember and Recall Spaces.arXiv preprint arXiv:2412.14171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:09.832430Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:541a1915c3b33e746f3bb9c7ded5aa50d51b2ee3c3ede388262cfbdf60a68892","observation_id":"087e9a15-00a5-4ddc-839e-9e842e1ba234","resolution":{"observed_at":"2026-08-01T23:45:09.832430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:09.937044Z","title":"SA VVY: Spatial awareness via audio-visual LLMs through seeing and hearing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:09.937044Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:2692fc02498216b982f8218c5e21aca56fe049694ba4abcadbec6cd28c8e8baf","observation_id":"fa155ee4-435a-4479-b5ee-1b76757b423b","resolution":{"observed_at":"2026-08-01T23:45:09.937044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:10.049426Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:10.049426Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:bb1e43c189da8859590f0de040d6186caf6bda0a2a9c1b4667d8fbe6611a2dbd","observation_id":"9fa58045-f767-4434-8878-e1ed7b319cee","resolution":{"observed_at":"2026-08-01T23:45:10.049426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:10.179811Z","title":"Sigmoid loss for language image pre-training.2023 IEEE/CVF International Conference on Computer Vision (ICCV), pages 11941–11952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:10.179811Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:7d81ea9c380d850c656a597121e46795587144baf130fa14460546e6401001e5","observation_id":"359e75a2-fb47-48a7-8558-ba205e3e8922","resolution":{"observed_at":"2026-08-01T23:45:10.179811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-01T23:45:10.278101Z","title":"Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, Olivier H’enaff, Jeremiah Harmsen, Andreas Steiner, and Xiao-Qi Zhai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:10.278101Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:63bdb32fbe4cbc59e3f0c56d4cb990be133e92e6f200e99f2155124b521f8c09","observation_id":"ba4ffdb9-582b-4d7b-8197-3c05cea8f469","resolution":{"observed_at":"2026-08-01T23:45:10.278101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:10.394732Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword- to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:10.394732Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:52abcd866e4c8dec1badb5138ab5a5011eb6b6784dbf19487c0fc2e00ba054eb","observation_id":"84882c8d-fd77-4feb-b39f-f6a4487ce965","resolution":{"observed_at":"2026-08-01T23:45:10.394732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:10.532974Z","title":"M2d-clap: Masked modeling duo meets clap for learning general-purpose audio-language representation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:10.532974Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:964cfd2798314ba50e592fd5945c0d2887d8fe56731413564101a2986c70beaa","observation_id":"c9be0394-ee91-4bde-aa42-f2d4c75dd318","resolution":{"observed_at":"2026-08-01T23:45:10.532974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:10.614491Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:10.614491Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:26dcb9e3243c4727438c48ab8b595d1528528ea71777c183e7063393f723e2f4","observation_id":"6afbe198-dbec-4a86-bf96-0a76ba2dd749","resolution":{"observed_at":"2026-08-01T23:45:10.614491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:10.782196Z","title":"Soundspaces 2.0: A simulation platform for visual-acoustic learning.Advances in Neural Information Processing Systems, 35:8896– 8911, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:10.782196Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:c75cb0cf33c97a0d36385781c9c7cb4ff4882ed46408a4c79205db30f868551d","observation_id":"0a251de8-209c-4b92-a886-28c4e134ea44","resolution":{"observed_at":"2026-08-01T23:45:10.782196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:10.929539Z","title":"Spatial-clap: Learning spatially-aware audio–text embeddings for multi-source conditions.arXiv preprint arXiv:2509.14785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:10.929539Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:e1e00570ba4714e4df8077c24bf8f4292307d9f7143e7f2ab4b2effcec8f402d","observation_id":"37ca474f-e31f-4530-9065-3826b6a9080e","resolution":{"observed_at":"2026-08-01T23:45:10.929539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:11.050820Z","title":"Audioclip: Extending clip to image, text and audio, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:11.050820Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:eb019442c0da608d602038bb048f385e62e8cc73cb3b6d7ef78c18b633d412ce","observation_id":"cefcb73f-99ff-412c-8cc5-c91d2f27ccf3","resolution":{"observed_at":"2026-08-01T23:45:11.050820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-01T23:45:11.136712Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models.arXiv preprint arXiv:2311.07919, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:11.136712Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:505272342839b0d77b8927a78a631dd71f3d45d89e3e968547e60755cda38b0f","observation_id":"7a135e44-0c66-4de4-abfc-b2c8d919dca7","resolution":{"observed_at":"2026-08-01T23:45:11.136712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:11.276028Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:11.276028Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:6f0a0b41a76b81e72309a52fca9ef3bb41a297b1a080f1642ab4c00370824aa8","observation_id":"d5a72fea-267f-4099-a288-860f71dff475","resolution":{"observed_at":"2026-08-01T23:45:11.276028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:11.437574Z","title":"X-instructblip: A framework for aligning x-modal instruction-aware representations to llms and emergent cross-modal reasoning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:11.437574Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:1826f34ed663106139d5682d18f3850cfd575bab58a72114e34b84d4a003c8d4","observation_id":"90422da9-de6d-4bea-bbd1-dc5e5ee793ce","resolution":{"observed_at":"2026-08-01T23:45:11.437574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:11.563238Z","title":"Robohop: Segment-based topological map representation for open-world visual navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:11.563238Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:8cea6d606e949214219e3bd0265c7394e8fcea597d49c262b194bb78d3ccc1d6","observation_id":"5f574047-85e9-44d2-84f0-254ef50bc28f","resolution":{"observed_at":"2026-08-01T23:45:11.563238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:11.725079Z","title":"Tenenbaum, Celso Miguel de Melo, Madhava Krishna, Liam Paull, Florian Shkurti, and Antonio Torralba","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:11.725079Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:0f8bcabde4dcbcd9443ba6f1dda4f6ff8dbd8e3deb8b827327d435ba44bbd112","observation_id":"96adb037-51b2-492c-9bda-a63cfc9a6986","resolution":{"observed_at":"2026-08-01T23:45:11.725079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:11.860092Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:11.860092Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:7401d2b3c0e8c10d91121e8bb5a7d9f41a1d5b30f06bf0df7a663823e9a6263c","observation_id":"e45cf3d6-2fb8-4b09-a2c2-0aa05a72d06f","resolution":{"observed_at":"2026-08-01T23:45:11.860092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:12.002085Z","title":"3d-mem: 3d scene memory for embodied exploration and reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:12.002085Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:2b6207f7c65eab9756797899dced1b46d80e4fe56e7629228348ea78bca1c690","observation_id":"867591e1-9f8b-42ee-8337-0496957f2db6","resolution":{"observed_at":"2026-08-01T23:45:12.002085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:12.133995Z","title":"Gridmm: Grid memory map for vision-and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:12.133995Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:4e2e884d95eb8e25436abf265a218f4e1904eb8cc5bbb8727c318650a085242e","observation_id":"d5d4d01b-c508-4578-999c-518ff00825f7","resolution":{"observed_at":"2026-08-01T23:45:12.133995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:12.276313Z","title":"Visual language maps for robot navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:12.276313Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:0b0b27581d7b45dff8d99e49044c4b5f2922cc30e39f1572cadaa9c4e8d6604a","observation_id":"18c5015a-b2ec-49a1-97b8-65d6b0aa6f33","resolution":{"observed_at":"2026-08-01T23:45:12.276313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00734","last_updated":"2024-12-01T08:59:30Z","snapshot_observed_at":"2026-08-07T03:42:58.749421Z","submitted_at":"2024-12-01T08:59:30Z","title":"ChatSplat: 3D Conversational Gaussian Splatting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00734","snapshot_observed_at":"2026-08-01T23:45:12.402273Z","title":"Chatsplat: 3d conversational gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:12.402273Z"},"links":{"cited_paper":"/paper/2412.00734","citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:d431156f911629b5a37d7db8fb4a9b47ffebca4c30028f0a49913101f14613b2","observation_id":"787cd91f-2c69-49fc-86e6-e138bae2a2b4","resolution":{"observed_at":"2026-08-01T23:45:12.402273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:12.593488Z","title":"Language embedded 3d gaus- sians for open-vocabulary scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:12.593488Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:3942fd688977230beb362408feb538f193ea97fdf61fc4eb321002c6c5329daf","observation_id":"7a330364-c9bb-485f-927e-3b7752c4b4a4","resolution":{"observed_at":"2026-08-01T23:45:12.593488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:12.735472Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:12.735472Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:f08ffe1797ee99c6ef73aab56b0ede9ef8f37b462549e356e0b9ef5c5fa38a2e","observation_id":"869d5ad7-b0cd-42a4-87b9-95c7485f50b6","resolution":{"observed_at":"2026-08-01T23:45:12.735472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-01T23:45:12.869585Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.ArXiv, abs/2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:12.869585Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:d810c61900340d2282c6871f3f0cf77f17c386547bcb817f36b5b834167273bc","observation_id":"ada12380-da4a-4a51-b8a8-ac326d4bbc3c","resolution":{"observed_at":"2026-08-01T23:45:12.869585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-05T08:31:40.101811Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-08-01T23:45:12.978003Z","title":"Grounding dino 1.5: Advance the \"edge\" of open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:12.978003Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:35b5e31bc8f3ca01238bbbae54874a25947eeb4d34b69b0193b0f9f4f2c8a8e7","observation_id":"cec6af44-1c2d-496f-8afd-5e9fa93481bb","resolution":{"observed_at":"2026-08-01T23:45:12.978003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:13.129125Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:13.129125Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:b93738d5b150fb033a4b79a49dfe4002c8ac4120e9850bdcd12f3e9e936532ba","observation_id":"a9d4588e-2aea-4595-bcd1-081a310578c6","resolution":{"observed_at":"2026-08-01T23:45:13.129125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:13.230943Z","title":"Deformable DETR: deformable transformers for end-to-end object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:13.230943Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:ceacf516db8509acacb57e450323b3ce5295c27c700e7775b51d22a57d474ee7","observation_id":"7735c57b-7f8d-4085-a0fe-1f3999ea89e5","resolution":{"observed_at":"2026-08-01T23:45:13.230943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:13.355094Z","title":"Visual scene graphs for audio source separation.2021 IEEE/CVF International Conference on Computer Vision (ICCV), pages 1184–1193, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:13.355094Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:024597c0fe383ca199fe405731b0eda70860491d7fa6bb0feb79c900cd99b8c4","observation_id":"5c277ad5-efd2-441b-837d-408a9db48d12","resolution":{"observed_at":"2026-08-01T23:45:13.355094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:13.471187Z","title":"Learning audio-visual dynamics using scene graphs for audio source separation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:13.471187Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:dc91f8f3651a3f0c61c78dbed46a1a88686f2fac54a7ccd40e0862ab25bd9dd7","observation_id":"6931c8d2-7ac8-4d2a-869b-c1eddec8864a","resolution":{"observed_at":"2026-08-01T23:45:13.471187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:13.619588Z","title":"Audio-visual grouping network for sound localization from mixtures","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:13.619588Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:b709ffd753fb944c6a0f8e2b45c303fe62b46941f527b005b891bedbab6c246e","observation_id":"eaefe87c-0218-4f4e-8df5-f278b90afa59","resolution":{"observed_at":"2026-08-01T23:45:13.619588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:13.774025Z","title":"Lavss: Location-guided audio-visual spatial audio separation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:13.774025Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:52e1e880417565064618c547521ccfaa2918c1fc4bc25f786d4b2379631a4cdc","observation_id":"42abd712-08d6-4308-a2d0-37dcafdc1f65","resolution":{"observed_at":"2026-08-01T23:45:13.774025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:13.876437Z","title":"Audio-visual scene analysis with self-supervised multisen- sory features","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:13.876437Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:ce0c318b276b41acc52d710ad279aa65f0a3ad71c6548f8a9f9db895783278eb","observation_id":"d06e21e3-55e7-4a05-a746-eda9ef93222e","resolution":{"observed_at":"2026-08-01T23:45:13.876437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:13.994141Z","title":"Discriminative sounding objects localization via self-supervised audiovisual matching","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:13.994141Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:1e830fdaa9cd628468c2251a922206636d4adfe793e64579acf24f9c72b7bcb4","observation_id":"bbb297ea-d6c8-4832-bbea-d2450a83228b","resolution":{"observed_at":"2026-08-01T23:45:13.994141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:14.119034Z","title":"Cyclic co-learning of sounding object visual grounding and sound separation.2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 2744–2753, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:14.119034Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:1e1f18cf50289eaf4a75bf753d389f208a8e64743d964c8d82596e757c7658b7","observation_id":"4a079e94-ac57-4bac-b5aa-ee37f30e3cca","resolution":{"observed_at":"2026-08-01T23:45:14.119034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:14.234913Z","title":"Sound event localization and detection of overlapping sources using convolutional recurrent neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:14.234913Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:330fd41ef11dd31a563ccac9e11cb8ec29b94dde7582a994e0c6ddf9a95b4fb2","observation_id":"6375b6c3-6475-4cd7-b519-374fc9abb232","resolution":{"observed_at":"2026-08-01T23:45:14.234913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:14.359911Z","title":"Robust sound source tracking using srp-phat and 3d convolutional neural networks.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 29:300–311, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:14.359911Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:5c85252004d798fde876909d669e28415b8a2b04b1eb322b7774ff2e43de96c8","observation_id":"a6ae3561-fd26-4391-96ca-f791e2cea1c7","resolution":{"observed_at":"2026-08-01T23:45:14.359911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:14.478774Z","title":"Bat: Learning to reason about spatial sounds with large language models.International conference on machine learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:14.478774Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:badd379739df8b9e0d71f611a349a91626a581325cdd5f98da55eb333168d523","observation_id":"9efd7d7b-ca93-45ea-899b-a67e4b12152c","resolution":{"observed_at":"2026-08-01T23:45:14.478774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:14.603604Z","title":"Learn- ing spatially-aware language and audio embeddings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:14.603604Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:a0b3414fa2d2d10130b8cdde86899843c2fb5f6c795a466fdb266d5c8904a428","observation_id":"03cd5d5f-eb1f-4398-8f33-4fa02f26aef6","resolution":{"observed_at":"2026-08-01T23:45:14.603604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:14.756020Z","title":"Phasecoder: Microphone geometry-agnostic spatial audio understanding for multimodal llms, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:14.756020Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:4ea1f34e98845229efa71d01f60c225a56093314aba8f138c467616b67b46749","observation_id":"33a8d984-0ce8-4804-8617-7277ee0e7e9d","resolution":{"observed_at":"2026-08-01T23:45:14.756020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:14.865953Z","title":"Hear you are: Teaching llms spatial reasoning with vision and spatial sound","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:14.865953Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:5a3f6034b827ae39533bb4d24707289247a67e5c454c30dc37790228efec8d91","observation_id":"6ede0104-3ccb-4c0a-aa2e-0a61176afc18","resolution":{"observed_at":"2026-08-01T23:45:14.865953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-01T23:45:14.924921Z","title":"Representation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:14.924921Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:9bcb769f29388fdd81fe9c1806528c9288380859911f4d086421bef882a0e599","observation_id":"6cce96e4-6ae2-4f9a-bc45-40baf052a953","resolution":{"observed_at":"2026-08-01T23:45:14.924921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:14.994531Z","title":null,"venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:14.994531Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:3d9dae44faf8a3367053eedcf8586a89e4571dd64a91e499f39cf1fa104895c8","observation_id":"77dc329a-2f41-42a6-ad31-1e9efd935d37","resolution":{"observed_at":"2026-08-01T23:45:14.994531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:15.088113Z","title":"Audiocaps: Generat- ing captions for audios in the wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:15.088113Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:447c4b22eded41711373b1eb772a37d4e605aab31a9a45284a3c76dc6af54b3a","observation_id":"53c8a13d-4907-4ed5-a2bb-fc325b4189c6","resolution":{"observed_at":"2026-08-01T23:45:15.088113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:15.208143Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:15.208143Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:5c266011833cf887efeaa78d627db2e2d4c08d4f3158a8d74dbf54d5152b14dc","observation_id":"a1ea4721-43c5-4328-acb0-40570d21e1bf","resolution":{"observed_at":"2026-08-01T23:45:15.208143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-01T23:45:15.291684Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:15.291684Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:053b0530aff29fa46c9259e75f14245c627dec09371504bc242d608d2b98fafc","observation_id":"603ca818-19a3-4c3d-a5e5-95370ad2288a","resolution":{"observed_at":"2026-08-01T23:45:15.291684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14906","last_updated":"2025-06-03T03:27:47Z","snapshot_observed_at":"2026-08-07T16:00:40.489931Z","submitted_at":"2025-04-21T07:21:28Z","title":"OmniAudio: Generating Spatial Audio from 360-Degree Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14906","snapshot_observed_at":"2026-08-01T23:45:15.384571Z","title":"Omniaudio: Generating spatial audio from 360-degree video.ArXiv, abs/2504.14906, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:15.384571Z"},"links":{"cited_paper":"/paper/2504.14906","citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:636f47439ec8b54235e95f8d49c7b328f392f1bcb2c54f258508297c43eed7d8","observation_id":"bce4cf90-12d6-4bba-b2e4-185c3480e0b3","resolution":{"observed_at":"2026-08-01T23:45:15.384571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:15.502818Z","title":"Egocentric audio-visual object localization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:15.502818Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:ee7be47e97ad0a250ba166cc10f3c9bdfca95013e226ddf3b153da46be840584","observation_id":"353e9768-a41e-4bb2-9a0f-a4678a78b367","resolution":{"observed_at":"2026-08-01T23:45:15.502818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:15.653444Z","title":"Learning to localize sound source in visual scenes","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:15.653444Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:8469fc84a32e1e03ad7375f4890b0d2a4638102fa7743f44c0573f654e561d13","observation_id":"383336a3-3d67-4805-9280-e08d372edd49","resolution":{"observed_at":"2026-08-01T23:45:15.653444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.05526","last_updated":"2021-11-10T04:40:12Z","snapshot_observed_at":"2026-08-03T02:42:16.998766Z","submitted_at":"2021-11-10T04:40:12Z","title":"Space-Time Memory Network for Sounding Object Localization in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.05526","snapshot_observed_at":"2026-08-01T23:45:15.752844Z","title":"Space-time memory network for sounding object localization in videos.arXiv preprint arXiv:2111.05526, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:15.752844Z"},"links":{"cited_paper":"/paper/2111.05526","citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:0af21298685e705f648639bebb3c9b50a46cfc84fbb106d6fc1d22faebd64238","observation_id":"3d48dc4b-3740-4396-a076-f6b30842fbb9","resolution":{"observed_at":"2026-08-01T23:45:15.752844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:15.887730Z","title":"Localizing visual sounds the hard way","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:15.887730Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:3b10f04d90268aedd7f688aba3286a6ac25c150ae1f0d0217d3f695d15389157","observation_id":"95c9fc40-ea70-4699-b065-03355a706977","resolution":{"observed_at":"2026-08-01T23:45:15.887730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:16.031689Z","title":"Self-supervised predictive learning: A negative-free method for sound source localization in visual scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:16.031689Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:a32281a362f1454591b4647c3ff4a7a42133081873cefbfd2e0a6e7085596b31","observation_id":"b9fa7dce-9b23-457d-b5ef-961ed5ad3755","resolution":{"observed_at":"2026-08-01T23:45:16.031689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:16.142632Z","title":"Mix and localize: Localizing sound sources in mixtures","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:16.142632Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:8468fca70e6e2284845f6ebd69d46b4ac90bd09c9ef4da0324ca3fbfd69f9647","observation_id":"d66b6d27-f23d-43b8-864a-167f465af2da","resolution":{"observed_at":"2026-08-01T23:45:16.142632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:16.265301Z","title":"Seeing speech and sound: Distinguishing and locating audio sources in visual scenes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:16.265301Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:f4b17bf5ac6689a9c28887f03e220bc3bbe56b9546b74c2ec8c285f4bdf001c6","observation_id":"232d415c-9c5b-4bd9-8fb3-b16ac595c070","resolution":{"observed_at":"2026-08-01T23:45:16.265301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:16.368315Z","title":"Cnn architectures for large-scale audio classification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:16.368315Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:c046ad9293ac9657aa220791a6423e92d05f82a1f1fe6c2134d926f8df0da214","observation_id":"b12a34dd-9798-4d1c-9803-70969eea25d0","resolution":{"observed_at":"2026-08-01T23:45:16.368315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:16.485987Z","title":"Hrtf measurements of a kemar dummy-head microphone","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:16.485987Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:96cdc7cce3d8baf4e1d132765e5e28c7d417de29ac3f571843e55f3daa110c27","observation_id":"13992702-ac53-4d69-bdf4-6bda3fd4bb2e","resolution":{"observed_at":"2026-08-01T23:45:16.485987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:16.596325Z","title":"- visual_only: if visible, but it is silent or not synchronized with any sound","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:16.596325Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:a1554ecddab25951d06278a02af2df9a4ad830c3f22d9185468755a320ebbaad","observation_id":"512491a8-737e-40c7-8d43-bf1cc8de3d4b","resolution":{"observed_at":"2026-08-01T23:45:16.596325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:16.701974Z","title":"- Duration Constraint: Events must be short atomic instances","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:16.701974Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:e9625bc43554895b30d94466147f25bb6036d514a8508083bdd13a1aba350110","observation_id":"bfe70c16-5a9d-47bf-9cde-368b0eb8ba21","resolution":{"observed_at":"2026-08-01T23:45:16.701974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:16.815500Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:16.815500Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:7f8f18ac311964193b071478a2dc580308624c67226b63529760bcb298f3166f","observation_id":"7de46d3a-8f6d-4e9f-b90d-23ff514e4446","resolution":{"observed_at":"2026-08-01T23:45:16.815500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:45:16.890460Z","title":"- semantic_anno (6 to 8 words): Describe WHAT the object is doing/being","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T23:45:16.890460Z"},"links":{"citing_paper":"/paper/2607.15265"},"observation_digest":"sha256:9e9f7690db3444dfa33a90ac10097831181107f5bbf2e543d63b167da78962da","observation_id":"18c585ce-c824-4bd8-bd52-92b5e851d144","resolution":{"observed_at":"2026-08-01T23:45:16.890460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15265","last_updated":"2026-07-16T17:55:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T19:45:23.483841Z","submitted_at":"2026-07-16T17:55:15Z","title":"SceneBind: Binding What and Where Across Vision, Audio and Language"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2607.15265."}