{"as_of":"2026-08-08T01:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9702f3641f161842b409ddc390184834770c050e149ba355c97e8f047de30e0","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:50:53.648115Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T23:39:22.070629Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T23:45:08.222067Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"cited_work":{"arxiv_id":"2506.05414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05414","snapshot_observed_at":"2026-06-30T23:45:08.222067Z","title":"Savvy: Spatial awareness via audio-visual llms through seeing and hearing.arXiv preprint arXiv:2506.05414","venue":null,"work_id":"573c5c3d-87f8-4584-8a8b-e48ba5f539d7","year":2025},"citing_paper":{"arxiv_id":"2602.14122","last_updated":"2026-04-18T15:08:17Z","snapshot_observed_at":"2026-08-02T05:18:20.195131Z","submitted_at":"2026-02-15T12:46:35Z","title":"EgoSound: Benchmarking Sound Understanding in Egocentric Videos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T21:44:47.636912Z"},"links":{"cited_paper":"/paper/2506.05414","citing_paper":"/paper/2602.14122"},"observation_digest":"sha256:8df336c82447382242a8bf02f0e0770c751a122182aa6a08b27ebef3c94a84ad","observation_id":"ccdd4417-f720-4d73-a485-7bcd61c5b45d","resolution":{"observed_at":"2026-05-15T21:46:42.583892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"cited_work":{"arxiv_id":"2506.05414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05414","snapshot_observed_at":"2026-06-30T23:45:08.222067Z","title":"Savvy: Spatial awareness via audio-visual llms through seeing and hearing.arXiv preprint arXiv:2506.05414","venue":null,"work_id":"573c5c3d-87f8-4584-8a8b-e48ba5f539d7","year":2025},"citing_paper":{"arxiv_id":"2605.07061","last_updated":"2026-05-29T22:08:19Z","snapshot_observed_at":"2026-08-03T12:53:30.755817Z","submitted_at":"2026-05-08T00:14:07Z","title":"Do Joint Audio-Video Generation Models Understand Physics?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T23:39:22.070629Z"},"links":{"cited_paper":"/paper/2506.05414","citing_paper":"/paper/2605.07061"},"observation_digest":"sha256:cb675c0c5697c034e7af228ce8c393b9307f0a57a1863c1f437415f7ca353ebc","observation_id":"162511d4-657a-4d71-8e94-51887078ef76","resolution":{"observed_at":"2026-06-30T23:45:08.223574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"cited_work":{"arxiv_id":"2506.05414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05414","snapshot_observed_at":"2026-06-30T23:45:08.222067Z","title":"Savvy: Spatial awareness via audio-visual llms through seeing and hearing.arXiv preprint arXiv:2506.05414","venue":null,"work_id":"573c5c3d-87f8-4584-8a8b-e48ba5f539d7","year":2025},"citing_paper":{"arxiv_id":"2605.18194","last_updated":"2026-05-18T10:32:56Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:32:56Z","title":"Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T10:10:31.059095Z"},"links":{"cited_paper":"/paper/2506.05414","citing_paper":"/paper/2605.18194"},"observation_digest":"sha256:090c07ec3199efc6a64a41258c9afbb73cee761600fa5a93e260fc9dc7273cba","observation_id":"1105d00a-a7c5-41f2-b56c-abe588f4d4b2","resolution":{"observed_at":"2026-05-20T10:13:11.900409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05414/citation-record","integrity":"/paper/2506.05414/integrity","json":"/paper/2506.05414/citation-record.json","paper":"/paper/2506.05414"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.213723Z","title":"Shelton and Timothy P","venue":null,"work_id":"0d71a8c2-3c7e-447d-bb9b-aff91b857202","year":2001},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.562058Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:9eda3d9856745b578d1e4f6daccf09bfa07c1af50baf38605923cb9b6bfe505e","observation_id":"51c70d91-d0d3-4485-9597-c4635738810b","resolution":{"observed_at":"2026-08-07T10:50:55.218328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.568788Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.568788Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:8d8119b36f916b6d59ee4ef9eb27e9aa81e8d9793bc12f0921f55a78ece9ce16","observation_id":"54604aca-b920-4463-a66d-cc2af4ca5b7f","resolution":{"observed_at":"2026-08-07T10:50:52.568788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T10:50:52.575432Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember and Recall Spaces.arXiv preprint arXiv:2412.14171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.575432Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:dbd7a308b54393ad1b25719bf2ff929a54b3c0ff4c023028c569c585ea4bb6d7","observation_id":"8d839f7c-d13a-4593-8741-4824627e8516","resolution":{"observed_at":"2026-08-07T10:50:52.575432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.581847Z","title":"Tenenbaum, Celso Miguel de Melo, Madhava Krishna, Liam Paull, Florian Shkurti, and Antonio Torralba","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.581847Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:93a96f824e23941a7c619f1beec2241294530c6d43654ec862cf641c4f46906e","observation_id":"d9994da5-2214-47aa-967d-1499f0e1d1ef","resolution":{"observed_at":"2026-08-07T10:50:52.581847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-07T23:35:09.059226Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-07T10:50:52.588064Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.588064Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:e067d9ea8e7caddcd097d2d331ebc5b31521bc30d5247bfcd3b17dfa2712c793","observation_id":"7ab239f0-022e-42d6-bc5d-4a37fbd8672b","resolution":{"observed_at":"2026-08-07T10:50:52.588064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.596168Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.Advances in Neural Information Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.596168Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:16703765c7e18299066ba3a6942f1e0f54b8bf99031718bc45fe953183918401","observation_id":"30493e97-6e53-4e79-89a1-589441b5d889","resolution":{"observed_at":"2026-08-07T10:50:52.596168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.603103Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.603103Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:ed5c0eb17f42e3fb321ba0c207fdfe0210dda7bd28b57f2bb8fe1625e6d03f6a","observation_id":"c43455d5-fd59-416f-a947-1c9b60b35c83","resolution":{"observed_at":"2026-08-07T10:50:52.603103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.610231Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.610231Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:4b855a7e1e0013d510a79414d69bf77323838e989f5d4a2e0d16ce8ea130cd3a","observation_id":"d85400df-0ead-4fef-bad4-b78914fb1e5b","resolution":{"observed_at":"2026-08-07T10:50:52.610231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.617297Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.617297Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:6d20b6aace7c48706123e32c6c1fe731a27f0dbdc2eadbb2f297a295bf8f1383","observation_id":"a4d67649-81ae-4855-8570-07441948562b","resolution":{"observed_at":"2026-08-07T10:50:52.617297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.624322Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.624322Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:704e7fd9236f412ba2a1b305913f1311af1556829ad308784404f64538da1a7c","observation_id":"e126f361-8d8a-4cd4-9614-0a94ea7d0776","resolution":{"observed_at":"2026-08-07T10:50:52.624322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-07T10:50:52.630717Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision).arXiv preprint arXiv:2309.17421, 9(1):1, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.630717Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:b37da8b0218cdde28927786ed5ca61e7641e1e04cb5b1199b2140d7b77609ac8","observation_id":"5815ef23-37f8-41bd-a5f7-b5a5bbffcd90","resolution":{"observed_at":"2026-08-07T10:50:52.630717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T10:50:52.638441Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.638441Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:15c7170ec52304ccaa1c3c16d71ca82d819778fd4b42562e84dd9ead53fa42c9","observation_id":"1b379fc0-4ef3-45e3-93b6-51201ac64726","resolution":{"observed_at":"2026-08-07T10:50:52.638441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T10:50:52.645520Z","title":"Videochat: Chat-centric video understanding.arXiv preprint arXiv:2305.06355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.645520Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:d387472a4164440485ac14563225d96aa66dd9082fc4f9f48ab61a1cce9c0904","observation_id":"d7856dab-999d-4b83-a02d-48a4ba13866f","resolution":{"observed_at":"2026-08-07T10:50:52.645520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T10:50:52.652513Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding.arXiv preprint arXiv:2306.02858, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.652513Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:3be168dc500413dbf55a769e7ba3668194be0283264323a76ebec7389803d067","observation_id":"961cccdb-6df9-40ec-8327-66d0ad9ea2b4","resolution":{"observed_at":"2026-08-07T10:50:52.652513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T10:50:52.658655Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.658655Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:c9c4ad26d235bd7f1d62327ad817182d4af5f5e5d05fb35be43c2d2a09146c06","observation_id":"64518349-8e1d-4ed3-8a5c-6eb46e3d765a","resolution":{"observed_at":"2026-08-07T10:50:52.658655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T10:50:52.664757Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.664757Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:80c3e9d8f4b160845da333e39ef62d5d6522c23e4c33764932324b3103d9125e","observation_id":"3d34628c-381a-41de-ae2a-00fadf19fe1e","resolution":{"observed_at":"2026-08-07T10:50:52.664757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T10:50:52.670777Z","title":"Listen, think, and understand.arXiv preprint arXiv:2305.10790, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.670777Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:48f8716fd09786216b554244f2bcffcd38af0ff29df6421a674cc525f6e79f5b","observation_id":"b19e6aaa-7840-46aa-9110-6e641672ca3c","resolution":{"observed_at":"2026-08-07T10:50:52.670777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T10:50:52.677692Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models.arXiv preprint arXiv:2311.07919, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.677692Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:4a6bc8515bef6c55fd961593274b0b45c4140e82adc182e156ec03b9450fe221","observation_id":"fbef4dad-59d5-4be8-ba15-309b10b28eb1","resolution":{"observed_at":"2026-08-07T10:50:52.677692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-07T10:50:52.684460Z","title":"Kimi-audio technical report.arXiv preprint arXiv:2504.18425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.684460Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:13e0544f1836741b09b0e2f3b7b6eb2b33971eff44c6b673969cbff1e98c5f5f","observation_id":"2f83e2ec-4967-4a44-8c46-197267c26a52","resolution":{"observed_at":"2026-08-07T10:50:52.684460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.130804Z","title":"Audio-reasoner: Improving reasoning capability in large audio language models, 2025","venue":null,"work_id":"66ee74d1-3d58-4011-801f-db537b0ac8ec","year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.691260Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:816f318f324b78f749d4d3ca1be4082b7b85847fcdd041713e9474f8f545f104","observation_id":"95790d61-6845-4e0e-9e17-22c7694b5a54","resolution":{"observed_at":"2026-08-07T10:50:55.135905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T10:50:52.698238Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.698238Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:7a10236d166ac5e34d2bba9b32a91bd36d810f2d62c1bdb36517743232a98393","observation_id":"f773e9ef-4b51-40a0-b55a-e8f37e6c6c5d","resolution":{"observed_at":"2026-08-07T10:50:52.698238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19772","last_updated":"2025-03-20T11:55:30Z","snapshot_observed_at":"2026-07-06T19:58:57.119904Z","submitted_at":"2024-11-29T15:18:06Z","title":"LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19772","snapshot_observed_at":"2026-08-07T10:50:52.705026Z","title":"Longvale: Vision-audio-language-event benchmark towards time-aware omni-modal perception of long videos.arXiv preprint arXiv:2411.19772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.705026Z"},"links":{"cited_paper":"/paper/2411.19772","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:4b31a7908d593e156746d7583e4948c8ff38ab2a3e63c53d7df5545b74f80c62","observation_id":"f5dcc519-42f4-4923-9c3a-02a13a5e89ac","resolution":{"observed_at":"2026-08-07T10:50:52.705026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.712377Z","title":"Egolife: Towards egocentric life assistant, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.712377Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:d67b09c5cf72151613439e4ef9c39af409b3948070b5c1faf177920eaa6f6801","observation_id":"1286094a-ef5e-48ac-9c06-67421896a221","resolution":{"observed_at":"2026-08-07T10:50:52.712377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T10:50:52.719441Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.719441Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:2f83cf67ac9657b508b571c7d6574da7f5c0757d2017370c346b61cc299154f1","observation_id":"757897fa-3c40-4072-bca9-bb4530bc2848","resolution":{"observed_at":"2026-08-07T10:50:52.719441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T10:50:52.728028Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.728028Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:bcb44a7da5a3136d045320ab4e800d02035290454ec6008563600965aeec0472","observation_id":"a410c64e-8898-4152-9fd8-a7bd08e38da9","resolution":{"observed_at":"2026-08-07T10:50:52.728028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.105754Z","title":"video-SALMONN: Speech-enhanced audio-visual large language models","venue":null,"work_id":"b43c3a32-edee-4e09-a721-bea8a847f53e","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.734466Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:85908d7dc1faff770a57b3a47256aa09ab74983d28a210a1151a8b521cb6fcae","observation_id":"e8db80ae-0bf3-485d-b398-3fc0753f61e4","resolution":{"observed_at":"2026-08-07T10:50:55.110689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.088905Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":"653a8265-568d-4ca8-a01b-3d73b1fee2fd","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.741622Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:0d7bd1bf5bf1eaad17e98808131bcec9903139f9d967488c913b6155da3dff38","observation_id":"d2d7f427-c064-4870-b456-31241f56a0db","resolution":{"observed_at":"2026-08-07T10:50:55.094678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.069854Z","title":"X-instructblip: A framework for aligning x-modal instruction-aware representations to llms and emergent cross-modal reasoning, 2023","venue":null,"work_id":"8451b47d-1c7e-4fb8-8e82-10dd9a217170","year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.749258Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:0c435c187a4ce55fd898cd8882c09943655b13742458726ced785bcb7cf7d190","observation_id":"b7dc4d74-c4f0-4614-b6be-86224e0a7b4e","resolution":{"observed_at":"2026-08-07T10:50:55.076047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T10:50:52.756287Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv preprint arXiv:2306.14824, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.756287Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:8ef1525ff9f5c895fc7ace5a4d76bf214a1769c55bd575022529d47de9a8237d","observation_id":"20a70e97-adf7-4fe3-8876-f3fb30f6b31e","resolution":{"observed_at":"2026-08-07T10:50:52.756287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-07T10:50:52.761992Z","title":"Ferret: Refer and ground anything anywhere at any granularity.arXiv preprint arXiv:2310.07704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.761992Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:bdc15bc062a2ac05b16dce1bc3609f3a52538e74824b6f65eee6496c1679a19f","observation_id":"c633c6df-ccb1-4ba4-9085-88e1fd92b35f","resolution":{"observed_at":"2026-08-07T10:50:52.761992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-07T10:50:52.768322Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models.arXiv preprint arXiv:2404.07973, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.768322Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:3f8e8c90e80d2087314d140382223919576eed67f6717b2e312597f82caee3c3","observation_id":"061cff8b-33b5-4e83-a9cd-f71616a5ae0e","resolution":{"observed_at":"2026-08-07T10:50:52.768322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.047814Z","title":"Robohop: Segment-based topological map representation for open-world visual navigation","venue":null,"work_id":"34c10e8e-8f12-44b2-aea5-65571e2d4a94","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.775435Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:95eb1dd3d15a6de0dfa4eb6d39d72d067bec43cbf5279a0543665cd6e8cace8f","observation_id":"c14d7703-8bd6-4d2b-88ae-881a8999a0dd","resolution":{"observed_at":"2026-08-07T10:50:55.054845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.782291Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.782291Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:4579f528a13f39a7187f4c9744a741bc39c7d13fcaa0b6bcafa85572c87d489b","observation_id":"26c96cbc-7529-41bd-b782-88ab2c7aae1d","resolution":{"observed_at":"2026-08-07T10:50:52.782291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:55.012653Z","title":"3d-mem: 3d scene memory for embodied exploration and reasoning, 2024","venue":null,"work_id":"af9ad727-e0b0-4443-924f-40aac91b0401","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.789671Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:9324964e47e5a99af09d25eff6609fc869dd1e7184d2d1563ad44637856c02dc","observation_id":"5615034d-7b85-4e48-83af-89adf22e580d","resolution":{"observed_at":"2026-08-07T10:50:55.021240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-03T20:40:12.599818Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01163","snapshot_observed_at":"2026-08-07T10:50:52.796197Z","title":"3d-llava: Towards generalist 3d lmms with omni superpoint transformer.arXiv preprint arXiv:2501.01163, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.796197Z"},"links":{"cited_paper":"/paper/2501.01163","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:c6a7c59d8982580e074638ca4350e06cfe12cd9e6afecdf4590d5f57fe1e1b1e","observation_id":"cfa85fcf-2cdf-4e1d-8934-7ba0409f6ef4","resolution":{"observed_at":"2026-08-07T10:50:52.796197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00493","last_updated":"2025-03-27T10:30:42Z","snapshot_observed_at":"2026-07-06T19:59:28.832182Z","submitted_at":"2024-11-30T14:28:53Z","title":"Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00493","snapshot_observed_at":"2026-08-07T10:50:52.802988Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding.arXiv preprint arXiv:2412.00493, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.802988Z"},"links":{"cited_paper":"/paper/2412.00493","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:a2690301622c14a57be3180577a0d4e9d4066b802b7e4a6190a32fc85a5456cf","observation_id":"3eabc801-a4d0-4b7b-ae40-b2bc915861bf","resolution":{"observed_at":"2026-08-07T10:50:52.802988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.809764Z","title":"Gridmm: Grid memory map for vision-and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.809764Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:416aeb95693eec91be4fe0090aeb1192692b19f270a596eed8f60d48fbb91e21","observation_id":"279161f6-8053-4e84-a3bf-af5e8044a284","resolution":{"observed_at":"2026-08-07T10:50:52.809764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.978683Z","title":"Visual language maps for robot navigation","venue":null,"work_id":"0d283501-1cfd-4a68-9fff-ea9a6bd11181","year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.816719Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:b61386804d9ca3e873206a8059769e2c7ea253a2cbfdca57bdc7c15e7a0e87c2","observation_id":"1f6e8217-2a87-4753-8dee-63be6fbd7fbc","resolution":{"observed_at":"2026-08-07T10:50:54.985179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00734","last_updated":"2024-12-01T08:59:30Z","snapshot_observed_at":"2026-08-07T03:42:58.749421Z","submitted_at":"2024-12-01T08:59:30Z","title":"ChatSplat: 3D Conversational Gaussian Splatting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00734","snapshot_observed_at":"2026-08-07T10:50:52.823519Z","title":"Chatsplat: 3d conversational gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.823519Z"},"links":{"cited_paper":"/paper/2412.00734","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:a3eaa8ca54e51aa406933a1eaa0d3226cb60f2e7f529e2ba6c0faa5806aa296e","observation_id":"88f90bd5-fb71-45df-912b-dd854a51244c","resolution":{"observed_at":"2026-08-07T10:50:52.823519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.957199Z","title":"Language embedded 3d gaus- sians for open-vocabulary scene understanding","venue":null,"work_id":"4fc4d24f-1255-4f41-92b3-10896c8b0456","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.831954Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:0d5e977d2c859fae0e34d6a5bd655f575d4f47eca6ef771abc9e7e4b4c208429","observation_id":"b1d1f0eb-5cd9-4f36-aa76-5afbb6c206db","resolution":{"observed_at":"2026-08-07T10:50:54.965124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:50:52.840774Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.840774Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:924dddb5c12716651c5d4545e4f206f2f7869bfa6992c0735a085397d86548a9","observation_id":"c43b3d02-3cd2-42ba-af71-3d520818c96b","resolution":{"observed_at":"2026-08-07T10:50:52.840774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.940113Z","title":"Sound event localization and detection of overlapping sources using convolutional recurrent neural networks","venue":null,"work_id":"f2bd592a-cf1c-4ecb-be29-41707281e676","year":2018},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.848124Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:283920190cec85c38dd058a03ba21216f3fefb71f1ab609f4af3284123a20130","observation_id":"fff3a9a3-9b5c-44a7-98dd-53a5720c8082","resolution":{"observed_at":"2026-08-07T10:50:54.945823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.921664Z","title":"Robust sound source tracking using srp-phat and 3d convolutional neural networks.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 29:300–311, 2020","venue":null,"work_id":"ca68334f-942a-4471-9eb4-d15f5312bf31","year":2020},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.854282Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:70c2163168fb6643b0270c65ea5762c64bb7e163c5bbd8d1647a909b8a28c787","observation_id":"604093e5-88f7-44b7-8c2a-be60f54dca3f","resolution":{"observed_at":"2026-08-07T10:50:54.927560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01591","last_updated":"2025-05-17T22:03:39Z","snapshot_observed_at":"2026-07-06T17:24:24.953352Z","submitted_at":"2024-02-02T17:34:53Z","title":"BAT: Learning to Reason about Spatial Sounds with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01591","snapshot_observed_at":"2026-08-07T10:50:52.861092Z","title":"Bat: Learning to reason about spatial sounds with large language models.arXiv preprint arXiv:2402.01591, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.861092Z"},"links":{"cited_paper":"/paper/2402.01591","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:b3178be3c4438e3148cfb5e3f9c2323a40a65a2a45898b08d986f959b8257cd5","observation_id":"efc636f5-7775-4511-97f9-5a2ddf7bfe92","resolution":{"observed_at":"2026-08-07T10:50:52.861092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T10:50:52.869518Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.869518Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:ed12dc90c6214b4cd88e5813b485c1708b0199ae7e078e466022d7097d2090d8","observation_id":"bb8ad452-b6a5-4306-b951-3c05b1870867","resolution":{"observed_at":"2026-08-07T10:50:52.869518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.902739Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"e3272df7-23b6-4e46-aa4f-b30629be56f5","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.877319Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:22b12e6171a9c88626bdfa55867539acf2050c10edc9d21b9e17514210293190","observation_id":"bc12e5ea-1e8b-4171-9691-9bf612a8fdfb","resolution":{"observed_at":"2026-08-07T10:50:54.909983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.882782Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.882782Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:ca0a5c25781f0c83d6dc94e1c8de6630e10d5f669ce8c7c3ad1acb6f26cd31bb","observation_id":"635378ff-4dab-49c3-9e8d-0bf0d600d337","resolution":{"observed_at":"2026-08-07T10:50:52.882782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-07T10:50:52.887571Z","title":"Video-bench: A comprehensive benchmark and toolkit for evaluating video-based large language models.arXiv preprint arXiv:2311.16103, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.887571Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:747033e9ea8d24599dfe21696dfcd239ff9151daf9db5531ab7e10ed36eba699","observation_id":"7015e766-957a-4caa-ae1a-f5ee80c334fc","resolution":{"observed_at":"2026-08-07T10:50:52.887571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:52.895136Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.895136Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:5a9c9ff4962c1c331a777bd4b4c62173f73cab91d378d491b7a610913af2dfd5","observation_id":"b6c4f11c-2b5b-40bf-8e1d-df83df2d7f6e","resolution":{"observed_at":"2026-08-07T10:50:52.895136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T10:50:52.925613Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.925613Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:f97c23bf897787134e8d1a9aaa6f9764419deac7432be83080725dd8d895b79e","observation_id":"1b58dd93-e748-4d80-b495-5a2a619c530e","resolution":{"observed_at":"2026-08-07T10:50:52.925613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.714408Z","title":"Egotaskqa: Understanding human tasks in egocentric videos.Advances in Neural Information Processing Systems, 35:3343–3360, 2022","venue":null,"work_id":"6f2bbe03-ad4c-4ef0-a9ef-1b3c62c66c5b","year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.049207Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:a1590c1040dbdf19fabec7a916c03b4b6d65772fefea43e43cf16df9f33e3057","observation_id":"310fc69f-3eaf-45d3-aa84-59b71bcd55fb","resolution":{"observed_at":"2026-08-07T10:50:54.725195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:53.186552Z","title":"Vitatecs: A diagnostic dataset for temporal concept understanding of video-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.186552Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:f3b960c2f5f669110f8000c567f16a1ccadacabb28efe6da2109899b3030ae07","observation_id":"19258998-a866-4f9e-8f3f-d97f04b0a596","resolution":{"observed_at":"2026-08-07T10:50:53.186552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T10:50:53.344906Z","title":"Tempcompass: Do video llms really understand videos?arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.344906Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:b42e6b537fbe6c4dc610f6d85a53e4a509630651713cd9e2b63cdc7f087f1e66","observation_id":"9c23d341-727b-45fe-a305-5e5ebaa9831e","resolution":{"observed_at":"2026-08-07T10:50:53.344906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13646","last_updated":"2025-03-17T18:50:36Z","snapshot_observed_at":"2026-08-07T16:56:49.420728Z","submitted_at":"2025-03-17T18:50:36Z","title":"Omnia de EgoTempo: Benchmarking Temporal Understanding of Multi-Modal LLMs in Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13646","snapshot_observed_at":"2026-08-07T10:50:53.504475Z","title":"Omnia de egotempo: Benchmarking temporal understanding of multi-modal llms in egocentric videos.arXiv preprint arXiv:2503.13646, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.504475Z"},"links":{"cited_paper":"/paper/2503.13646","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:72f94551e0bf00a04c24843accc3649966025fe5b75bbce35160c8fae331ca76","observation_id":"de2fd68e-6b4e-4389-82a8-f67a378ad5e7","resolution":{"observed_at":"2026-08-07T10:50:53.504475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.564012Z","title":"Tackling data bias in music-avqa: Crafting a balanced dataset for unbiased question-answering","venue":null,"work_id":"756b99e9-b5eb-4b4c-90d2-9795125082d6","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.539032Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:d7d08e56cf11732159046d6fbcd093aa1303ac8383c841c9fca90985696c3fb3","observation_id":"5bb61c32-e1aa-46ba-831d-2129db380b73","resolution":{"observed_at":"2026-08-07T10:50:54.669457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:53.543428Z","title":"Avqa: A dataset for audio-visual question answering on videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.543428Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:90367198689eaf290b61dd9028e51d6aeb7fed9fe7e9d4bcf5725afe76521617","observation_id":"def4e580-b561-4b44-a3c7-3a91abb81f92","resolution":{"observed_at":"2026-08-07T10:50:53.543428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.392124Z","title":"Pano-avqa: Grounded audio-visual question answering on 360deg videos","venue":null,"work_id":"97c827c6-db0a-41f0-8ec0-18893d9a1af6","year":2021},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.548005Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:bd94ce61108470f24212bfd4ae1cb7a74c93de84de9f679fb6fd1da2c0f97550","observation_id":"49b099fd-7b1b-4ebf-95bc-c124ef5a7b27","resolution":{"observed_at":"2026-08-07T10:50:54.416844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.369759Z","title":"Egocentric audio-visual object localization","venue":null,"work_id":"0933f3f7-553f-4e37-bb6e-cd3aa1a1bb08","year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.553335Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:32c9a14ba45dab97b9b24e3be02d84bf5dbfd0e5d553d6f118384d48bc983b36","observation_id":"729992a3-cf9f-4247-93aa-6672fe9925b3","resolution":{"observed_at":"2026-08-07T10:50:54.377983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:53.558636Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.558636Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:eecddcc892587893dfac9cb7cb7f942f232121b60704e4a55be37785bb50915f","observation_id":"aa926751-849e-4ffe-be82-aada78b03281","resolution":{"observed_at":"2026-08-07T10:50:53.558636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13349","last_updated":"2024-02-22T03:37:36Z","snapshot_observed_at":"2026-08-07T04:03:49.639867Z","submitted_at":"2024-02-20T19:53:15Z","title":"Aria Everyday Activities Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13349","snapshot_observed_at":"2026-08-07T10:50:53.578305Z","title":"Aria everyday activities dataset.arXiv preprint arXiv:2402.13349, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.578305Z"},"links":{"cited_paper":"/paper/2402.13349","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:1640dbb922b98b21d1d26723e4cca20e1e13220a376d2340be313eff68b82d8f","observation_id":"cdab30bd-6328-42ec-a59f-65cd428c537e","resolution":{"observed_at":"2026-08-07T10:50:53.578305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10224","last_updated":"2024-06-14T17:57:35Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:57:35Z","title":"EFM3D: A Benchmark for Measuring Progress Towards 3D Egocentric Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10224","snapshot_observed_at":"2026-08-07T10:50:53.582860Z","title":"Efm3d: A benchmark for measuring progress towards 3d egocentric foundation models.arXiv preprint arXiv:2406.10224, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.582860Z"},"links":{"cited_paper":"/paper/2406.10224","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:3c9f06dbebae4ba3cb36f5bcf2613688b302849166d6cc8ace1b47c7d91394f1","observation_id":"535037db-2991-4d05-9af7-42db1e362124","resolution":{"observed_at":"2026-08-07T10:50:53.582860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.336364Z","title":"Photo-slam: Real-time simul- taneous localization and photorealistic mapping for monocular stereo and rgb-d cameras","venue":null,"work_id":"eaf0dd64-1222-40c6-8a07-bc2cac67d8f5","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.589037Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:70517b2bf6ce26936e079a1c941d9ed75d2bffc4f37fb5f72686f9bd21b7d158","observation_id":"807f7348-d4b2-45c7-ba36-a2e8112298f8","resolution":{"observed_at":"2026-08-07T10:50:54.344003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.314743Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":"da084f06-00d5-419a-ad94-72a522fe1f12","year":2022},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.594292Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:e911284246bad66ce07931d671385e4a94c3cfebc7c0571e60143c694d874ac2","observation_id":"1fc0ec9a-3838-4591-b4fa-0b8096f1dfec","resolution":{"observed_at":"2026-08-07T10:50:54.322048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T10:50:53.598703Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.598703Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:65a0374b9baf355345a81b93bfeff13ca5c4543297464278f4e9638c63d182bd","observation_id":"3bca59fb-6576-4c28-8f48-23d558462aba","resolution":{"observed_at":"2026-08-07T10:50:53.598703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-07T10:50:53.604010Z","title":"Zoedepth: Zero-shot transfer by combining relative and metric depth.arXiv preprint arXiv:2302.12288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.604010Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:56f96c35dc503e90994fa30a9bc31754c70d067477d4f2aadda1806a26f272ff","observation_id":"d4850f78-4ad4-4792-a478-502cc15fb36c","resolution":{"observed_at":"2026-08-07T10:50:53.604010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.294823Z","title":"Brown University, 2000","venue":null,"work_id":"6dd0bc80-a3c3-40fe-8904-bcf40e03c97e","year":2000},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.610157Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:492cdd91511dc95f866983b42011d98a6311fd10869bc38d2cf6c4eef47c44c9","observation_id":"9f425254-a64c-4200-8c14-fc01a2b8f709","resolution":{"observed_at":"2026-08-07T10:50:54.300866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.275925Z","title":"Coherent-to-diffuse power ratio estimation for dere- verberation.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 23(6):1006– 1018, 2015","venue":null,"work_id":"b5b45e8f-1dd8-4108-bf8b-e87e407d3073","year":2015},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.616226Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:913e2dc58e978b3a6e6d01806c452a673e0c7c4823023feb166c000b9ad29e8b","observation_id":"5eb5c881-4c66-4058-9e95-398f0fe18c18","resolution":{"observed_at":"2026-08-07T10:50:54.282138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:53.621308Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.621308Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:143566b1aacb388d4b2067d0f00d88179a7e52f773c92f3c49ef0cec1d79a92c","observation_id":"91ed6964-f625-4b2b-8f82-fc619039816a","resolution":{"observed_at":"2026-08-07T10:50:53.621308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.247833Z","title":"A new approach to linear filtering and prediction problems.Transactions of the ASME–Journal of Basic Engineering, 82(Series D):35–45, 1960","venue":null,"work_id":"b6d466ee-d2e6-4879-b52f-a865dbe52bae","year":1960},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.628005Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:2fef61d833e60e89a9d6b63d96ca66fc0bcde04e0413e1323ea8b70fbdb34feb","observation_id":"02188b04-effb-453d-b0b7-83a0edf3fc75","resolution":{"observed_at":"2026-08-07T10:50:54.254676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:53.635225Z","title":"The pascal visual object classes (voc) challenge.International Journal of Computer Vision, 88:303–338, 06 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.635225Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:ead7a60ea5a675fdbb47cc2499c89a48196f30da79643d5dcaebace55f702c98","observation_id":"c8411998-4f37-4049-accb-4eef08f76a8e","resolution":{"observed_at":"2026-08-07T10:50:53.635225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T10:50:53.641537Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models.arXiv preprint arXiv:2407.12772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.641537Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:b59659623bbc4936d911cf76b5231d6289d30e21b5b11bc82af3f1a456d54a12","observation_id":"aa89350e-5ea6-4487-b41b-6fccf2ed5fd6","resolution":{"observed_at":"2026-08-07T10:50:53.641537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:50:54.217514Z","title":null,"venue":null,"work_id":"f4861f91-7a79-4491-8b2f-49d59fbe0357","year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.648115Z"},"links":{"citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:4e8ffade265ab3ce684772c493ba63ff308cc657412586a800e4106799d86ec0","observation_id":"5d13a14a-8e9a-4e43-adc4-bf1ea64118bd","resolution":{"observed_at":"2026-08-07T10:50:54.224692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 3 inbound Pith citation observations for arXiv:2506.05414."}