{"as_of":"2026-08-07T06:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e353779c1bef8c79797fe8cebddda4f034383a27670b76d1457b23e3d6b16a5a","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:53:23.400359Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09584/citation-record","integrity":"/paper/2509.09584/integrity","json":"/paper/2509.09584/citation-record.json","paper":"/paper/2509.09584"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:16.711792Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:16.711792Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:97be8cca8767e9ba7afa4d6782f305c08388f107cc72e5721a19f7ddc4c93fe9","observation_id":"69f8be74-7cac-4b03-a998-323700a8bb09","resolution":{"observed_at":"2026-08-04T18:53:16.711792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:16.779199Z","title":"Ddd17: End-to-end davis driving dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:16.779199Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:d11b3cf14f0dfb894a431f97fc370bc068dc967313f0a65374696fad443024ee","observation_id":"d1f5e596-55f8-441e-91d0-d4cf340d0404","resolution":{"observed_at":"2026-08-04T18:53:16.779199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:16.875833Z","title":"A 240× 180 130 db 3 µs latency global shutter spatiotemporal vision sensor.IEEE Journal of Solid-State Circuits, 49(10):2333–2341, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:16.875833Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:39b4b8bf2f3bdc99fbdf69884dcd152f618b0e7bddfd96b00fc78c096bda32b0","observation_id":"69c1ee43-07b2-48ae-b118-ab830b972185","resolution":{"observed_at":"2026-08-04T18:53:16.875833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.025049Z","title":"Low-latency event- based visual odometry","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.025049Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:4ee5048f60092b063cac84a0af6434386f66c48ca3c480292213123a4d00112b","observation_id":"98c6c956-dcba-4818-8dd2-0d914c2d18dc","resolution":{"observed_at":"2026-08-04T18:53:17.025049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.086524Z","title":"Recent event camera innovations: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.086524Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:0c427a249473f9db124f05c733fcc01d27c38cf606103dbebf4ad17dddd002ea","observation_id":"812efb98-3bb6-4df0-a546-fca4dfcbabce","resolution":{"observed_at":"2026-08-04T18:53:17.086524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.171789Z","title":"Ani Hsieh, Christopher Korpela, Vijay Kumar, Camillo J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.171789Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:748110a7d3ea3476959168723ac490b05f35683be51c1c8e96b8c263f5d82d67","observation_id":"604bbfe8-1575-49fb-b0e0-df83954a0642","resolution":{"observed_at":"2026-08-04T18:53:17.171789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.228085Z","title":"Chang, and Matthias Nießner","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.228085Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3e6bf9e1a8b2186ced9eeab38c1e287c3a794cd38027fe131e8952770f9ef4ce","observation_id":"3120291f-ef87-4642-95bd-780b57ec269a","resolution":{"observed_at":"2026-08-04T18:53:17.228085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.328796Z","title":"Ecmd: An event- centric multisensory driving dataset for slam.IEEE Trans- actions on Intelligent Vehicles, 9(1):407–416, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.328796Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:ca63b8eebf21bcf4d7df3c577c0370f98e9a9e32ec2c59ecaac315ef7a8b693c","observation_id":"9dd5731d-f533-444f-9522-fec36163e9a6","resolution":{"observed_at":"2026-08-04T18:53:17.328796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.460244Z","title":"Label-free event-based object recognition via joint learning with image reconstruction from events","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.460244Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:ccc80e523a5270211f3cea72e260ec18607f52d5cc44b2b8600d133b65370b94","observation_id":"8449ba3d-9002-4fe7-af7e-5478e78a9ba0","resolution":{"observed_at":"2026-08-04T18:53:17.460244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.472259Z","title":"Hue dataset: High-resolution event and frame sequences for low-light vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.472259Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:5d52d9998301906dd8edae9a24536887d96cfe26c65b8f7f0ba6c563b3bac78f","observation_id":"1ebde21e-ece5-44c5-abea-f91f2ac3c1bd","resolution":{"observed_at":"2026-08-04T18:53:17.472259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.565742Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.565742Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:f3e9d5b263d0500bac6979837c53ed2f2b8236f9066455d30f2618659f785904","observation_id":"2de6aadd-110a-4a02-afae-093159054501","resolution":{"observed_at":"2026-08-04T18:53:17.565742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.718226Z","title":"Event-based vision: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(1):154–180, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.718226Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3e5d134d9e9b1520aa2bfa419b2a353ce6c0e6547a318f90ebe40f335d6de694","observation_id":"c19388c7-655a-4400-9167-f201aef53796","resolution":{"observed_at":"2026-08-04T18:53:17.718226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12324","last_updated":"2022-11-22T15:14:20Z","snapshot_observed_at":"2026-07-06T14:21:45.463565Z","submitted_at":"2022-11-22T15:14:20Z","title":"Pushing the Limits of Asynchronous Graph-based Object Detection with Event Cameras","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12324","snapshot_observed_at":"2026-08-04T18:53:17.922881Z","title":"Pushing the limits of asynchronous graph-based object detection with event cam- eras.arXiv preprint arXiv:2211.12324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.922881Z"},"links":{"cited_paper":"/paper/2211.12324","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:b606bd966e6ba202d5b3bf7b80ec44d358a0481757c7674e5a80b9e1957e88ef","observation_id":"cb074fa5-adc8-4d99-b9f9-b002b0c68582","resolution":{"observed_at":"2026-08-04T18:53:17.922881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.080959Z","title":"Low-latency auto- motive vision with event cameras.Nature, 629(8014):1034– 1040, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.080959Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:57daa726b98be1fad24bc7b6e46482b15db4ff1a2656e0fb2404e14f44b466f2","observation_id":"18caaa36-f412-4dfe-9ea3-e6e7f4bf35ec","resolution":{"observed_at":"2026-08-04T18:53:18.080959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.202202Z","title":"Derpa- nis, and Davide Scaramuzza","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.202202Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:53af2aa888cf1ad37b7d51afb1eb40b529edf3b0c026793777fedaf941a634ba","observation_id":"5fdf2387-b515-48bf-95b0-dcea9ddbb869","resolution":{"observed_at":"2026-08-04T18:53:18.202202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.285558Z","title":"Recurrent vision transformers for object detection with event cameras","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.285558Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:02bebc5155d7faf8810b6ef88b43d364b333e75c3e88e093fa7d47bc16abda93","observation_id":"1a25491f-8afb-4728-b0d6-35c88699b11e","resolution":{"observed_at":"2026-08-04T18:53:18.285558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.440348Z","title":"Dsec: A stereo event camera dataset for driving scenarios.RA-L, 6(3):4947–4954, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.440348Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:7db32a0e3e95d658745f9c7197fa5853f05f826c30a6840a3bf1dc25318ba0d8","observation_id":"3c0223c5-0866-42c2-8e35-87e5fc47245e","resolution":{"observed_at":"2026-08-04T18:53:18.440348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.547303Z","title":"Hierarchical neural memory network for low latency event processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.547303Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:ac70dd0fae8f7c6e05cec3d1141a50e959b756d2bf29a414d007552a672ccb8c","observation_id":"38aad683-308f-4962-81d7-1aa0b95ee867","resolution":{"observed_at":"2026-08-04T18:53:18.547303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14178","last_updated":"2024-06-20T10:36:24Z","snapshot_observed_at":"2026-08-02T22:53:22.733522Z","submitted_at":"2024-06-20T10:36:24Z","title":"EvSegSNN: Neuromorphic Semantic Segmentation for Event Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14178","snapshot_observed_at":"2026-08-04T18:53:18.693039Z","title":"Evsegsnn: Neuromor- phic semantic segmentation for event data.arXiv preprint arXiv:2406.14178, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.693039Z"},"links":{"cited_paper":"/paper/2406.14178","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:e80553352e12cce2d5e0a9d56ef68ff9d9de22b93fbcdda92980da4349b7cd16","observation_id":"38340529-7389-4bde-9620-4e99574ff1b9","resolution":{"observed_at":"2026-08-04T18:53:18.693039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.804191Z","title":"Event-aided direct sparse odometry","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.804191Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:32ebaefa85b789112f0cf301f9d4ebecbb57044a80875b8c63196b082dbfd410","observation_id":"fbdb2d52-d332-4dfb-8201-ca949ba2871f","resolution":{"observed_at":"2026-08-04T18:53:18.804191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.904765Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.904765Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3a983e2adea618aa8b063e4fcdc70ade0dfd8586a68d1986bfd73b53383879b2","observation_id":"c1612e61-40f1-48e5-8a64-d4f37246e77b","resolution":{"observed_at":"2026-08-04T18:53:18.904765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.007993Z","title":"To- wards robust event-based networks for nighttime via un- paired day-to-night event translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.007993Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:9faf07042738cda2d424188d3340c87750826addad0aaf597c1db1fcbb320a89","observation_id":"e6cf6090-8380-4912-91a8-0dcf3bd6087f","resolution":{"observed_at":"2026-08-04T18:53:19.007993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.116994Z","title":"Efficient learning of event-based dense representation using hierarchical mem- ories with adaptive update","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.116994Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:d5b26316c748f1a9d88f27964c0e0c40ab05f78b2c7eb20dc7ced430843bbde3","observation_id":"b07174ee-b7ff-4c9b-afe7-69ff6ceb6594","resolution":{"observed_at":"2026-08-04T18:53:19.116994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.219250Z","title":"Mdetr- modulated detection for end-to-end multi-modal understand- ing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.219250Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:0ee6e26e8b55f182290cf50b51cbb1704f7c0439b93b81f20d09264eb079a364","observation_id":"8de88b94-d785-436a-a551-ea26c542909e","resolution":{"observed_at":"2026-08-04T18:53:19.219250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.332871Z","title":"N-imagenet: Towards robust, fine-grained object recognition with event cameras","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.332871Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:de8a9192c6c1d8afe4904d7406d8da9459be8d91f25a7379ee66b16118444a99","observation_id":"5f94b1a8-501b-4bfb-a98b-b86d1f6d491f","resolution":{"observed_at":"2026-08-04T18:53:19.332871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.384828Z","title":"Text2pos: Text-to-point-cloud cross-modal localiza- tion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.384828Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:52cca264d16f159cba3b26ff3c69589c61d64b436542da87c91904b770a8b4e7","observation_id":"e636b6b6-0efd-44cf-a42e-336769241ac4","resolution":{"observed_at":"2026-08-04T18:53:19.384828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.470423Z","title":"Cot- tereau, and Wei Tsang Ooi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.470423Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:40fe64c23763585f22846fec8dddb6b59fbcc6bf9a8d6af65ef7133ed9511beb","observation_id":"591eee3d-5201-400a-a832-6d45a007cf84","resolution":{"observed_at":"2026-08-04T18:53:19.470423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.515309Z","title":"Cottereau","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.515309Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:c616b66b4db62762a6cf69238f1f4456b75b8d7a28b32cb172cdc72be3406f66","observation_id":"0cec2ff5-7746-4472-8cd6-c47af8cb8d5c","resolution":{"observed_at":"2026-08-04T18:53:19.515309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.618601Z","title":"Geochat: Grounded large vision-language model for remote sensing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.618601Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:c86cd34ddaf29d2f6a0a7ed0ab305b0c488bb53f10adfa52f5381015f24c0a51","observation_id":"7959cc76-6d31-4504-bdae-4f24635120d7","resolution":{"observed_at":"2026-08-04T18:53:19.618601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.674869Z","title":"Seeground: See and ground for zero-shot open- vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.674869Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:9c8e7f570d1a1fe90aa3b649e3fc88d1d1e58a9b50ff487e3b74d7d09ba55264","observation_id":"c4b6f792-9791-421a-954e-bf645d135e37","resolution":{"observed_at":"2026-08-04T18:53:19.674869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.772654Z","title":"Wildrefer: 3d object localization in large-scale dynamic scenes with multi-modal visual data and natural language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.772654Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:20924c90873cb97a2423fa09b86218424a8683dca139aa66b5977dfa4ef4ecbe","observation_id":"32ce420a-2a4b-4cc4-8520-fc47f1705e98","resolution":{"observed_at":"2026-08-04T18:53:19.772654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.882366Z","title":"Context-aware biaffine localizing network for temporal sentence grounding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.882366Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:8efdfdc5885b9029cc1404b07425844e0e656d28d8373596c60b334a2776711a","observation_id":"78f4b495-06a5-4a18-824a-f05c2809d2e7","resolution":{"observed_at":"2026-08-04T18:53:19.882366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.038042Z","title":"Explor- ing optical-flow-guided motion and detection-based appear- ance for temporal sentence grounding.IEEE Transactions on Multimedia, 25:8539–8553, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.038042Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:47da8dc4cbc25171871022076a8a64b454546b35eedec10aa3667604b7948cb5","observation_id":"81f6967e-e016-4b5a-89ec-df26cbbb2dcf","resolution":{"observed_at":"2026-08-04T18:53:20.038042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05785","last_updated":"2024-07-22T03:21:27Z","snapshot_observed_at":"2026-08-05T03:56:22.669895Z","submitted_at":"2024-06-09T13:52:12Z","title":"A Survey on Text-guided 3D Visual Grounding: Elements, Recent Advances, and Future Directions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05785","snapshot_observed_at":"2026-08-04T18:53:20.096462Z","title":"A survey on text-guided 3d visual grounding: elements, recent advances, and future directions.arXiv preprint arXiv:2406.05785, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.096462Z"},"links":{"cited_paper":"/paper/2406.05785","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:59a5e70af237e13c331fc7652f52785fdd85914212e182ca3f398639aca50c69","observation_id":"9b9c0c3d-8455-4aa1-bcb5-17bf349d7ccf","resolution":{"observed_at":"2026-08-04T18:53:20.096462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.171807Z","title":"Flexevent: Towards flexible event-frame object detection at varying operational frequen- cies.arXiv preprint arXiv:2412.06708, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.171807Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:648f9ab983f8df085e5ac7829df42ac231c8582a1e08cbb32bb10449d817538a","observation_id":"e163339a-9e25-4824-b2a7-1d658ec8ee71","resolution":{"observed_at":"2026-08-04T18:53:20.171807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.278165Z","title":"Maqueda, Antonio Loquercio, Guillermo Gallego, Narciso Garc´ıa, and Davide Scaramuzza","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.278165Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:74ae0c81de663c3ae914366dea1eba08fef59c6b2374bfe79bbb402a5c3095e9","observation_id":"d5f91996-8210-4f01-9f8b-73897c6ad2b7","resolution":{"observed_at":"2026-08-04T18:53:20.278165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.381657Z","title":"Cityrefer: geography-aware 3d visual grounding dataset on city-scale point cloud data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.381657Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:ca8769cb553c0480f38b961e4a2a6bf04251efa8a3b2c206879bf06c57a1ba89","observation_id":"7eaba23c-de75-4a18-b29e-0224efeb4b8a","resolution":{"observed_at":"2026-08-04T18:53:20.381657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.428654Z","title":"Continuous-time visual-inertial odometry for event cameras.IEEE Transactions on Robotics, 34(6): 1425–1440, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.428654Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3dc2a512a09782cea8f0009ba8359899f2f19b2b047d38df9e606079897fd877","observation_id":"7797965c-a0eb-4c28-9a81-6761acaf2ef3","resolution":{"observed_at":"2026-08-04T18:53:20.428654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.529010Z","title":"Learning to detect objects with a 1 megapixel event camera","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.529010Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:afd6c37e7286afca541531fa4ec747d70812e90515378c2a41e2a08f5dd7a940","observation_id":"aff60c32-9c5d-4d1f-ba0b-d1404e72fcb1","resolution":{"observed_at":"2026-08-04T18:53:20.529010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01801","last_updated":"2024-04-02T10:03:23Z","snapshot_observed_at":"2026-07-06T17:54:27.841979Z","submitted_at":"2024-04-02T10:03:23Z","title":"EventSleep: Sleep Activity Recognition with Event Cameras","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01801","snapshot_observed_at":"2026-08-04T18:53:20.590680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.590680Z"},"links":{"cited_paper":"/paper/2404.01801","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:adcbf597bf2181b73130f738a133338b7b7e3ed501668f8e9a345d2fbe85dad5","observation_id":"332ce6a3-269d-43a1-a833-8c0fee9fb132","resolution":{"observed_at":"2026-08-04T18:53:20.590680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.672133Z","title":"A qvga 143 db dynamic range frame-free pwm image sensor with lossless pixel-level video compression and time-domain cds.IEEE Journal of Solid-State Circuits, 46(1):259–275, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.672133Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:9375db9fbfe8d74c469a1b78ae238011a7467a60a59a3d1c567649b2a6cc0d52","observation_id":"f2fb0a5a-ad70-4f47-bf88-903ebd005715","resolution":{"observed_at":"2026-08-04T18:53:20.672133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.707806Z","title":"High speed and high dynamic range video with an event camera.IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(6):1964–1980, 2019","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.707806Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:209eaa779e7bc97342d60bac28fd80697ebaf0898b5e55ebd06edce92da9c4df","observation_id":"00b2254c-78ae-405e-9459-e2311cf5c01c","resolution":{"observed_at":"2026-08-04T18:53:20.707806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.784390Z","title":"4.1 a 640×480 dynamic vision sensor with a 9µm pixel and 300meps address-event representation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.784390Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:fe5ce21282fcb7f1cd59ce48988fd28495e2f582b8ecba457e57030a88be9f21","observation_id":"0108e2a9-53a4-479c-b8b5-f645d079c93a","resolution":{"observed_at":"2026-08-04T18:53:20.784390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.859457Z","title":"Neuromor- phic stereo vision: A survey of bio-inspired sensors and al- gorithms.Frontiers in Neuroscience, 13:28, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.859457Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:e1ed1beb539c77a131e7ff68f626e1121d3bce5f7ab0a5b7a325370ddcf4056b","observation_id":"6f7544a8-8eb7-465f-bcf7-c4e5bb0bdcbd","resolution":{"observed_at":"2026-08-04T18:53:20.859457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.943356Z","title":"Visual grounding in remote sensing images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.943356Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:4e8ec87c46581ba720ef53924548b7bc275f6e7e338bdf8de485d363d5b7180f","observation_id":"8fb4ab4e-9312-4d6a-9754-2bf1df0567a6","resolution":{"observed_at":"2026-08-04T18:53:20.943356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.993119Z","title":"Ess: Learning event-based semantic seg- mentation from still images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.993119Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:737e5566e9eb409d7d902600d3603f05a7751f4687655813c92d5df9af78ba55","observation_id":"0b04a64b-0355-4c43-8873-c722343a8487","resolution":{"observed_at":"2026-08-04T18:53:20.993119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.053055Z","title":"Learning two-branch neural networks for image-text match- ing tasks.IEEE Transactions on Pattern Analysis and Ma- chine Intelligence, 41(2):394–407, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.053055Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:1a441246ffc2b0cd3496a7088d6bc3018b126a819542beb7b55e900c0fe9bde5","observation_id":"8d483adc-a39f-4594-99ec-220cb171a105","resolution":{"observed_at":"2026-08-04T18:53:21.053055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.153297Z","title":"Neighbourhood watch: Refer- ring expression comprehension via language-guided graph attention networks","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.153297Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:c8d83b20bf23221df3bd7a8e3fae4e501e08558291f609a8d1d3716effaa50d6","observation_id":"5cca9e3e-b8e9-4a4e-bc29-1f194ac66429","resolution":{"observed_at":"2026-08-04T18:53:21.153297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T18:53:21.269032Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.269032Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:db0ff4cb1299fc5f75b00d670dfbe6115f6889888697f05d1e57f239da383e5d","observation_id":"7a07f36c-2589-4d7c-a274-8275e3410f27","resolution":{"observed_at":"2026-08-04T18:53:21.269032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.392604Z","title":"Event stream-based visual object tracking: A high-resolution benchmark dataset and a novel baseline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.392604Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3415b3ab9d93a21c033d9855e9d7f74a0a8b71a47aac12b9ae37e982d0a9de49","observation_id":"0f606fb3-f844-41b5-9327-c57890a026dc","resolution":{"observed_at":"2026-08-04T18:53:21.392604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.510900Z","title":"Referring multi- object tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.510900Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:901c03b599ed30b3dcadb8cb9c670e2845577460b7944059b275fd059b04488f","observation_id":"bab512a4-d63b-4a10-8ebd-e5db0b04b08c","resolution":{"observed_at":"2026-08-04T18:53:21.510900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.650079Z","title":"To- wards open vocabulary learning: A survey.IEEE Transac- tions on Pattern Analysis and Machine Intelligence, 46(7): 5092–5113, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.650079Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:ed43a317b92ca9be5e157a716b7361e692675d4deca001d535bcdc3183f6f89d","observation_id":"ad0a6862-d22b-4657-b5ea-39f04328f843","resolution":{"observed_at":"2026-08-04T18:53:21.650079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.755383Z","title":"Towards visual grounding: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.755383Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:0c195fc96f1d4d5727ccbaa51e7d7c957f2a22baf2580ba0bafb2207ac8f9011","observation_id":"385cd3ff-286e-4e6a-a0c9-f64c48855425","resolution":{"observed_at":"2026-08-04T18:53:21.755383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.857150Z","title":"Tubedetr: Spatio-temporal video ground- ing with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.857150Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3596875f028923b4fb1d1af0b58db298d0bfe3be5d8a5cc3aca2b6cfb6ef4aaf","observation_id":"b0e9d4cf-9073-4cb4-8ff3-6630ef713b4a","resolution":{"observed_at":"2026-08-04T18:53:21.857150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.940853Z","title":"Cross-modal re- lationship inference for grounding referring expressions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.940853Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3fdbecdd379b7809e49aa7ff29b9fa7c2892c6476072dccf398e99be70d3f030","observation_id":"0fe1ee83-65d2-4d82-839e-69e0cba3f951","resolution":{"observed_at":"2026-08-04T18:53:21.940853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.013876Z","title":"Event camera data pre- training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.013876Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:cbf139a4d8686466c82d36ce5cde95fc14fe541f7f22786a98e28530168d0779","observation_id":"8e4bf53b-a296-4163-ae5b-1e50dd675270","resolution":{"observed_at":"2026-08-04T18:53:22.013876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.092359Z","title":"A fast and accurate one- stage approach to visual grounding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.092359Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:36bcc46e7f20ac31dc2e7168ac8382ddf635394a479208999856e1aef3057586","observation_id":"594b23e2-b3b7-4cb6-bc67-e01397169b92","resolution":{"observed_at":"2026-08-04T18:53:22.092359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.196143Z","title":"Sat: 2d semantics assisted training for 3d visual grounding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.196143Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:9be6ddf2eda3f433857526460b853f488a4416221aa5e0c4b1a9ff564d6fc232","observation_id":"71a4a8a0-d198-478c-811c-9e046387c748","resolution":{"observed_at":"2026-08-04T18:53:22.196143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.360126Z","title":"Berg, and Tamara L","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.360126Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:0b29804159c3d12bf5bd2531b55fa34ea5a5327cc6b80eb4242f0cd9379d59df","observation_id":"19cee7e2-4e60-4c8a-ba06-3df8b3fdfa8f","resolution":{"observed_at":"2026-08-04T18:53:22.360126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.495576Z","title":"Visual programming for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.495576Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:ec583f337b9df1fbe31bcaefac4fc8648c102444716fead72ca79eb1c52da354","observation_id":"dcf04041-cd20-453d-9005-c81adb6e3d6b","resolution":{"observed_at":"2026-08-04T18:53:22.495576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.642569Z","title":"Rsvg: Exploring data and models for visual grounding on remote sensing data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.642569Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:9bda94445011662494eda1854a57f37a82c43abae4c5858f3742eb1adfff7991","observation_id":"14bf8ffb-8ba9-4220-8b93-2b433e6aa43f","resolution":{"observed_at":"2026-08-04T18:53:22.642569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.740504Z","title":"Mono3dvg: 3d visual grounding in monocular images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.740504Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:39b69c34d84aa375d81258df7333e52f511766eb45a3f8ca94c2a348d5c43418","observation_id":"5f273e64-9f51-4d35-9c90-fb15ef10380b","resolution":{"observed_at":"2026-08-04T18:53:22.740504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.848156Z","title":"3dvg- transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.848156Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:f65bfd7c752bfc322e1090ca7bad4f90b54fe07909841804b7bfcde5727b474f","observation_id":"cd76ce6a-0972-4201-baa7-a4b241afac4d","resolution":{"observed_at":"2026-08-04T18:53:22.848156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08890","last_updated":"2024-04-11T15:34:46Z","snapshot_observed_at":"2026-08-02T18:31:55.280063Z","submitted_at":"2023-02-17T14:19:28Z","title":"Deep Learning for Event-based Vision: A Comprehensive Survey and Benchmarks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08890","snapshot_observed_at":"2026-08-04T18:53:22.971883Z","title":"Deep learning for event-based vision: A comprehensive survey and bench- marks.arXiv preprint arXiv:2302.08890, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.971883Z"},"links":{"cited_paper":"/paper/2302.08890","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:66b0b126a5857f3c85f791a27c9fc6aa3bd89f04a6c4a80a0fc87e4718b792ef","observation_id":"44521fc0-d5f5-40f6-830f-e82b46f7d1fa","resolution":{"observed_at":"2026-08-04T18:53:22.971883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:23.082614Z","title":"Ex- act: Language-guided conceptual reasoning and uncertainty estimation for event-based action recognition and more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:23.082614Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:44fc25fc7a9f6692dea4c4f1055772e3a7d1d29884b806df8ac3c340e7b6e97e","observation_id":"d2df8b5d-4fe2-4e42-825b-09f60ac7801d","resolution":{"observed_at":"2026-08-04T18:53:23.082614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11904","last_updated":"2025-05-10T15:43:29Z","snapshot_observed_at":"2026-08-03T22:19:33.624164Z","submitted_at":"2024-11-16T05:12:11Z","title":"GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11904","snapshot_observed_at":"2026-08-04T18:53:23.175900Z","title":"Geoground: A unified large vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:23.175900Z"},"links":{"cited_paper":"/paper/2411.11904","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:39a095b2752c035c55319eddee68cebe13fb42807d787ce89a9448563e7aeb1f","observation_id":"4a018cba-9848-4189-9a10-e958ee7e58bd","resolution":{"observed_at":"2026-08-04T18:53:23.175900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:23.300547Z","title":"The multi- vehicle stereo event camera dataset: An event camera dataset for 3d perception.RA-L, 3(3):2032–2039, 2018","venue":null,"work_id":null,"year":2032},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:23.300547Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:424903438c697093df8c31b89c3ba24457ed74029570c19e19536e75ca8ce425","observation_id":"9090ef6a-0730-4b32-956d-cee799d46982","resolution":{"observed_at":"2026-08-04T18:53:23.300547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:23.400359Z","title":"Cear: Com- prehensive event camera dataset for rapid perception of agile quadruped robots.RA-L, 9(10):8999–9006, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:23.400359Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:cfe1ec176409eacc824fcdb92c911b08e78d786fae3557fadf90a2a4515ac3e9","observation_id":"1938b355-d4ba-4f92-be38-5bafd677e553","resolution":{"observed_at":"2026-08-04T18:53:23.400359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T18:53:16.184575Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2509.09584."}