{"as_of":"2026-08-08T13:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d7c31974c53efe7abf49d3fd0e080b39f71c3b75d47e584a17a58da22a7d1b4","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:13:06.935892Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.16812/citation-record","integrity":"/paper/2508.16812/integrity","json":"/paper/2508.16812/citation-record.json","paper":"/paper/2508.16812"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.343107Z","title":"TransFusion: Robust LiDAR-camera fusion for 3D object detection with transformers","venue":null,"work_id":"40f5356a-e0f6-407a-a166-32828f3d0727","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.437631Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:3838de3fb850a810f577e7d10cc27ae35f01a70b7ef7a62f2c927140367527dd","observation_id":"840f8725-d2b5-4625-9829-401e7c8370a8","resolution":{"observed_at":"2026-08-05T17:13:09.347860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05095","last_updated":"2021-06-09T14:48:13Z","snapshot_observed_at":"2026-08-08T08:05:04.282318Z","submitted_at":"2021-02-09T19:49:33Z","title":"Is Space-Time Attention All You Need for Video Understanding?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05095","snapshot_observed_at":"2026-08-05T17:13:01.481907Z","title":"Is space-time attention all you need for video understanding? InInternational Conference on Machine Learning (ICML), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.481907Z"},"links":{"cited_paper":"/paper/2102.05095","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:297b01a886a648b3e90000058a2496fd45336ef302470c3a36a715fd883dd13a","observation_id":"d9c232d4-c6b1-404e-8f17-5e6da800d8ae","resolution":{"observed_at":"2026-08-05T17:13:01.481907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.326722Z","title":"Lang, Sourabh V ora, V enice Erin Liong, Qiang Xu, Anush Krishnan, Y u Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"14613caa-74d3-4d25-9439-a21b767b023b","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.550840Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:5afb4c0fe7094cd71c5f2190fbfd847eb441a3ecb6a9855f61de97e0cb904295","observation_id":"0323529f-d181-4656-9e98-f1df76763a63","resolution":{"observed_at":"2026-08-05T17:13:09.331370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.310449Z","title":"CoDA: Collaborative novel box discovery and cross-modal alignment for open-vocabulary 3D object detection","venue":null,"work_id":"45b637d2-750b-4b6b-8df8-1a29c170e891","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.619614Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:20e8d4d4672ad139a4c76228a131978b7873911e243327bf9714b04ac3ebe96f","observation_id":"92bfde35-7860-4701-81bd-53daddc5e63f","resolution":{"observed_at":"2026-08-05T17:13:09.315917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00830","last_updated":"2025-08-03T15:13:12Z","snapshot_observed_at":"2026-08-07T21:58:59.027315Z","submitted_at":"2024-06-02T18:32:37Z","title":"Collaborative Novel Object Discovery and Box-Guided Cross-Modal Alignment for Open-Vocabulary 3D Object Detection","version":2},"cited_work":{"arxiv_id":"2406.00830","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.00830","snapshot_observed_at":"2026-08-05T17:13:08.718629Z","title":"Collaborative Novel Object Discovery and Box-Guided Cross-Modal Alignment for Open-Vocabulary 3D Object Detection","venue":"cs.CV","work_id":"7a668c98-6f7c-4c36-a59a-a782b1b0f679","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.666088Z"},"links":{"cited_paper":"/paper/2406.00830","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:b7ceb669046547e0c02603e712db3a4ab0aa64fedfc7e9242b4b06eba9ef11b0","observation_id":"5e6d3ffb-ca94-414c-9c2d-5ae815fbcfda","resolution":{"observed_at":"2026-08-05T17:13:08.748655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07750","last_updated":"2018-02-12T17:10:11Z","snapshot_observed_at":"2026-07-06T05:43:40.624942Z","submitted_at":"2017-05-22T13:57:53Z","title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07750","snapshot_observed_at":"2026-08-05T17:13:01.758342Z","title":"Quo vadis, action recognition? A new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.758342Z"},"links":{"cited_paper":"/paper/1705.07750","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:531530b9b5ce9499a519b602d0ae2b11423ace0b51cd1ebb51dbfa302f3bfc4d","observation_id":"b85c14d1-2749-4e90-94ee-c905dc863425","resolution":{"observed_at":"2026-08-05T17:13:01.758342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14940","last_updated":"2022-03-28T17:50:26Z","snapshot_observed_at":"2026-08-08T10:27:52.231805Z","submitted_at":"2022-03-28T17:50:26Z","title":"Learning to Prompt for Open-Vocabulary Object Detection with Vision-Language Model","version":1},"cited_work":{"arxiv_id":"2203.14940","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.14940","snapshot_observed_at":"2026-08-05T17:13:08.418095Z","title":"Learning to Prompt for Open-Vocabulary Object Detection with Vision-Language Model","venue":"cs.CV","work_id":"9f240a4f-8e68-4433-a147-6660f97179e6","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.824856Z"},"links":{"cited_paper":"/paper/2203.14940","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:8215377bbb1de38638d83b460d552a054992fad35eabd4f75aee5c39a0032266","observation_id":"103b1be2-881b-4092-a9de-cdf760126ccd","resolution":{"observed_at":"2026-08-05T17:13:08.568522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13556","last_updated":"2024-07-12T10:42:30Z","snapshot_observed_at":"2026-07-06T17:47:38.508384Z","submitted_at":"2024-03-20T12:51:30Z","title":"Find n' Propagate: Open-Vocabulary 3D Object Detection in Urban Environments","version":2},"cited_work":{"arxiv_id":"2403.13556","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.13556","snapshot_observed_at":"2026-08-05T17:13:08.320157Z","title":"Find n' Propagate: Open-Vocabulary 3D Object Detection in Urban Environments","venue":"cs.CV","work_id":"0893514a-dcd1-44d6-80fc-31e2f2d6a5ec","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.870710Z"},"links":{"cited_paper":"/paper/2403.13556","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:209ac98f962e9c65d8674b3af8f231fa5ccc903d06e5c57890dfea1a11a7557c","observation_id":"fcc17589-f298-479f-9021-265f579e2956","resolution":{"observed_at":"2026-08-05T17:13:08.337877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.292747Z","title":"Fully sparse 3D object detection","venue":null,"work_id":"b0587390-a9d7-4c8d-82d3-417a7d4d126e","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.958733Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:78879d3516d2900cce6fa8ba0742f9f5eefdb38a7763a91e59982d4eedd4a758","observation_id":"b9c0e4d5-992e-4efb-9ce4-80e17e4a012e","resolution":{"observed_at":"2026-08-05T17:13:09.297804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.276834Z","title":"Multi-modal transformer for video retrieval","venue":null,"work_id":"84d8313f-0dcd-416f-b9d4-4e7d2ca266a3","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.024764Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:844e35b5ee41f47811ba4eac425dec0c290ebe4d88335d89f62376fa83068664","observation_id":"65a7e81d-22fa-4f21-9b72-55d7e8009575","resolution":{"observed_at":"2026-08-05T17:13:09.281744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:02.093300Z","title":"Are we ready for autonomous driving? the KITTI vision benchmark suite","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.093300Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:28aa010dd41a3f0a5f16dfa9e00bdb8a7f17b6ba50c51c7eac63d99a4cd1eda3","observation_id":"ff00328c-a284-450d-a55a-0bed8daf3e52","resolution":{"observed_at":"2026-08-05T17:13:02.093300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16650","last_updated":"2023-09-28T17:53:38Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:53:38Z","title":"ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16650","snapshot_observed_at":"2026-08-05T17:13:02.141605Z","title":"Tenenbaum, Antonio T orralba, Florian Shkurti, and Liam Paull","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.141605Z"},"links":{"cited_paper":"/paper/2309.16650","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:96db4ce1d2182536e277068d2fab4cee0d4be3e370d708bc02e861c8cb76d444","observation_id":"5d3e40f7-cc5b-4a84-9b7c-20e5284fab6a","resolution":{"observed_at":"2026-08-05T17:13:02.141605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.260903Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"81261f6e-0328-4490-9f98-82295a92b7ab","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.230640Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:8c278684ead88aecf7df0cbf83d5e1adf7dd346190d0dfd863a36f6694b5a5c6","observation_id":"e667cdb0-2ac7-45a1-b463-6f4ee791ac75","resolution":{"observed_at":"2026-08-05T17:13:09.265554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.244886Z","title":"OneLLM: One framework to align all modalities with language","venue":null,"work_id":"fbec4006-7b83-4b2e-9ee0-a8742715929e","year":null},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.295762Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:cfa3a3dc67d86b339d2c1ad245c465539439a6e6c451793b8ac20c94270bfcbc","observation_id":"4daed349-6ad7-46ce-8ed6-7562da3577c9","resolution":{"observed_at":"2026-08-05T17:13:09.250070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.226141Z","title":"Jones, and Vishal M","venue":null,"work_id":"fd2b3779-e398-4b90-bcd1-b9320cdbb7e3","year":2025},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.472014Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:b82090f03419d5dcc883b50951e7fb7de9e17608ef3f8d0fcbd7cbe20ca843cf","observation_id":"1feac009-2953-4277-953f-eb5175876ced","resolution":{"observed_at":"2026-08-05T17:13:09.231011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.209645Z","title":"Jones, and Vishal M","venue":null,"work_id":"26c067b0-3dfb-4478-acec-00520da23cf6","year":2025},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.563889Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:9d9fc620ab19efc9f0317991143620d452b2675ef7a879bd16555052f3dbafd2","observation_id":"a42b1dbc-f053-4791-b64e-845761745580","resolution":{"observed_at":"2026-08-05T17:13:09.214938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:02.655417Z","title":"Long short-term memory.Neural Comput., 9 (8):1735–1780, November 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.655417Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:4d727e49c5a5e3ee5a897ee9f0d7efefb53b76c66cc5b0b606a89d15e79a3bab","observation_id":"eb6ac23e-a5bd-4605-8d95-8fc262d9962e","resolution":{"observed_at":"2026-08-05T17:13:02.655417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07241","last_updated":"2023-10-23T14:56:15Z","snapshot_observed_at":"2026-07-06T14:51:48.920020Z","submitted_at":"2023-02-14T18:40:26Z","title":"ConceptFusion: Open-set Multimodal 3D Mapping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07241","snapshot_observed_at":"2026-08-05T17:13:02.731888Z","title":"T enenbaum, Celso Miguel de Melo, Madhava Krishna, Liam Paull, Florian Shkurti, and Antonio T orralba","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.731888Z"},"links":{"cited_paper":"/paper/2302.07241","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:6034da1d9aa792eaf2b71c1a004fbe2fabe5bdae21d1fbcbfc281b5eee167bd0","observation_id":"a27b0254-1bb4-49a8-990b-1cdea1a248cb","resolution":{"observed_at":"2026-08-05T17:13:02.731888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.194273Z","title":"Action genome: Actions as composition of spatio-temporal scene graphs","venue":null,"work_id":"a66eff9a-c76a-4d18-987a-b77072b59fb4","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.811170Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:43621b2c7583acbd93c27d035ca38bf815a8b9b55a5c2f2ee3db481d19d1c4a8","observation_id":"1e0ae063-aee7-4e35-80d7-5e7f021646cb","resolution":{"observed_at":"2026-08-05T17:13:09.198930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.177511Z","title":"PF3Det: A prompted foundation feature assisted visual LiDAR 3D detector","venue":null,"work_id":"bf03a4eb-7ea1-497c-9c7d-28e118802d10","year":2025},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.874237Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:5baadb59c0488b009ebc3e814ecb82981ecdaa7cadbf2dce789295ed2687983b","observation_id":"81b7e8c8-d47a-4b5b-980c-41e71feb883e","resolution":{"observed_at":"2026-08-05T17:13:09.182991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.160086Z","title":"Grounded language-image pre-training","venue":null,"work_id":"ed4ac06f-34f7-4e2a-a76a-3e43e80b3444","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.980304Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:370ab0a26fd9f30f7ce0880318ef7472e88ba830cdd4788c0b4cbeaacf3092d2","observation_id":"c734e3c7-3a44-4ebe-b8d5-b10c179ca67a","resolution":{"observed_at":"2026-08-05T17:13:09.165658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.141454Z","title":"OpenShape: Scaling up 3D shape representation towards open-world understanding","venue":null,"work_id":"8c3e21fa-fc7b-4af3-9525-7e4800510771","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.053531Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:81377d7a08da798f6acf5cf341b4fd5df4daddaf68cb16e649d8e077349af82c","observation_id":"f5844c12-2d4d-467f-b559-f74bc885388d","resolution":{"observed_at":"2026-08-05T17:13:09.146762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.122824Z","title":"Grounding DINO: Marrying DINO with grounded pre-training for open-set object detection","venue":null,"work_id":"33006aa3-1741-4abe-b640-fc1349185596","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.160071Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:e26d97e37fdae2da8dc628d4186a3df1ece4385efcd260f36f4e3dabcfb59348","observation_id":"47339047-0ceb-48aa-be97-d11fc8eb48e5","resolution":{"observed_at":"2026-08-05T17:13:09.127565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.106257Z","title":"Open-vocabulary point-cloud object detection without 3D annotation","venue":null,"work_id":"49187183-9563-4423-b593-d1247e996151","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.291623Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:2d4bf1bcbbf920354113239d745911ba7e2a448b9e0aeeab0cdcd4bbed348a5a","observation_id":"a1648445-19ac-4617-ac79-9ebce9000c08","resolution":{"observed_at":"2026-08-05T17:13:09.111280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08141","last_updated":"2021-09-16T17:57:37Z","snapshot_observed_at":"2026-08-04T20:09:04.612844Z","submitted_at":"2021-09-16T17:57:37Z","title":"An End-to-End Transformer Model for 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08141","snapshot_observed_at":"2026-08-05T17:13:03.369392Z","title":"An end-to-end transformer model for 3D object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.369392Z"},"links":{"cited_paper":"/paper/2109.08141","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:ce9a9b03d8255f82352bdf958aca425ccc737c2cca33708b85f4eb20745fda92","observation_id":"7f458115-3bbd-44f3-ab37-2168437dc4ee","resolution":{"observed_at":"2026-08-05T17:13:03.369392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.088969Z","title":"Modeling temporal structure of decomposable motion segments for activity classification","venue":null,"work_id":"04b7d43f-9b97-43db-9a72-db8b8d953f54","year":2010},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.471688Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:bf9abb3aa7e572a2c71e911ca86cd9b834b1da7efa137466663cd39793e1fc77","observation_id":"b0c79d08-7717-4a79-a1ee-1dd63bd53f09","resolution":{"observed_at":"2026-08-05T17:13:09.094901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.069516Z","title":"PyT orch: An imperative style, high-performance deep learning library","venue":null,"work_id":"c4c2233e-9129-4aa6-a9f8-91294300a29e","year":2019},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.583519Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:89df4ee264204e89af2731a321fae7dfda944edac97cb1166c3e943cc8ad54c0","observation_id":"dabae4fa-8546-48ee-8e6e-dc06fcded168","resolution":{"observed_at":"2026-08-05T17:13:09.076037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.054137Z","title":"OpenScene: 3D scene understanding with open vocabularies","venue":null,"work_id":"c506874f-6059-48c8-91fb-c29995c7e733","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.686010Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:7abd25b6c63482853fed61917ed21c88209eb2d1031d4db08a9f4fd2306b4437","observation_id":"1bd61506-50b3-4391-9cd5-498424ec4d70","resolution":{"observed_at":"2026-08-05T17:13:09.058826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.034730Z","title":"Qi, Hao Su, Kaichun Mo, and Leonidas J","venue":null,"work_id":"aac78c4b-6786-4a86-986d-b5f823b7992d","year":2017},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.788184Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:fcbc437d404427799c45c889fdb4564facb4f530338ebc9631913782c89287d4","observation_id":"166f1343-26ab-447c-9b6d-14a5b9b70c69","resolution":{"observed_at":"2026-08-05T17:13:09.042963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08488","last_updated":"2018-04-13T00:30:24Z","snapshot_observed_at":"2026-08-04T05:51:09.891500Z","submitted_at":"2017-11-22T19:52:18Z","title":"Frustum PointNets for 3D Object Detection from RGB-D Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.08488","snapshot_observed_at":"2026-08-05T17:13:03.886207Z","title":"Qi, W ei Liu, Chenxia Wu, Hao Su, and Leonidas J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.886207Z"},"links":{"cited_paper":"/paper/1711.08488","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:7462e9d331392c6cee77a74bccba5f0175bcc49dec179ce0b7317c38cf645016","observation_id":"2f536505-b225-487c-a519-1c9ef552fcc6","resolution":{"observed_at":"2026-08-05T17:13:03.886207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09664","last_updated":"2019-08-22T20:54:40Z","snapshot_observed_at":"2026-07-06T07:47:29.276335Z","submitted_at":"2019-04-21T21:36:36Z","title":"Deep Hough Voting for 3D Object Detection in Point Clouds","version":2},"cited_work":{"arxiv_id":"1904.09664","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09664","snapshot_observed_at":"2026-08-05T17:13:08.078320Z","title":"Deep Hough Voting for 3D Object Detection in Point Clouds","venue":"cs.CV","work_id":"303891d2-0fcb-455b-ba3c-c1e59ba6bc53","year":2019},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.987522Z"},"links":{"cited_paper":"/paper/1904.09664","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:50f0adf63294071d2d6c80078d636ba6ac8bac2291d7d9225312865d1d730443","observation_id":"0303b28b-8ef5-4362-897b-8707f7336768","resolution":{"observed_at":"2026-08-05T17:13:08.084109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T17:13:04.056417Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.056417Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:bf5ae73d39076348dfa1b233bbc7bec91c1b66c1422c126d497533cb7b826971","observation_id":"6d60b02a-280e-4cea-8201-22b4b411d242","resolution":{"observed_at":"2026-08-05T17:13:04.056417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04244","last_updated":"2019-05-16T15:50:01Z","snapshot_observed_at":"2026-08-08T07:37:57.421399Z","submitted_at":"2018-12-11T07:27:56Z","title":"PointRCNN: 3D Object Proposal Generation and Detection from Point Cloud","version":2},"cited_work":{"arxiv_id":"1812.04244","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.04244","snapshot_observed_at":"2026-08-05T17:13:08.028958Z","title":"PointRCNN: 3D Object Proposal Generation and Detection from Point Cloud","venue":"cs.CV","work_id":"1c97675c-039c-47c2-9596-7d786996170f","year":2018},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.157255Z"},"links":{"cited_paper":"/paper/1812.04244","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:37d7512d76b3bf7d4bff7539702aa6b3aef8ae97d4e159664435f055f53dd69f","observation_id":"70bcaecc-0c36-41b1-9450-c0d54195480f","resolution":{"observed_at":"2026-08-05T17:13:08.034757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.016870Z","title":"PV -RCNN: Point-voxel feature set abstraction for 3D object detection","venue":null,"work_id":"4fea7fd1-f994-4153-a81c-b89df2b5db8d","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.256401Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:9f2a7d26772e62bcc5c7ef56950ce117c526032e4835a39678339ac49a6c8d35","observation_id":"cd9525d2-b4da-4dea-9189-e38ee5217e14","resolution":{"observed_at":"2026-08-05T17:13:09.021635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.000081Z","title":"VideoBERT: A joint model for video and language representation learning","venue":null,"work_id":"45e1effa-6bc5-4c69-9f23-cf3cddc0c137","year":2019},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.338428Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:a3c77bc788aa9950aea991b3de26fbdb9938c25ec4858a3d97e8a1d029dad91d","observation_id":"75bf4426-3b0a-45c4-98d4-8e737839456c","resolution":{"observed_at":"2026-08-05T17:13:09.005712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.979660Z","title":"Scalability in perception for autonomous driving: W aymo open dataset, 2020","venue":null,"work_id":"a65fe1ac-ef05-4893-a68b-ae0209044bcc","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.558032Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:7d2ab9edd3edb5b7bd65c3912a6e9c7383d9d9e1e7cf817deb9131e08dd20507","observation_id":"9536a125-4495-40da-9be9-6671aa89b29a","resolution":{"observed_at":"2026-08-05T17:13:08.986709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.950211Z","title":"Learning spatiotemporal features with 3D convolutional networks","venue":null,"work_id":"e19b1dd1-c088-46a4-9a61-dd05bfd92b0e","year":2015},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.735453Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:ac4106184624b1dc183e3b9758cbf9add68f1000be5eaf8e4fc5ef82af36eaf3","observation_id":"ca3ff166-92f1-495c-ac5c-aa2b4d7e419f","resolution":{"observed_at":"2026-08-05T17:13:08.956623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.929946Z","title":"DSVT: Dynamic sparse voxel transformer with rotated sets","venue":null,"work_id":"634701ad-9174-4fd8-b75c-d4e5478cd57b","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.934308Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:b616feaa40af88c18f838e9588f16d94e28d4c28124f43342887a317c3c2c59b","observation_id":"a3914318-82fa-4337-b98e-878381f55c9f","resolution":{"observed_at":"2026-08-05T17:13:08.935947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:05.358512Z","title":"Hierarchical open-vocabulary 3D scene graphs for language-grounded robot navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.358512Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:40c14c3e1e78b2c38ad3867d56c9fad8ac7f24742a939896b7a2faecb2875c39","observation_id":"76edf698-e339-4015-b383-1b7c9cfd170c","resolution":{"observed_at":"2026-08-05T17:13:05.358512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.908348Z","title":"Argoverse 2: Next generation datasets for self-driving perception and forecasting","venue":null,"work_id":"24b4adaf-ae34-4ba5-937b-70f617148314","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.456330Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:49e221e4a8d90f44e87d8b5b80686e3a14a095b5fd7cc871ab8f0fc11c990cac","observation_id":"5f9d2efa-63c2-4004-8447-bccd567f0af8","resolution":{"observed_at":"2026-08-05T17:13:08.914171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.890339Z","title":"Transformation- equivariant 3D object detection for autonomous driving","venue":null,"work_id":"72554450-f084-460e-b39a-1c3b62fe2b16","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.555846Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:e98037bc1d3cd660bd68d73111546731655d7c154b9f8e6cb488767b5aa2620f","observation_id":"6e6596de-4638-4dfd-90ba-f7288e8a3ee8","resolution":{"observed_at":"2026-08-05T17:13:08.895793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15880","last_updated":"2024-02-01T08:31:59Z","snapshot_observed_at":"2026-08-07T19:44:22.371508Z","submitted_at":"2023-06-28T02:33:06Z","title":"Towards Open Vocabulary Learning: A Survey","version":4},"cited_work":{"arxiv_id":"2306.15880","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.15880","snapshot_observed_at":"2026-08-05T17:13:08.000099Z","title":"Towards Open Vocabulary Learning: A Survey","venue":"cs.CV","work_id":"d852334c-978e-4c83-82b3-7373281243aa","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.638687Z"},"links":{"cited_paper":"/paper/2306.15880","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:79879a1bdacd272de537679e8b00b3722600d0c237590e4e17b387e6147a0c5f","observation_id":"74593d27-35fd-4cd5-be04-5504b25e89aa","resolution":{"observed_at":"2026-08-05T17:13:08.006377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03620","last_updated":"2023-11-07T00:12:01Z","snapshot_observed_at":"2026-07-06T16:43:54.752924Z","submitted_at":"2023-11-07T00:12:01Z","title":"FusionViT: Hierarchical 3D Object Detection via LiDAR-Camera Vision Transformer Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03620","snapshot_observed_at":"2026-08-05T17:13:05.763277Z","title":"FusionViT: Hierarchical 3D object detection via LiDAR- camera vision transformer fusion.arXiv preprint arXiv:2311.03620, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.763277Z"},"links":{"cited_paper":"/paper/2311.03620","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:090268bb221278f19f67ada99f3069bfc15cc5a30a341dd3f851b9f8bcfae0f7","observation_id":"7e732a7a-114b-4d1f-b7be-a104fda0f275","resolution":{"observed_at":"2026-08-05T17:13:05.763277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2311.0374","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:07.883591Z","title":"3DifFusionDet: Diffusion model for 3D object detection with robust LiDAR-camera fusion.arXiv preprint arXiv:2311.0374, 2023","venue":null,"work_id":"b7fbb4aa-3cce-48ac-b066-5ae4dea726e4","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.930584Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:647b248d398f9f3fe11d0bc93745017a3f6504f5d9212efd589ededaf838d7ec","observation_id":"d4098634-ae30-4531-82c2-b551b1eddb60","resolution":{"observed_at":"2026-08-05T17:13:07.953455Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12317","last_updated":"2024-03-18T23:22:37Z","snapshot_observed_at":"2026-08-04T05:32:14.154503Z","submitted_at":"2024-03-18T23:22:37Z","title":"EffiPerception: an Efficient Framework for Various Perception Tasks","version":1},"cited_work":{"arxiv_id":"2403.12317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12317","snapshot_observed_at":"2026-08-05T17:13:07.613586Z","title":"EffiPerception: an Efficient Framework for Various Perception Tasks","venue":"cs.CV","work_id":"2e1b149c-c63b-4de0-adde-3474eb5e66cf","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.036014Z"},"links":{"cited_paper":"/paper/2403.12317","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:dbf65710534591ed45f702f786c886ed2bf16341e4ed816d5b3c17acb3357a39","observation_id":"6c5b56a5-94f0-4a35-af10-38ab6e6203b0","resolution":{"observed_at":"2026-08-05T17:13:07.702417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.00191","last_updated":"2018-08-01T06:50:19Z","snapshot_observed_at":"2026-07-06T06:53:26.207924Z","submitted_at":"2018-08-01T06:50:19Z","title":"Graph R-CNN for Scene Graph Generation","version":1},"cited_work":{"arxiv_id":"1808.00191","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.00191","snapshot_observed_at":"2026-08-05T17:13:07.445481Z","title":"Graph R-CNN for Scene Graph Generation","venue":"cs.CV","work_id":"76567201-4ea1-41f4-8a09-18129e169881","year":2018},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.116837Z"},"links":{"cited_paper":"/paper/1808.00191","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:859652c05cb57e7df556c649fa30e03bee13a9e52de7f8256223cf105b38f6a6","observation_id":"91b533a6-5f6e-4b49-86d4-4fb4a3360e09","resolution":{"observed_at":"2026-08-05T17:13:07.519380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-20077-9_7","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:07.061158Z","title":"Open-vocabulary DETR with conditional matching","venue":null,"work_id":"f6d7ee93-1048-4285-9a62-8ccf00b491b6","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.198543Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:af2c08ab457df18415ca10b14d1bf76cfa1937200c5c338deaf869f3673298c1","observation_id":"d37adc28-e3b3-44ff-ba67-1b6365d0cabd","resolution":{"observed_at":"2026-08-05T17:13:07.148949Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10678","last_updated":"2021-03-14T18:45:04Z","snapshot_observed_at":"2026-07-06T10:16:31.843825Z","submitted_at":"2020-11-20T23:05:46Z","title":"Open-Vocabulary Object Detection Using Captions","version":2},"cited_work":{"arxiv_id":"2011.10678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.10678","snapshot_observed_at":"2026-08-05T17:13:07.259985Z","title":"Open-Vocabulary Object Detection Using Captions","venue":"cs.CV","work_id":"ac048c50-3c92-4877-a8f9-688b2cf1062d","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.300876Z"},"links":{"cited_paper":"/paper/2011.10678","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:38966d2c17b787c8533dc0499f659538dcc4b717b2f014f64865e6718080b248","observation_id":"32c79f97-0f4c-4abb-9c36-4cfb103414ca","resolution":{"observed_at":"2026-08-05T17:13:07.337789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.872897Z","title":"FM-OV3D: Foundation model-based cross-modal knowledge blending for open-vocabulary 3D detection","venue":null,"work_id":"e3de7a9f-df99-4f57-9793-2a13c9d5926b","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.391908Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:46af47823ccf8e4723e1a68e4b6f04ffe36f27c74d1e652f844d7cd973c13c6c","observation_id":"f02b52ce-72b7-4aed-9ed4-519b2f9548b2","resolution":{"observed_at":"2026-08-05T17:13:08.878591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.854997Z","title":"OpenSight: A simple open-vocabulary framework for LiDAR-based object detection","venue":null,"work_id":"6805f5bd-15aa-48cb-be90-3add140fb8d0","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.478801Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:7a5d7040301f0b3b1eec1955dd26fb416508249aba0d0fcd6a8540f6a85aacad","observation_id":"0ffd2678-aa19-4326-be4b-169e30a6c3a8","resolution":{"observed_at":"2026-08-05T17:13:08.860512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.832600Z","title":"G, Anastasis Stathopoulos, Manmohan Chandraker, and Dimitris Metaxas","venue":null,"work_id":"e4d742e0-99ad-4bf8-91bc-453b24a14e41","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.561654Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:01d88377b28f6eb7090082d8cb9b6246540322f19fe33933daf351a7b570b68d","observation_id":"c38fb163-4d80-43bf-ba6d-f93513cef3f2","resolution":{"observed_at":"2026-08-05T17:13:08.839413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.811888Z","title":"OcTr: Octree-based transformer for 3D object detection","venue":null,"work_id":"4085e152-770b-46a2-ae0c-923cc68c640f","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.650142Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:9004fd1f5e4564932496ddcfc1007fc9974d71fae3640ccff0e95cac773fc2a7","observation_id":"8fd75d1e-f795-4927-90fd-bd099936e1de","resolution":{"observed_at":"2026-08-05T17:13:08.816793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T17:13:06.743796Z","title":"Object2Scene: Putting objects in context for open-vocabulary 3D detection.arXiv preprint arXiv:2311.03079, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.743796Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:8300044cb1a50af57b53ce469b8abdea5058616c867eff7a8ac1d1eb8593a474","observation_id":"e84cafae-c49f-4a74-b668-7d794db8d9da","resolution":{"observed_at":"2026-08-05T17:13:06.743796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.794888Z","title":"PointCLIP V2: Prompting CLIP and GPT for powerful 3D open-world learning","venue":null,"work_id":"d088bdb0-10b4-4d34-bb01-ea1669065195","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.857653Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:5d8632767f0f72ffa6b3bdc4fd032b7e4e15a3b9843ae50578b97e6a0d06a6e9","observation_id":"af50caab-0370-43a9-b0b5-631aea67a62b","resolution":{"observed_at":"2026-08-05T17:13:08.799818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.779516Z","title":"Then, the model continues to be trained for 20 epochs","venue":null,"work_id":"b1362bc2-8b23-4c27-b1a4-40790f5801d9","year":null},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.935892Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:3678a1f886ea9543561a25159fc1c1c6240ef1bff7a30403b316a547f4c1cb68","observation_id":"f4e88895-2b6d-422c-95bc-46b5a19585ec","resolution":{"observed_at":"2026-08-05T17:13:08.784314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03700","last_updated":"2025-01-09T09:12:06Z","snapshot_observed_at":"2026-08-04T10:20:08.342718Z","submitted_at":"2023-12-06T18:59:19Z","title":"OneLLM: One Framework to Align All Modalities with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03700","snapshot_observed_at":"2026-08-05T17:13:02.378508Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.378508Z"},"links":{"cited_paper":"/paper/2312.03700","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:51c4e687bf4ae4155a5c6299a815732b0769872d47077c39cc2430ac44bef8bf","observation_id":"3a331ea2-4e45-46c3-b90b-5d7b8e65f565","resolution":{"observed_at":"2026-08-05T17:13:02.378508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T07:26:19.421198Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":11,"verified_fuzzy":32},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2508.16812."}