{"as_of":"2026-08-18T17:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a46c0dcbc268d8a97f2e34457465b05c689472518828bf5765e49bb52418eddc","coverage":[{"denominator":7,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:13:25.257063Z","state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:34:07.995899Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T12:16:17.039197Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-18T14:55:34.470191Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.18738","doi":"10.48550/arxiv.2504.18738","metadata_source":"pith","pith_arxiv_id":"2504.18738","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"A Review of 3D Object Detection with Vision-Language Models","venue":"cs.CV","work_id":"3188dcd0-b557-447e-bcdc-b3d66f8c2640","year":2025},"citing_paper":{"arxiv_id":"2504.20419","last_updated":"2025-04-29T04:31:58Z","snapshot_observed_at":"2026-08-18T14:56:23.177803Z","submitted_at":"2025-04-29T04:31:58Z","title":"Plant Disease Detection through Multimodal Large Language Models and Convolutional Neural Networks","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-16T05:34:07.995899Z"},"links":{"cited_paper":"/paper/2504.18738","citing_paper":"/paper/2504.20419"},"observation_digest":"sha256:6defe0ad0ba7982b0ec99049589bb67c13a761dc6a12aaeed7bb85a7dd6d126e","observation_id":"f52befdf-3477-40ff-8c9b-f9d2922e3eb1","resolution":{"observed_at":"2026-08-16T05:34:08.064561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.18738/citation-record","integrity":"/paper/2504.18738/integrity","json":"/paper/2504.18738/citation-record.json","paper":"/paper/2504.18738"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.17851","last_updated":"2024-06-17T17:27:19Z","snapshot_observed_at":"2026-08-18T14:56:27.564472Z","submitted_at":"2023-11-29T17:54:22Z","title":"Leveraging VLM-Based Pipelines to Annotate 3D Objects","version":2},"cited_work":{"arxiv_id":"2311.17851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17851","snapshot_observed_at":"2026-08-16T10:13:25.729570Z","title":"Leveraging VLM-Based Pipelines to Annotate 3D Objects","venue":"cs.CV","work_id":"4312fdc6-1269-408b-9fbe-6b04eda00ba7","year":2023},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-18T14:55:34.470191Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.139862Z"},"links":{"cited_paper":"/paper/2311.17851","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:ac9b881747e93dfdf77ab97368b9cad108426a9b147eba1058b96fddae3ae308","observation_id":"98957a5e-5342-4994-8ea7-0436f0597901","resolution":{"observed_at":"2026-08-16T10:13:25.741575Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08092","last_updated":"2025-03-11T06:52:25Z","snapshot_observed_at":"2026-08-18T14:56:24.284966Z","submitted_at":"2025-03-11T06:52:25Z","title":"SparseVoxFormer: Sparse Voxel-based Transformer for Multi-modal 3D Object Detection","version":1},"cited_work":{"arxiv_id":"2503.08092","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.08092","snapshot_observed_at":"2026-08-16T10:13:25.617968Z","title":"SparseVoxFormer: Sparse Voxel-based Transformer for Multi-modal 3D Object Detection","venue":"cs.CV","work_id":"79a0205b-6c26-4109-ba0b-5e1724f776bf","year":2025},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-18T14:55:34.470191Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.173316Z"},"links":{"cited_paper":"/paper/2503.08092","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:1242e77b0d15b3b83c62970ae7c65a917a9a162c8fc7ec053b790be3b561078a","observation_id":"33ac26f8-7c1c-4483-ba56-11a9eb3bf281","resolution":{"observed_at":"2026-08-16T10:13:25.627225Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13175","last_updated":"2025-02-25T12:49:59Z","snapshot_observed_at":"2026-08-17T18:15:22.113753Z","submitted_at":"2025-02-18T03:38:07Z","title":"Towards Robust and Secure Embodied AI: A Survey on Vulnerabilities and Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13175","snapshot_observed_at":"2026-08-16T10:13:25.257063Z","title":"Computers & Graphics 119 (2024), 103885","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-18T14:55:34.470191Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.257063Z"},"links":{"cited_paper":"/paper/2502.13175","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:8133e5de2bdcd79dd4c3c087a553613dfc34d5441292ac7751e075f7783bb4cd","observation_id":"7018c0b3-d611-47e9-8421-b7f103a98985","resolution":{"observed_at":"2026-08-16T10:13:25.257063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"cited_work":{"arxiv_id":"2412.11475","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11475","snapshot_observed_at":"2026-08-16T10:13:25.893446Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","venue":"cs.CV","work_id":"987c82f0-9d55-43aa-92e9-d0ca380c6140","year":2024},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-18T14:55:34.470191Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.113330Z"},"links":{"cited_paper":"/paper/2412.11475","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:85148d404ef963afcbd14239128aceb5318c537bc68d300c9881b05c012b592b","observation_id":"8febbffd-7988-46e7-b6ce-d4a41c792e9f","resolution":{"observed_at":"2026-08-16T10:13:26.010057Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15780","last_updated":"2023-03-28T07:50:45Z","snapshot_observed_at":"2026-08-16T21:26:31.535428Z","submitted_at":"2023-03-28T07:50:45Z","title":"Instruct 3D-to-3D: Text Instruction Guided 3D-to-3D conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15780","snapshot_observed_at":"2026-08-16T10:13:25.147697Z","title":"arXiv preprint arXiv:2303.15780 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-18T14:55:34.470191Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.147697Z"},"links":{"cited_paper":"/paper/2303.15780","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:86825fdc10af40605c97f53b47ed84ea1374fd3063f08b204414d0536c880f2e","observation_id":"f2f5b1d2-5aff-40db-a7c9-fc4a66b70aa8","resolution":{"observed_at":"2026-08-16T10:13:25.147697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-18T17:14:44.330300Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-16T10:13:25.100455Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-18T14:55:34.470191Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.100455Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:506bf1bf1c4e8ddf20e15788f9ce3e837f3b2c1ae89cd64201f56236affbddbc","observation_id":"0abec588-bf00-4e50-ae31-19e61f2e006e","resolution":{"observed_at":"2026-08-16T10:13:25.100455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06435","last_updated":"2025-03-09T04:22:08Z","snapshot_observed_at":"2026-08-18T02:04:38.814077Z","submitted_at":"2025-03-09T04:22:08Z","title":"OV-SCAN: Semantically Consistent Alignment for Novel Object Discovery in Open-Vocabulary 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06435","snapshot_observed_at":"2026-08-16T10:13:25.128583Z","title":"arXiv preprint arXiv:2503.06435 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-18T14:55:34.470191Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.128583Z"},"links":{"cited_paper":"/paper/2503.06435","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:6c2b4061ccd5c87f6de0533eb5773321ddc9cb029e4fb91c7c015102dfc9f87b","observation_id":"ba40995c-8a85-4c7d-bded-77e27378dee3","resolution":{"observed_at":"2026-08-16T10:13:25.128583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T14:55:34.470191Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models"},"reference_resolution":{"displayed":7,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":7},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 7 of 7 outbound references and 1 inbound Pith citation observation for arXiv:2504.18738."}