{"as_of":"2026-08-08T12:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba9ac4211542bc2971016b8a7273072329733aa9793e9cf497b6d7b448e1b45d","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:28:15.940386Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21547/citation-record","integrity":"/paper/2506.21547/integrity","json":"/paper/2506.21547/citation-record.json","paper":"/paper/2506.21547"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.17310","last_updated":"2024-07-25T07:47:11Z","snapshot_observed_at":"2026-08-05T15:06:06.140557Z","submitted_at":"2024-07-24T14:22:55Z","title":"LangOcc: Self-Supervised Open Vocabulary Occupancy Estimation via Volume Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17310","snapshot_observed_at":"2026-08-06T22:28:10.803060Z","title":"Lan- gocc: Self-supervised open vocabulary occupancy estima- tion via volume rendering.arXiv preprint arXiv:2407.17310,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:10.803060Z"},"links":{"cited_paper":"/paper/2407.17310","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:95ea36cbe46002f05b01b7d40e4ba74b156930a0709e648cf7760b6ec1399f73","observation_id":"2ac381a2-7a67-4441-b1a1-e7c66b4d829c","resolution":{"observed_at":"2026-08-06T22:28:10.803060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05613","last_updated":"2023-11-09T18:59:58Z","snapshot_observed_at":"2026-08-07T21:30:16.529389Z","submitted_at":"2023-11-09T18:59:58Z","title":"Window Attention is Bugged: How not to Interpolate Position Embeddings","version":1},"cited_work":{"arxiv_id":"2311.05613","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.05613","snapshot_observed_at":"2026-08-06T22:28:16.438773Z","title":"Window Attention is Bugged: How not to Interpolate Position Embeddings","venue":"cs.CV","work_id":"cb1c5b1b-fe80-444d-81bb-5954e3ed71b6","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:10.888459Z"},"links":{"cited_paper":"/paper/2311.05613","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:241fb0956e4c9f338cce9ebb86b9b756ca5b4e996a760355262199092552daec","observation_id":"9992915a-c8e1-4f4f-80ae-be853b1b3b11","resolution":{"observed_at":"2026-08-06T22:28:16.533009Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.370580Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":"2bec55d1-0280-456d-a35d-b8ca20301c3e","year":2020},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:10.975136Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:f6b01bb0540f52f45fde28de281eb14b99bd3c4d2d9e59d04ec345374755a8dc","observation_id":"89010207-a54a-4a6e-8e9f-974003b12214","resolution":{"observed_at":"2026-08-06T22:29:27.387049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.327351Z","title":"Mopa: Multi-modal prior aided do- main adaptation for 3d semantic segmentation","venue":null,"work_id":"f090959c-d9c9-4424-b1d1-974dd2ecba41","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.046017Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:29bcca0dc3f5cb27b65571f315dafc1a83efe91262dc6db9c86d76e7451151c2","observation_id":"6b49c0f9-68f1-4c6e-a557-29ab62811d22","resolution":{"observed_at":"2026-08-06T22:29:27.346250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.285093Z","title":"Rsprompter: Learning to prompt for remote sensing instance segmenta- tion based on visual foundation model","venue":null,"work_id":"b77f34d0-cd07-4611-8439-54290ec217d9","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.102893Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:df55da43152923147df684f3c739d54bd208e839f86d533930c7a7bd38f0cb50","observation_id":"ad728328-d395-4920-9852-d916c8ae3c76","resolution":{"observed_at":"2026-08-06T22:29:27.303638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.245002Z","title":"Clip2scene: Towards label-efficient 3d scene under- standing by clip","venue":null,"work_id":"c97ca10b-79bc-43be-b6bf-c74b7cbe9a7f","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.222058Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:9d06be9629dec835903a7fdd193ce8862d7b41e4acf168bc90013b5a808ff97d","observation_id":"c7c4142c-3c5d-44b1-85b9-54f9f2588850","resolution":{"observed_at":"2026-08-06T22:29:27.262150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04579","last_updated":"2024-08-10T11:20:52Z","snapshot_observed_at":"2026-07-06T18:58:30.942582Z","submitted_at":"2024-08-08T16:40:15Z","title":"SAM2-Adapter: Evaluating & Adapting Segment Anything 2 in Downstream Tasks: Camouflage, Shadow, Medical Image Segmentation, and More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04579","snapshot_observed_at":"2026-08-06T22:28:11.282044Z","title":"Sam2-adapter: Evaluating & adapting seg- ment anything 2 in downstream tasks: Camouflage, shadow, medical image segmentation, and more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.282044Z"},"links":{"cited_paper":"/paper/2408.04579","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:88b254ad0e69ff731abdb2640bd97f2a66cafdd99de94319d820e4107962c0ba","observation_id":"bce75e2d-29a5-48c6-990d-9a8cdbddb7e4","resolution":{"observed_at":"2026-08-06T22:28:11.282044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.172561Z","title":"Futr3d: A unified sensor fusion framework for 3d detection","venue":null,"work_id":"4aa34aeb-bdc8-4528-9730-1834e1160abe","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.358394Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:2dca02faa4693923eee7607bf4bdf7e8dbc391289a429ac7779c0bbab72c700d","observation_id":"a57b0d19-3363-47fc-9907-32a96d8e68d4","resolution":{"observed_at":"2026-08-06T22:29:27.192187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.122063Z","title":"Modular interactive video object segmentation: Interaction-to-mask, propagation and difference-aware fusion","venue":null,"work_id":"84eb1fc2-19ba-49b9-b9d2-9225f70a6900","year":2021},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.437050Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:efad8f7cd297dbcdb0cef336c8650be3a47df0f2049ae1a88019ed35e490d473","observation_id":"6ff831bb-075d-4614-baa4-f0b6d2a39902","resolution":{"observed_at":"2026-08-06T22:29:27.149445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:26.698440Z","title":"4d spatio-temporal convnets: Minkowski convolutional neural networks","venue":null,"work_id":"8146df2c-f98d-4fa8-adea-b6a6dba793f3","year":2019},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.543080Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:9450c7baf9f4a1b6240a098d651b1dc9ac874d50dcf5a8425c32e7dfaa52d9c7","observation_id":"05c13c22-e3f8-4399-8f0e-f50900c6da1c","resolution":{"observed_at":"2026-08-06T22:29:26.651484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:25.483953Z","title":"Benchmarking robustness of 3d object detection to common corruptions","venue":null,"work_id":"f755f6be-e5c1-4be9-8f09-d3c6397d6d5d","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.628577Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:30dfcc8239e3b9edccf33e908d8cb3ec3afaf861da5968b0452d834e9765a79b","observation_id":"e682c806-5e8d-44e4-a89b-2d054e40b149","resolution":{"observed_at":"2026-08-06T22:28:25.874669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08206","last_updated":"2025-04-10T17:59:53Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:59:45Z","title":"Interactive4D: Interactive 4D LiDAR Segmentation","version":2},"cited_work":{"arxiv_id":"2410.08206","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08206","snapshot_observed_at":"2026-08-06T22:28:16.221789Z","title":"Interactive4D: Interactive 4D LiDAR Segmentation","venue":"cs.CV","work_id":"4222fa3a-cad5-46e1-998d-577229daa849","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.689229Z"},"links":{"cited_paper":"/paper/2410.08206","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:e8cff1ff84dde4283e96f247ed412475082ded330c64cb133d1d5aa3c6efc5fe","observation_id":"5a5a5369-4943-489d-95df-0dedf5477d85","resolution":{"observed_at":"2026-08-06T22:28:16.308866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:25.187124Z","title":"Scale dispar- ity of instances in interactive point cloud segmentation","venue":null,"work_id":"e4d5c70c-6bc6-4c3c-b82c-5eb299d90b33","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.749729Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:33c84eadb746b4ba17f46ce24e15d3f50c724b3d05141d8e280bae2ab25fd178","observation_id":"288c131c-5716-4678-a671-72ffd04b7912","resolution":{"observed_at":"2026-08-06T22:28:25.321476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:24.588608Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"6730f7bf-519c-4e21-9b83-cbe094522c29","year":2016},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.810505Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:43c34f823eee6eaf9fbeea62fc1f6618333b279aafb75447d5f3090a0bc97c26","observation_id":"c4d0897f-45dc-4955-89aa-92352ea36eb2","resolution":{"observed_at":"2026-08-06T22:28:24.915851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:24.313967Z","title":"Segment3d: Learning fine-grained class-agnostic 3d segmentation without manual labels","venue":null,"work_id":"2880708e-0972-4b67-97fe-e46838c60d68","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:11.924255Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:7a4f6c2b37bfe7ae0536efc77b813621ca410dff8624fe10ea0ce6950f82ffe2","observation_id":"9ab79ba9-7ea9-4821-bdde-d809574fc80a","resolution":{"observed_at":"2026-08-06T22:28:24.417648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:24.124619Z","title":"Segment anything in high qual- ity","venue":null,"work_id":"d853311e-b23c-4766-bbdb-b7b8ffebe51b","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.016699Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:afac3b062faf63412126e5bace2e5ff71a3b88769dd3a255fc97fa927b9ba4fb","observation_id":"0eb6b550-77ab-43e2-bacb-b39043093dc1","resolution":{"observed_at":"2026-08-06T22:28:24.209914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.928980Z","title":"Segment any- thing","venue":null,"work_id":"61684f46-cbbd-4345-b80b-c8a78c6ca3d7","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.097005Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:ee9f1baa6916e731e272aa89b4af229c42aa7e1dd686d89a2a54d254b0bc7e3d","observation_id":"27d59497-94e5-47ee-b449-e591fd5d1db1","resolution":{"observed_at":"2026-08-06T22:28:24.021950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.736885Z","title":"Mseg3d: Multi-modal 3d semantic segmentation for autonomous driv- ing","venue":null,"work_id":"d2a6ee4b-aa1b-4334-ab7d-a78a87ca56d3","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.161800Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:fb3541ccae848c544a462b46814bf2252f0af04267ef83a660220e02e074c978","observation_id":"b48e889b-3f05-4a1d-9e35-34e7b5d7afaa","resolution":{"observed_at":"2026-08-06T22:28:23.828327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.560008Z","title":"Pmafusion: Projection-based multi-modal alignment for 3d semantic oc- cupancy prediction","venue":null,"work_id":"f0f46399-da23-4eaa-b62b-92e6dbe30ea3","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.287159Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:ba8bdd78184f78ad31aad9d6590fa0acf9a18be2d24a0d5724934f1e5d431a38","observation_id":"8e8cfae4-d57b-4452-a94a-dc2bc45c40b2","resolution":{"observed_at":"2026-08-06T22:28:23.627826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.398674Z","title":"Lwsis: Lidar-guided weakly super- vised instance segmentation for autonomous driving","venue":null,"work_id":"8e11a2bd-3320-483d-98e1-3e756aa9a5b3","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.400584Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:9c16d26105515cb91a9b330f141a06a813ab44eb362a4905299522cd858a70cc","observation_id":"57ba217e-c2f3-4515-9b7b-d9f9deebdb50","resolution":{"observed_at":"2026-08-06T22:28:23.454887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:12.516765Z","title":"Unifying voxel-based representation with transformer for 3d object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.516765Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:a5984865d34a9415921a1bac3177e4b8c8a61209b8fa7d11603115b46bc38492","observation_id":"4852bd04-6014-4ed3-b718-1fabca8ccc35","resolution":{"observed_at":"2026-08-06T22:28:12.516765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:12.613265Z","title":"Bevfusion: A simple and robust lidar-camera fusion framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.613265Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:12fa8bf7a3d19e4bf32ea2b471395b6549c2f33b8f76b1b71c298f47c51ea80e","observation_id":"3ad836e0-5447-4f84-8b78-4f13a6c2c4b3","resolution":{"observed_at":"2026-08-06T22:28:12.613265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.222108Z","title":"Vlm2scene: Self-supervised image-text-lidar learning with foundation models for autonomous driving scene understanding","venue":null,"work_id":"83a69387-bea2-4beb-8d33-5c30681ca0bf","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.691733Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:7f6aabd33ff8609b8caf96d9eb415c90636c7467dd5aae86633a843d85c2603e","observation_id":"7dc72b01-e2f8-486a-93c7-5cb8c9a9fc75","resolution":{"observed_at":"2026-08-06T22:28:23.274589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:23.094681Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"df6d64c8-91fb-4ed4-b627-efd7a5ff9b69","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.767624Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:c7bb17074da8150fc8a752763fc695d8a9b2a540dd471c9e8eab9601041e68c9","observation_id":"69cefcba-e25b-4313-924f-7d8e5fdfcbb3","resolution":{"observed_at":"2026-08-06T22:28:23.136403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:22.877875Z","title":"Segment any point cloud sequences by distilling vision foundation models","venue":null,"work_id":"bda2f0b4-dbb6-4bcc-85a2-3b31acc14d33","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.816178Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:d7c5532e2c07ea8cf81dfb7f390633d68d9c16a46460340929c5120741a3b07c","observation_id":"521ff32b-f73d-4f80-be6f-405ce9ac529f","resolution":{"observed_at":"2026-08-06T22:28:22.999539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:22.586795Z","title":"Bevfusion: Multi- task multi-sensor fusion with unified bird’s-eye view repre- sentation","venue":null,"work_id":"efd11440-1f5d-4f22-adcf-b4c2ec1e2fee","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.913459Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:144becc69d98a8d2472a6c412259bea9dcb66a53b2d7da217b857a24c84eb3dc","observation_id":"887d42bc-bd97-46b5-a0d5-ea8e716bc9d5","resolution":{"observed_at":"2026-08-06T22:28:22.716845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:22.357967Z","title":"See more and know more: Zero- shot point cloud segmentation via multi-modal visual data","venue":null,"work_id":"a08e4894-5c95-439c-bdf9-23b39e21063d","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:12.983576Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:b147e238db9cd952cdd7bcbddf991fc57dd014f3128e60db4aa411f6436d6e75","observation_id":"1ebe25f0-709a-47bd-bf85-0e8823cd6382","resolution":{"observed_at":"2026-08-06T22:28:22.455639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:22.103499Z","title":"Segment anything in medical images","venue":null,"work_id":"fd2335be-4115-4f3c-9973-101d213dc290","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.092381Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:9801fe581e4ee491ccc1e5947debd2adac6bd0a6685bf8a2487be1029a682881","observation_id":"58779a7e-db85-41b4-87e4-46f68b9d48f5","resolution":{"observed_at":"2026-08-06T22:28:22.248901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:21.795503Z","title":"Segment anything model for medical image analysis: an experimental study","venue":null,"work_id":"99091342-a955-4167-b5d3-6477f525df40","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.168000Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:67bdab6279452fbe63b841d1b08bef585a282ae825ba8742de41286e6e20701e","observation_id":"06358cd6-5af7-4a6b-b613-7a4e03d3338e","resolution":{"observed_at":"2026-08-06T22:28:21.961123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:21.465239Z","title":"Robust 3d semantic segmentation based on multi-phase multi-modal fusion for intelligent vehicles","venue":null,"work_id":"37398f4d-06a8-4478-a087-7824ea2981d2","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.268755Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:2f6549db3b38775039f37c47ef3300a1d9632e49e5e47801fe380c93af2d6308","observation_id":"c2693f9a-04ae-4461-9ac0-effec3427f74","resolution":{"observed_at":"2026-08-06T22:28:21.593696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:21.210430Z","title":"Better call sal: Towards learning to segment anything in lidar","venue":null,"work_id":"7c466c1e-5018-49e4-97bf-fa5a66dea648","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.329196Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:f7b663ba5729a516a7e4f3de475d08cd81d131acdfc4243a0d324ffe23b9fb1c","observation_id":"7223ce68-41fb-4da4-9e6c-4791ad46c17f","resolution":{"observed_at":"2026-08-06T22:28:21.306518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:21.026430Z","title":"Co-occ: Coupling explicit feature fusion with volume rendering regularization for multi-modal 3d semantic occupancy prediction","venue":null,"work_id":"3bde9a67-87b3-4d04-95b2-638fcd8ab6ba","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.425878Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:2f84507ccc57b6dc8d4b2c321757ba9be787a69f3d4da0ac6c1ba20e0369f277","observation_id":"00e01074-674a-4b09-88cc-8faa5e1808bc","resolution":{"observed_at":"2026-08-06T22:28:21.155493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:20.758614Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"2343957c-4002-4042-811c-ab2c3e0a7054","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.479715Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:b22d67f33a74d2222732900ffa40f2b5048eafc13fd1a7dae4027e9aab68432b","observation_id":"56222498-ccbf-4815-9543-67b0663ff15d","resolution":{"observed_at":"2026-08-06T22:28:20.883231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:20.491172Z","title":"Lift, splat, shoot: Encoding images from arbitrary camera rigs by implicitly unprojecting to 3d","venue":null,"work_id":"cd458942-f3aa-4bc9-a3b2-d1a2c41853c6","year":2020},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.546869Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:9e3f8f5226af6d015eb077130972f6e19ea88b31f63c367ee087f91ab10165b1","observation_id":"3b0fe05a-39b8-48ef-977e-87226489e8e4","resolution":{"observed_at":"2026-08-06T22:28:20.604570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-06T22:28:13.642128Z","title":"The 2017 davis challenge on video object segmentation.arXiv preprint arXiv:1704.00675, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.642128Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:ca54a0077fe84f13ed5bdf41fb0806418fc22b0dfe5f1bf91a9c014fc3421f39","observation_id":"95121827-8a7d-44fc-878e-3baaecc68ddd","resolution":{"observed_at":"2026-08-06T22:28:13.642128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:20.257315Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"ab641937-62db-42e4-997e-bbe76c43a789","year":2021},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.732489Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:a43c7c6f4c8be0765677e852e861fbb0bbcb8ef8c710662c31d29367bcdb46ac","observation_id":"b3951558-4fb3-44c4-9701-ac99923d386d","resolution":{"observed_at":"2026-08-06T22:28:20.358640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T22:28:13.828639Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.828639Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:f0a42d46275cd46435dfd2223d3b70def7424ccb1db16c22b7caf61bae7c782b","observation_id":"d33ec2b0-c661-4b84-9eeb-16412d686622","resolution":{"observed_at":"2026-08-06T22:28:13.828639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-05T08:31:40.101811Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-08-06T22:28:13.888243Z","title":"Grounding dino 1.5: Advance the” edge” of open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.888243Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:3bd3818ec470f416504c40c45e4217c7d40f3b85db21481e960231dddabce682","observation_id":"0ce97f8d-5518-48cb-be0c-b13437d839de","resolution":{"observed_at":"2026-08-06T22:28:13.888243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-06T22:28:13.937878Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.937878Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:7096e039c8f8be897eb074a1be823b851133c149d10e6e503b071794c5a79dfb","observation_id":"6bb1e929-f93e-46d1-a1c2-f718a3ecead6","resolution":{"observed_at":"2026-08-06T22:28:13.937878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:19.970963Z","title":"Hi- era: A hierarchical vision transformer without the bells-and- whistles","venue":null,"work_id":"08749e10-e777-4554-9592-3ab3e1309a18","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:13.996791Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:d519c5f44e68568b6e2abf09a69a0b66d1dec5965daa050508220fdc7f43be00","observation_id":"04eeb661-edeb-4890-abb3-1f31f9b7038a","resolution":{"observed_at":"2026-08-06T22:28:20.124015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:19.806538Z","title":"Mm-tta: multi-modal test-time adaptation for 3d 10 semantic segmentation","venue":null,"work_id":"d1a59216-111c-4e7c-975f-d9047babf037","year":null},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.083889Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:ac79704812d3eaeb02fe38d6f9415051bfede162aec5663df76de1ca12cf9b6e","observation_id":"fe3c8e16-b962-4f90-a250-866c14332d9d","resolution":{"observed_at":"2026-08-06T22:28:19.905563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:19.561569Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"00209697-54d3-4681-8e15-47f1b083121c","year":2020},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.198855Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:f176ef77ebd276cefc17d26c5d26b12c046a11d0abf9b5804fc13cc6398fa933","observation_id":"8e8a36f8-76dc-4376-afae-5d73055b4523","resolution":{"observed_at":"2026-08-06T22:28:19.679837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16133","last_updated":"2023-06-14T17:30:54Z","snapshot_observed_at":"2026-07-06T15:33:23.984280Z","submitted_at":"2023-05-25T15:07:25Z","title":"OVO: Open-Vocabulary Occupancy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16133","snapshot_observed_at":"2026-08-06T22:28:14.311420Z","title":"Ovo: Open-vocabulary occupancy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.311420Z"},"links":{"cited_paper":"/paper/2305.16133","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:6acebd7a247b5f4c4e18d3e2d7bd31979f1e8c48b6ad0c03ea8c43fc583b6dee","observation_id":"10904c99-98c2-4407-80de-7fd0d75e0fb1","resolution":{"observed_at":"2026-08-06T22:28:14.311420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:19.273079Z","title":"TorchSparse: Efficient Point Cloud Inference Engine","venue":null,"work_id":"5aa2e0d5-607e-4505-a6fa-e299a87860e8","year":2022},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.388928Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:490a8be20a4df4fd86ddd893e0d3f7a8c663ad8a5ee51f90526f8fed261cb9e5","observation_id":"048dea18-c13c-43bc-889b-9508a4246db2","resolution":{"observed_at":"2026-08-06T22:28:19.394459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:19.038284Z","title":"TorchSparse++: Efficient Point Cloud Engine","venue":null,"work_id":"3666f1be-19e8-4035-b72b-35bbb7d71069","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.457268Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:e9dc61738a33b6d331937f45c9231feb8bca098122b072253d6599d263e36e69","observation_id":"6d4e4b1c-5c4b-42ef-bb94-67dc322153bb","resolution":{"observed_at":"2026-08-06T22:28:19.142619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04709","last_updated":"2023-04-11T03:53:13Z","snapshot_observed_at":"2026-08-02T08:12:49.049315Z","submitted_at":"2023-04-10T17:05:58Z","title":"Can SAM Segment Anything? When SAM Meets Camouflaged Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04709","snapshot_observed_at":"2026-08-06T22:28:14.554591Z","title":"Can sam segment any- thing? when sam meets camouflaged object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.554591Z"},"links":{"cited_paper":"/paper/2304.04709","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:da1280748f54e623e6f55fa8dacaaec32e0178fcb1923d32d636e14a2530c725","observation_id":"2ca008ae-81d6-454e-b188-3f093be001e1","resolution":{"observed_at":"2026-08-06T22:28:14.554591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:18.744530Z","title":"Vdbfusion: Flexible and efficient tsdf integration of range sensor data","venue":null,"work_id":"efe5d83a-f1a2-49ea-adea-5dda6fc40b0f","year":2022},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.617828Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:3e4384527a04407f77bc2d2569acb89e0abf2891ab5689e1efcfd92bfb8088e0","observation_id":"dd6a4028-5a97-44df-9a51-3348a75155a6","resolution":{"observed_at":"2026-08-06T22:28:18.889648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:18.458630Z","title":"Pop-3d: Open-vocabulary 3d occupancy prediction from im- ages","venue":null,"work_id":"0643e187-a8dd-45c7-96d3-a5e9b0f95756","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.696262Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:3f1de4ca9bb4f3599f48dbc06cfa179d597daeb17396ee869cad231cf18695a6","observation_id":"4514438b-612b-45ce-ad7c-9f0799eaac10","resolution":{"observed_at":"2026-08-06T22:28:18.596931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:18.375752Z","title":"Occgen: Gener- ative multi-modal 3d occupancy prediction for autonomous driving","venue":null,"work_id":"efce1fff-0e8c-4c0a-978a-1cf2535aa9ab","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.745117Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:2fd590a6c45f2a5f19ace86212d75752bd2c13fabef74bca37ab9ee1b39f57d3","observation_id":"b20dc3c7-d8d9-4ed9-837a-c7e0b4f764b8","resolution":{"observed_at":"2026-08-06T22:28:18.397216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:18.242316Z","title":"Meta- rangeseg: Lidar sequence semantic segmentation using mul- tiple feature aggregation","venue":null,"work_id":"ecd975c7-7c70-4e4d-8a15-b96fc409368d","year":2022},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.837250Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:4458abba8389462a51a4b08fb8e31ade48d26160c7e65c102cbe55b951b5cb71","observation_id":"5117500d-1e4f-4828-9c67-3c422536abfc","resolution":{"observed_at":"2026-08-06T22:28:18.304287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:18.074488Z","title":"Lidar2map: In defense of lidar-based semantic map construction using online camera distillation","venue":null,"work_id":"6fdde540-8c60-47df-aa95-2ab15a880a46","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:14.911320Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:b5928916f50ba4d1951f940d535ec5db7352a1db6299e9be33cb217fe45bd9a3","observation_id":"1826d538-8db4-4539-abf5-f4c4d9e65dd5","resolution":{"observed_at":"2026-08-06T22:28:18.142947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06719","last_updated":"2023-04-13T17:59:46Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:59:46Z","title":"RoboBEV: Towards Robust Bird's Eye View Perception under Corruptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06719","snapshot_observed_at":"2026-08-06T22:28:15.020275Z","title":"Robobev: Towards robust bird’s eye view perception under corruptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.020275Z"},"links":{"cited_paper":"/paper/2304.06719","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:0893554a84fe92cf0b7c40fa7904231084a89882f7c0ed0b52c3e4dd410a59cc","observation_id":"2f119ed4-54bf-4b06-a0fc-111514c14e61","resolution":{"observed_at":"2026-08-06T22:28:15.020275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.922721Z","title":"Sparsefusion: Fusing multi-modal sparse representations for multi-sensor 3d object detection","venue":null,"work_id":"7ac04ede-5f3e-4d6b-9ef9-be51e9b5be38","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.086386Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:51cff6c10cfd0a3cf274ca5319cab4c17ebbdcee945b7d48ffcbcf9faff17f6e","observation_id":"57ac75e5-3316-46cf-b835-ff898c2efd3b","resolution":{"observed_at":"2026-08-06T22:28:17.974967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.759847Z","title":"Efficientsam: Leveraged masked image pretraining for efficient segment anything","venue":null,"work_id":"537b0063-3049-43af-8125-595a2b96dbda","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.162663Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:ac4a697e9b205f3f9343a835def069f422c77bc3ed945aa9037a5654dcd24795","observation_id":"c45b0873-6ebf-48b1-92e7-f03a01d3cbff","resolution":{"observed_at":"2026-08-06T22:28:17.828763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.606739Z","title":"Cross modal trans- former: Towards fast and robust 3d object detection","venue":null,"work_id":"2e941da0-b3a3-4ff5-8d1b-5a4fa0b14858","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.230500Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:5adbbafa4ac42468bc59b2075854c99d838aa6267f6df28c0d96d9d4b769e51b","observation_id":"3af955d8-7007-4b70-ab22-03a92915b5a5","resolution":{"observed_at":"2026-08-06T22:28:17.689018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03908","last_updated":"2023-06-06T17:59:51Z","snapshot_observed_at":"2026-08-07T21:29:04.973616Z","submitted_at":"2023-06-06T17:59:51Z","title":"SAM3D: Segment Anything in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03908","snapshot_observed_at":"2026-08-06T22:28:15.313315Z","title":"Sam3d: Segment anything in 3d scenes.arXiv preprint arXiv:2306.03908, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.313315Z"},"links":{"cited_paper":"/paper/2306.03908","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:4a9c710ba6695e7b2c99a92ae75bc929b1d77a39c9bc8efb7815a196242bf79d","observation_id":"f769896a-2525-4489-91e7-b3235d7d941f","resolution":{"observed_at":"2026-08-06T22:28:15.313315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.436471Z","title":"Clip2: Contrastive language- image-point pretraining from real-world point cloud data","venue":null,"work_id":"d269b992-1bd9-4078-9cc1-8ff825b0d9bf","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.380507Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:aa6427f7afc311d1435bf421f464656bdd866fd1b14a929583dccfde37400e8b","observation_id":"92380653-c9af-4de4-89df-45bdfeb533d8","resolution":{"observed_at":"2026-08-06T22:28:17.517182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-07-06T15:46:29.060519Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-08-06T22:28:15.468490Z","title":"Faster segment anything: Towards lightweight sam for mo- bile applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.468490Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:a2422633d0d7ecf29a79e5e53f6457a067a85b9b02a2034586886514ec180f89","observation_id":"6a9bb9de-4862-431d-b96a-c716d17ce480","resolution":{"observed_at":"2026-08-06T22:28:15.468490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.298415Z","title":"Sparselif: High-performance sparse lidar- camera fusion for 3d object detection","venue":null,"work_id":"806f2a6d-b57f-4725-87d1-b03de0ec0903","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.557301Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:c3345e112f0c4e33a99c4327589dbe3395ebbe069494d1fda267bda5a313f9cd","observation_id":"5079f15d-3d6f-4ffa-9eb6-60410e2dbaf9","resolution":{"observed_at":"2026-08-06T22:28:17.344616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:17.137404Z","title":"Clip-fo3d: Learning free open-world 3d scene representations from 2d dense clip","venue":null,"work_id":"7bc74dec-5f1b-43af-9abc-edf8d28a433e","year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.633085Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:23013b7fb3816a76388f51f9cfea05127584eb3ea70c75f24c52d15a6e512b7e","observation_id":"266c0635-4718-4ac9-812a-679da8aeb5ac","resolution":{"observed_at":"2026-08-06T22:28:17.210553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:16.987599Z","title":"Fusionocc: Multi-modal fusion for 3d occupancy prediction","venue":null,"work_id":"f420e64a-6318-430d-832f-c21e296315ac","year":null},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.697544Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:3bfb64bcb35a40150449edb270caa1c2b24713c53348c1fab1b73f42bee02251","observation_id":"8d974c38-1dd3-48e8-9b15-0dbb479abf16","resolution":{"observed_at":"2026-08-06T22:28:17.060316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-07-06T15:45:01.961896Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-06T22:28:15.753789Z","title":"Fast segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.753789Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:505c03315444b21e3c536fbbc904eb05de81f6a108de436c53815b519ea48cef","observation_id":"0f863402-eebc-4571-85b7-2e6511037a3a","resolution":{"observed_at":"2026-08-06T22:28:15.753789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:16.812962Z","title":"Veon: V ocabulary- enhanced occupancy prediction","venue":null,"work_id":"bc8d4ff3-4ba4-4267-91ca-12609398c420","year":2024},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.851855Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:3adb08953a04cec1b49512032ed27b64bdd740835135e00395409f8c3f56e023","observation_id":"9b7be7dc-94ce-4f9c-8dad-b1f021f0db35","resolution":{"observed_at":"2026-08-06T22:28:16.897444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:28:16.630840Z","title":"Point-SAM: Promptable 3d segmentation model for point clouds","venue":null,"work_id":"9ea1f5e7-8e29-4e6c-9bc7-dada3d80783d","year":2025},"citing_paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:15.940386Z"},"links":{"citing_paper":"/paper/2506.21547"},"observation_digest":"sha256:4a6d3e068fabf39b1969b0b6f5bc875d86ab487b731a24d22ade157cf740f7f8","observation_id":"b7d79488-01cb-4ca7-9565-da8cafc064af","resolution":{"observed_at":"2026-08-06T22:28:16.708075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21547","last_updated":"2025-06-26T17:59:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:29:32.645077Z","submitted_at":"2025-06-26T17:59:14Z","title":"SAM4D: Segment Anything in Camera and LiDAR Streams"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":2,"verified_fuzzy":48},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2506.21547."}