{"as_of":"2026-08-08T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:508ca69111050938bbe776e8fd80d91a2212e435d02d67df53633b503e588897","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T09:28:01.256510Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10762/citation-record","integrity":"/paper/2607.10762/integrity","json":"/paper/2607.10762/citation-record.json","paper":"/paper/2607.10762"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Semantickitti: A dataset for seman- tic scene understanding of lidar sequences,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:807bee4179a1a36f4b64efa3feb51c3f33093478069829d19c5e5a0a854e0c94","observation_id":"84766c98-e458-41c7-a20d-5ff7ad054f69","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"WildScenes: A Benchmark for 2D and 3D Semantic Segmentation in Large-scale Natural Environ- ments,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:b15aeddcbfd57214b31723cc70c7674c9a412da35582cd4d4e804f4e94d75c29","observation_id":"a665f069-c3e7-4959-8fe6-85eca71cbfdf","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Deep evidential uncertainty esti- mation for semantic segmentation under out-of-distribution obstacles,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:f4de59ff51240546122f0ec29033547be527a85e52af05695c07c2d21343e3e9","observation_id":"8a9d1dd0-2a03-4e6e-9bb5-df98ebdf5157","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Suma++: Efficient lidar-based semantic slam,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:11077c1f5f83aae647058b63013939f54350d6360db81cec4e34b27df4152d3a","observation_id":"9ec201de-71fe-43f7-a1a1-ba14993259ef","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Pointmoseg: Sparse tensor-based end-to- end moving-obstacle segmentation in 3-d lidar point clouds for au- tonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:0291ffb46761452ca595b3c61cb96a84ecaf1fd9dbb25fc96e51fec511c72c45","observation_id":"14083451-306d-44c6-8654-e5993b5e2c2d","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Theia: Distilling diverse vision foundation models for robot learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:76208eedd0bdd409c0bef28e7f3cd4f4168f2fab9665199b55ef553b962dda8d","observation_id":"9ecb6840-775c-42a9-a091-edb0ed5f0681","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Pair-VPR: Place-Aware Pre-Training and Contrastive Pair Classification for Visual Place Recognition with Vision Transformers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:46b4d345b224bf0e2fd1679f09f002fef236b63699cc33909a20936ceca7dfa1","observation_id":"d13e4282-f684-4db9-bc1b-a354b5bf0f61","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"ImLPR: Image-based LiDAR Place Recognition using Vision Foundation Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:5b1b342d9fc2c80251feb26652bf85e3762b4c2376fa32ccd6c3db1796ab1deb","observation_id":"14e0a7d5-d4a8-4bf5-9e23-ee7fb7ea409a","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Label-efficient lidar semantic segmen- tation with 2d-3d vision transformer adapters,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:0e37e3183d596ebd8687d5060efd976d0642b5e5efc4334bbe8dce01e10ccc7e","observation_id":"6625ddc3-f294-42d4-81d9-27277dd208a9","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04687","last_updated":"2021-12-27T15:19:51Z","snapshot_observed_at":"2026-07-06T10:58:14.547632Z","submitted_at":"2021-04-10T05:40:42Z","title":"Learning from 2D: Contrastive Pixel-to-Point Knowledge Transfer for 3D Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04687","snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Learning from 2d: Contrastive pixel-to-point knowledge transfer for 3d pretraining,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"cited_paper":"/paper/2104.04687","citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:15dfa8b751c06927940fe186c443c9905a1c42ce6512b7b18d9e065f1ab4d17f","observation_id":"933573ac-84db-456b-beb3-d17fb5880473","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Three pillars improving vision foundation model distillation for lidar,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:186a9ac5223891dd2ccc8dd5f97d7658eb595c7360490d0f6629705ec557bae2","observation_id":"3034f2f3-da9a-428f-9ca3-09bb5083337b","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Image-to-lidar self-supervised distillation for autonomous driving data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:0ffd27a1a9d7ec42ccbb62672a393a13f3a4ed16d0d45b87cf2837b3b0de8548","observation_id":"ac8a2b7e-43e8-4bef-828b-dde9832f38f0","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Segment any point cloud sequences by distilling vision foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:a3283440e1ca22e8e6ff4aa6e433f96ebbfb22c6b80263bccb02f88c4dddc8f8","observation_id":"509029e5-5c15-408d-8345-6cfe421a8bbb","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Cleverdistiller: Simple and spatially consistent cross-modal distillation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:c34866262a50f291d1808429b4c095ea5af864f06f7c133c55ebaca202a411cd","observation_id":"2e6b1bdb-b57b-44d0-bc9c-9884cf0204ac","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Cross-modal self-supervised learning with effective contrastive units for lidar point clouds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:c121431292869f77148140a15b2b4759659077cab060c437ad6251e8e334170c","observation_id":"d13a5021-11e1-4b1c-8fe9-6c3073ddc83b","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Point-PNG: Conditional Pseudo- Negatives Generation for Point Cloud Pre-Training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:2e44beb0b98721799fb92860c8786068cc6b22361a243bb1ee73ed0d88931d93","observation_id":"bf63f9fe-9f02-47cc-8329-ed8fdb2fa157","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Expert-enhanced masked point modeling for point cloud self-supervised learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:4666ede8f2c26453b3a4cb535c2b38d5c7c8b34598d8738b9d4de3e2154e6ea0","observation_id":"533425b7-2a00-4ee6-9165-535a2b9f574a","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:341d2d54714521d84b9a24ec14fe919f7651e2c622f5db2b6795659d72ec1b16","observation_id":"d70c9a7b-cc0b-48c1-8d7c-39940f52d2e8","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Largead: Large-scale cross-sensor data pretraining for autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:3d223579bc8629ef51f1204df0035bdcb749b4ccc3834c6440ce9e63a7e00341","observation_id":"218e7b32-43e6-4fe9-ad38-df5bdbbbe30d","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Do vision transformers see like convolutional neural networks?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:3cd8dfbf57859ad1a82d0f66f43d0f3477a5e87df1de7cb18e975a857cf926ab","observation_id":"0a01c858-be10-4ae0-a197-680324f599c6","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"One-for-all: Bridge the gap between hetero- geneous architectures in knowledge distillation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:b26b2e3537925f1d743cfb7ee9e818ae008665289d253b86fb89fd006c8dbdff","observation_id":"d64bec77-e9cd-4e13-a851-3011640d1105","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Cumulative spatial knowledge distillation for vision transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:b30097c27e0cf354b7f3dd8f99090bc86061c4ec2dd6b5dfa17b9412049af205","observation_id":"6611b169-bea6-4dd2-9108-c08d06455cce","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"nuscenes: A multimodal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:62af53d2fc591f53e399e56020761bd86f528b7cdb6485c715e4a9540abed4dc","observation_id":"b4aac3f5-aa83-42d6-a74a-5a7427f19d2d","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Pandaset: Advanced sensor suite dataset for autonomous driving,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:6e8125ededff75e09caff948ffe3b889eb3bde2fa8bce274e32b0a10e0b9bf81","observation_id":"5f56e3a3-eaa2-4585-ac8c-6ef1d0461582","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Scalability in perception for au- tonomous driving: Waymo open dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:8bab6b089983cb5c64bfa457858bd0eed8fa9f34faf7611d39ddac741cd5d04e","observation_id":"ba520142-60d6-490c-be60-5f7c1bae1fc5","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Improving multimodal distillation for 3d semantic segmentation under domain shift,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:eff8e581f79a5dac8083e487708ddf16f6330d7869fa8cdbafd695be1095dbd6","observation_id":"4d14490b-02a9-4195-8092-6cfded02042d","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Self-supervised image-to-point distil- lation via semantically tolerant contrastive loss,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:d6db6730958459096e63a67f4b32aac2e02c452a622ebf3fc25452127e0c4ab6","observation_id":"d047f6fb-4fd8-40fa-a464-99e079c996e6","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Minimal-entropy correlation alignment for unsupervised deep domain adaptation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:2001c88f9ab8f0e62d68e75448235321e83e0c051c33cd8e75be1949e9e8c18d","observation_id":"83b2f537-2ae9-47e2-9416-e8a5c4e0546f","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Cosmix: Compositional semantic mix for domain adaptation in 3d lidar segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:307b936ec4d82c0158aa7ca3bb31eabe74ab3df88395ee6fa4f5e9666c3db012","observation_id":"c8a5eb0d-30f4-48e7-afad-b31948593f9c","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Exploiting the complementarity of 2d and 3d networks to address domain-shift in 3d semantic seg- mentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:0e4201f9ab9b900b89d3b9fdb625de047007a49fe833b29498d57ae931568cab","observation_id":"fd66f901-46d7-49f5-8fed-3b737a633fdf","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Learning to adapt sam for segmenting cross- domain point clouds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:8e3308e225df804c35df7b3a456b33ec4e04851d0f36e436945af20e5418862b","observation_id":"4674341f-3cc0-4e87-8db2-081a9138a3e2","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Using a waffle iron for automotive point cloud semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:d2b4ba4c796830e34736acc965445fdd055eeafdad64f98cb26f212e73efa4f4","observation_id":"f02aebbb-1662-4faa-9d33-725c50509d9d","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"DINOv2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:3b262569a0b133a1b61f289974d62c47b254813327212b10f46ee18bbf609238","observation_id":"27cca281-1886-4e88-b1f8-d9780eb9585f","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Dune: Distilling a universal encoder from heterogeneous 2d and 3d teachers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:ac11d2b924c11af9242aa01564b35d3f35d2b0b8ef19f0862858f1f3e99aab9a","observation_id":"d4cedd7d-ac6e-45fb-b8d6-b1a60f635c6d","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"Robo3D: Towards robust and reliable 3d perception against corruptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:472f1924c2a3c29cfd11991da664d475a328267530a502da0abe77db4f81dbf8","observation_id":"05851c56-99ec-4c69-a5dd-15cbf6dc5823","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T09:28:01.256510Z","title":"4d contrastive superflows are dense 3d representation learners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T09:28:01.256510Z"},"links":{"citing_paper":"/paper/2607.10762"},"observation_digest":"sha256:7f549a64c7680a58c8d2ad218a476d63e412c78d18a536d738473015fb1b5ebf","observation_id":"e9e074c9-5dd7-423e-b98b-971a21d86c50","resolution":{"observed_at":"2026-07-14T09:28:01.256510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10762","last_updated":"2026-07-12T13:37:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T23:40:53.167718Z","submitted_at":"2026-07-12T13:37:47Z","title":"TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2607.10762."}