{"as_of":"2026-08-06T20:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f914598d3387100a52fb02edc42197fb60be78fc69b171e3535881aa9fc6b705","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T08:24:44.943709Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T03:16:33.702802Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T18:08:46.857611Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"cited_work":{"arxiv_id":"2602.00937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.00937","snapshot_observed_at":"2026-07-03T18:08:46.857611Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","venue":"cs.RO","work_id":"1dcd85bb-22fd-44d9-b331-13e60b1c3a03","year":2026},"citing_paper":{"arxiv_id":"2606.17256","last_updated":"2026-06-15T20:00:20Z","snapshot_observed_at":"2026-08-01T18:51:15.199353Z","submitted_at":"2026-06-15T20:00:20Z","title":"Contrastive Action-Image Pre-training for Visuomotor Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T03:16:33.702802Z"},"links":{"cited_paper":"/paper/2602.00937","citing_paper":"/paper/2606.17256"},"observation_digest":"sha256:27922571b0d3675184c17b0889dba66124a64f045cd3f1fed811dab6b24db315","observation_id":"0c5ffa09-569f-4857-9c50-80a116b0313c","resolution":{"observed_at":"2026-07-03T18:08:46.859071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.00937/citation-record","integrity":"/paper/2602.00937/integrity","json":"/paper/2602.00937/citation-record.json","paper":"/paper/2602.00937"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Big vision","venue":null,"work_id":"91305a97-cabd-4cb3-afcd-92a5ee283902","year":2022},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:b433f978aa234a77b07136d6b65b4ba90f424f5c736eff3b67f7683b9627fb21","observation_id":"7bd41ea1-fded-4706-a238-697e91a2981e","resolution":{"observed_at":"2026-05-16T08:30:46.316088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:4a6aaf062efcf6fe5ce50374b33f7ca6ec366b22b42abb79703ef566fb1cc954","observation_id":"7ee11045-bf6a-4a87-b6a7-108aa68eb244","resolution":{"observed_at":"2026-05-16T08:27:36.903981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JAX: composable transformations of Python+NumPy programs","venue":null,"work_id":"190ddee1-0fa2-40a8-acfc-a95292641cec","year":2018},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:599a0cc32a0aa204a5b6ac345c3cff2ce03ee37b06408ee04b217b45dec73efd","observation_id":"58d325f0-6ec9-4a7f-80fc-b8ec4c002598","resolution":{"observed_at":"2026-05-16T08:30:46.249407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foun- dation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"4f3e760d-1896-4184-b2b4-3f869157f874","year":2024},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:0545d39bd7a63bcc943bdfad8a0b29e1bf78df04cd2829ec386036e5042622d5","observation_id":"a337a850-aeb6-4fdc-b08b-b6d5812b12c0","resolution":{"observed_at":"2026-05-16T08:30:46.288198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reproducible scaling laws for contrastive language- image learning","venue":null,"work_id":"7f3a4541-c537-461b-8b04-9709779916fa","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:3a93fcd57af43b4dcc8c4ff1e4d84affd8717da8d252507944533c336cdfed65","observation_id":"bb933ee7-ea04-4cc2-9e95-743713968bb8","resolution":{"observed_at":"2026-05-16T08:30:46.331038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dif- fusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"d80c0f92-2261-4123-8c1e-e6984a409c86","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:97e67522185c172b39fcf12f8ece1591e376a2de7d78e98550eca8f88cf96933","observation_id":"f8efb56c-a83c-46eb-b1e3-ad0c2d3a5113","resolution":{"observed_at":"2026-05-16T08:30:46.314279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2009.520684","doi":"10.1109/cvpr.2009.5206848","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"author Dong, W","venue":"2009 IEEE Conference on Computer Vision and Pattern Recognition","work_id":"effdb28b-742e-4840-b3ca-d89502a6cd4d","year":2009},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:8993d4c3c1f3fdbac0d7595225425d5b9dd9180494bc3ade911030d5c6ba943e","observation_id":"5167d138-83dd-4a06-858c-1588e01c6c2d","resolution":{"observed_at":"2026-05-16T08:27:36.448205Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:19:22.921889+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:19:22.921889+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"c587e88e-b14f-4b85-b688-7e1a40ba4f48","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:20abb3b230114238bd216cd90c1ca1edfb0396e3e6362130dd76586914a2ea1e","observation_id":"5fa29b93-1576-40c1-86c3-ca6ba4a7d7ad","resolution":{"observed_at":"2026-05-16T08:30:46.357613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"6131c68f-052a-4d22-87ad-9f81556c7ba0","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:13db968c389124373d36f1d61fd49b52baa66159d4d3769df432c862e982adbe","observation_id":"b898bb92-15c7-4289-97f9-6a08e5b0ce7b","resolution":{"observed_at":"2026-05-16T08:30:46.343081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eva-02: A visual represen- tation for neon genesis.Image and Vision Computing, 149:105171","venue":null,"work_id":"6a1cb603-3f7a-4a7e-aba1-723c75e2d0d7","year":2024},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:e5dbc4ef6a301725983214e335ab9e54cd377ac5c761f6680cafa7d6e398b10d","observation_id":"67131aa8-f0a7-49ea-838e-4e193ed5fcd8","resolution":{"observed_at":"2026-05-16T08:30:46.307229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Act3d: 3d feature field transform- ers for multi-task robotic manipulation","venue":null,"work_id":"86edaa31-abe9-4108-8c3b-79cbe3296cc3","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:43c11334a1eba9f3c6cb709d296e54b213688d7529316b22bf686bda280a7f4f","observation_id":"9e1fdcae-4494-4c42-a320-d0e9b8d50d4f","resolution":{"observed_at":"2026-05-16T08:30:46.313442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting point cloud shape classification with a simple and effective baseline","venue":null,"work_id":"1f93c766-21e8-4001-802e-b5cea0e63b16","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:3085017674ccdbff1c02227c7fccf8086af3c7b452e5d18c7c880e9c36e594df","observation_id":"88193174-f803-4904-88ea-86de96acbe9e","resolution":{"observed_at":"2026-05-16T08:30:46.355423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rvt: Robotic view transformer for 3d object manipulation","venue":null,"work_id":"c6ab37ab-24ad-4397-8d8c-5ffe9c6fd416","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:7de7ad2a6b6dcc1e4ed466639f2ea12d811261408191e0c1a43a0c8610dfa04b","observation_id":"32c09b2c-dc2d-4826-9468-7af6653f0cb2","resolution":{"observed_at":"2026-05-16T08:30:46.339217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning dense visual descriptors using image augmentations for robot manipulation tasks","venue":null,"work_id":"b9e59060-0c40-4634-8417-da85f1b0323c","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:661dfa06c5934885103343c68dde8df1b1d709356bd052bc44428f5ae6f62050","observation_id":"4f3fda71-5160-4826-99aa-162edb970956","resolution":{"observed_at":"2026-05-16T08:30:46.304933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pct: Point cloud transformer.Computational visual media, 7(2): 187–199","venue":null,"work_id":"7dc2520d-acf7-48ca-9d93-356864d1b5d3","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:946037b49a4d61012fd507552829ddf3f75c1610b3d053c9f2bb6eafd51244b3","observation_id":"d8850130-7c24-4f2d-8cf7-b11361967db8","resolution":{"observed_at":"2026-05-16T08:30:46.325048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvtn: Multi-view transformation network for 3d shape recognition","venue":null,"work_id":"835fb77e-f303-473a-bd9e-1f2f832258c1","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:f73b49670630d24d9644e92ed2e6cefdbb14355ca6b91e05983c6c3a5b0e8973","observation_id":"e5cc3937-0a6b-476e-9f3b-8a1b2722eb1e","resolution":{"observed_at":"2026-05-16T08:30:46.351117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15363","last_updated":"2023-01-25T16:26:04Z","snapshot_observed_at":"2026-08-01T19:38:25.687983Z","submitted_at":"2021-11-30T13:08:19Z","title":"Voint Cloud: Multi-View Point Cloud Representation for 3D Understanding","version":2},"cited_work":{"arxiv_id":"2111.15363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.15363","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V oint cloud: Multi-view point cloud representation for 3d understanding","venue":null,"work_id":"57435a7f-9f96-4f1f-a6a3-a8de7afe51c4","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2111.15363","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:3097fc9c845ded44e92eac4737d32a82e991f2cf8e59655828dbaedb1273f878","observation_id":"faf9ce29-ce5e-4ab1-b4f1-2fef47304470","resolution":{"observed_at":"2026-05-16T08:27:36.877884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":"2006.11239","doi":"10.48550/arxiv.2006.11239","metadata_source":"pith","pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Probabilistic Models","venue":"cs.LG","work_id":"dc023f4e-7c79-471c-b713-deeb559ba010","year":2020},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:99c9bf74e380787d7dbd12c6cb1fa2a83a50949b65d15d1df2469388c2e2e543","observation_id":"6dbecb7a-20aa-46e5-8367-ed134d8c4b97","resolution":{"observed_at":"2026-05-16T08:27:36.891507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:06.511104+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:06.511104+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pri3d: Can 3d priors help 2d representation learning? InProceedings of the IEEE/CVF International Conference on Computer Vision, pages 5693–5702","venue":null,"work_id":"53871f4d-97b2-4b89-b09a-cf68e05fb64c","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:6906ce6683b75fcc5ae8cf3b3d4ae226bb3cede51d76a73f9a4b262ed4ad6c49","observation_id":"e7acc51b-0eb7-4133-b77c-cfd174f56f59","resolution":{"observed_at":"2026-05-16T08:30:46.309755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive survey on contrastive learning.Neurocomputing, 610:128645","venue":null,"work_id":"844351fc-01ba-4c29-9138-86536e62cbc0","year":2024},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:51f70a9b1561d9fde6506a3810cb38f7960dff28faf7fb8346caf64ba310a6cd","observation_id":"ac154d1c-187d-49da-8043-31e0454d3f21","resolution":{"observed_at":"2026-05-16T08:30:46.346842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":"2311.12871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-07-08T02:44:27.664173Z","title":"An Embodied Generalist Agent in 3D World","venue":"cs.CV","work_id":"2c1392ae-d82d-4f8f-aef7-75a5ff0e5d2e","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:1f4d22be95fb2b8c61b4c7cdcf76b307aedf7be84c4fad44e103b6796a675fda","observation_id":"d9901db9-9d7a-4c63-971e-ae81051efcb5","resolution":{"observed_at":"2026-05-17T14:22:18.773673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-view transformer for 3d visual grounding","venue":null,"work_id":"d5e45184-3d92-44e8-89e4-19f3f6f25b7f","year":2022},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:34e3dea7aa665824c9de4714b8112e36b45ff14fcc0353ad04d165599648a83a","observation_id":"0e09e095-f0c7-4a87-b55e-dce7732c0ee7","resolution":{"observed_at":"2026-05-16T08:30:46.323054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen clip transformer is an efficient point cloud en- coder","venue":null,"work_id":"feca6116-d7be-48bb-ab8d-3f2f415f4fa6","year":2024},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:fa330b332dae66a938038aac9bf26c88f638e1f079db5352361fe6f5ddbf64f0","observation_id":"01779527-60e1-444e-8431-cc55ffcd04bc","resolution":{"observed_at":"2026-05-16T08:30:46.344933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:9713ca3bd5cbcd84b04c04f0c8eb29e2afbac1632ba99e709aeab2faf4654387","observation_id":"ff30f187-bf5b-4e2a-b0ea-69750a3f8f9d","resolution":{"observed_at":"2026-05-16T08:27:36.858412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":"2107.14795","doi":"10.48550/arxiv.2107.14795","metadata_source":"pith","pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","venue":"cs.LG","work_id":"92bf7a73-2bef-4de4-8957-a9233d60b416","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:9249ed19fd31b7d74b8e444c7f71ed208d3e5e1229e802924580b74d93d7d8fe","observation_id":"9fcef661-6cee-4053-86cb-95c8fc0cf59c","resolution":{"observed_at":"2026-05-16T08:27:36.861655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.750382Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"99de536c-2c30-41fe-b0f9-77088fafbc80","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:1f9eb116d50a72aaddf9c522cfe41f3a9ad1d11b1e00c1139bdeef211e9ca298","observation_id":"07cd58b7-0075-445c-a246-60115abcf57a","resolution":{"observed_at":"2026-05-16T08:30:46.298227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lift3d policy: Lifting 2d foundation models for robust 3d robotic ma- nipulation","venue":null,"work_id":"13db3446-cca3-4035-a65c-57e81764f400","year":2025},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:161584bd41a5e802b0f2135332e6525f55e45df4665e6787e96460da60a49953","observation_id":"da2c2b08-b92b-44cb-a2d6-8f604e226792","resolution":{"observed_at":"2026-05-16T08:30:46.311327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"401d75c4-e229-428c-8c22-18c3c9e13102","year":2015},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:26e9045b412ab181a7d2a29214d6b75b65495b7dcc4320a21b23333cccb6f8d3","observation_id":"83154ea4-763d-4502-9e44-65bb88ef7b7c","resolution":{"observed_at":"2026-05-16T08:30:46.315093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:8a6f6caf3db2ac06b19579c680309c1785dcbbdcf6b76b5709be5723cbdf7757","observation_id":"537ba655-8893-47de-9a76-ce547efe1bb8","resolution":{"observed_at":"2026-05-16T08:27:36.848675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:55:40.404070Z","title":"Set transformer: A framework for attention-based permutation-invariant neural networks","venue":null,"work_id":"32c6b486-c81e-43ac-8c40-42f8da58a754","year":2019},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:6635ee2e2e6588c8a556f6b6553c9cbd567ac3f60a86badf53f3d9110ffcc143","observation_id":"2ceeb50a-5650-4e02-bdaf-0c639d236712","resolution":{"observed_at":"2026-05-16T08:30:46.300542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Class: Contrastive learning via action se- quence supervision for robot manipulation","venue":null,"work_id":"94b81581-fc5a-4ea4-975c-6e00899e76bc","year":2025},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:7b999a57735962dafd891f2b75a20208f10cb5db73aac7a13df13ea834209542","observation_id":"ed489ff4-d5f6-46a5-acc4-4cbd2898241f","resolution":{"observed_at":"2026-05-16T08:30:46.321125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07123","last_updated":"2022-11-29T07:07:37Z","snapshot_observed_at":"2026-08-02T22:08:27.106810Z","submitted_at":"2022-02-15T01:39:07Z","title":"Rethinking Network Design and Local Geometry in Point Cloud: A Simple Residual MLP Framework","version":2},"cited_work":{"arxiv_id":"2202.07123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.07123","snapshot_observed_at":"2026-07-04T20:00:07.697178Z","title":"Rethinking network design and local geometry in point cloud: A simple resid- ual mlp framework","venue":null,"work_id":"64512226-f7fd-4e43-8731-9b00608d193e","year":2022},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2202.07123","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:01d9c0f713e55388e2fa6590dac8adc48d77ec84235b1141f8014f18dde60bb8","observation_id":"f829b1b5-d3d0-47a4-9e9e-68a15d8aca5a","resolution":{"observed_at":"2026-05-16T08:27:36.845305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A multi-view projection-based object-aware graph network for dense captioning of point clouds.Computers & Graphics, 126:104156","venue":null,"work_id":"55001951-5c82-4aea-95ae-6ce5672e4660","year":2025},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:f894e4b9ca3b700766623c0ccb4481d445e0617822f67ab22a114eaca8d9fa0b","observation_id":"51460893-ea02-45a6-9416-e83d77d2620e","resolution":{"observed_at":"2026-05-16T08:30:46.252049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16512","last_updated":"2025-03-07T19:38:42Z","snapshot_observed_at":"2026-08-03T16:54:44.297715Z","submitted_at":"2024-10-21T21:05:04Z","title":"TIPS: Text-Image Pretraining with Spatial awareness","version":2},"cited_work":{"arxiv_id":"2410.16512","doi":"10.48550/arxiv.2410.16512","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tips: Text-image pretraining with spatial awareness.arXiv preprint arXiv:2410.16512","venue":"arXiv (Cornell University)","work_id":"6827f81b-625a-4a2b-9237-e3b2e6978069","year":2025},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2410.16512","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:c6fbb1058abfac071cede23f9d9a0660d259b0bc40cca7a9601891d32fce5e3a","observation_id":"047c7a70-f8ac-4ff1-bda9-897b930213fa","resolution":{"observed_at":"2026-05-16T08:27:36.852460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:f23762e3b4a4988792148855e467f5a3b19db1dc07da791e23198e66f9b95d4b","observation_id":"68c7a14d-b60a-468b-8be3-91b8be394917","resolution":{"observed_at":"2026-05-16T08:27:36.855310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","venue":null,"work_id":"b4c36b72-ec61-4bc0-9ea8-cd269118a345","year":2017},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:4cd8b71ffefd88939a772979c2b2b680755a5a1d766685313c36c07b38f3c679","observation_id":"430abd26-323b-43d4-a655-5e08b6cc22a8","resolution":{"observed_at":"2026-05-16T08:30:46.259955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:44:36.348772Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space.Advances in neural information processing systems, 30","venue":null,"work_id":"20799e7f-1c59-4a17-b58e-0c0626f114eb","year":2017},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:e686996e9bf949c8e2abe7de0a069db126dc8cb59f836bbffe491ecccf5dcdf5","observation_id":"839f2c63-a781-42e8-a31a-6ec7dfa3db20","resolution":{"observed_at":"2026-05-16T08:30:46.353200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-mvp: 3d multi- view pretraining for manipulation","venue":null,"work_id":"adc99056-7f6b-4f8b-ab25-def9440403c0","year":2025},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:8e81e4808a258445c25cf3dab55409635384cc34fdde525ac1b0b1d636d1de10","observation_id":"afe5c7eb-34a4-47ce-9076-9eab5265b586","resolution":{"observed_at":"2026-05-16T08:30:46.320043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"383b15a0-137f-4b5d-ade2-936a7156345b","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:2251b2bc6d5316a99813eb5e47189171248a05167a38b89a4652b441c8f34987","observation_id":"9caa72a4-47e2-49ab-8433-7ae7b765a9d4","resolution":{"observed_at":"2026-05-16T08:30:46.271836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:07:33.933522Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67","venue":null,"work_id":"ca70123a-eca4-46cf-a990-8e69d8885801","year":2020},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:134ec3fc95866a4b2d0e03e7f8f3e78db553760fda0e79b435cad7150ac4e295","observation_id":"bede3e90-fb50-4272-89b2-b80325a74a0e","resolution":{"observed_at":"2026-05-16T08:30:46.293364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02562","last_updated":"2025-02-04T18:37:17Z","snapshot_observed_at":"2026-08-02T18:33:53.297441Z","submitted_at":"2025-02-04T18:37:17Z","title":"Learning the RoPEs: Better 2D and 3D Position Encodings with STRING","version":1},"cited_work":{"arxiv_id":"2502.02562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02562","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning the ropes: Better 2d and 3d position encodings with string.arXiv preprint arXiv:2502.02562","venue":null,"work_id":"1e1e309f-439d-4d78-a5a4-345c1686c549","year":2026},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2502.02562","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:5ce6d22bdf6fdfe1e9934b720147fbfd76377f0a94cd1c91919803e7e6f59143","observation_id":"ee44d256-fdd5-4292-9a30-5b5d2139851e","resolution":{"observed_at":"2026-05-16T08:27:36.885411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-supervised visual descriptor learning for dense cor- respondence.IEEE Robotics and Automation Letters, 2 (2):420–427","venue":null,"work_id":"ea50068e-d279-4bdc-a27a-c87e0dc534c3","year":2016},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:e7f5d8c0310cf02b0c2a5a38c82dbb4cf6b31a76dd35ad579a4cd628473344bb","observation_id":"1d2d14c6-82c8-4837-880e-83ff708feca9","resolution":{"observed_at":"2026-05-16T08:30:46.269530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T10:07:01.162390Z","title":"Perceiver-actor: A multi-task transformer for robotic ma- nipulation","venue":null,"work_id":"e1b1ac95-8769-4212-be9a-4e195bdc2903","year":null},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:485632cf34926cd64a0e913804d1246bc2c9387fbb0627b552e89f4309172c84","observation_id":"6c8f155b-96a9-4714-8ada-96048da4f516","resolution":{"observed_at":"2026-05-16T08:30:46.280195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:264ce395fb6dc2c48af43eabe803216c391046595275ffa83783460560108624","observation_id":"f17a7717-22af-45d5-9ee7-f604b22c5562","resolution":{"observed_at":"2026-05-16T08:27:36.880704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03342","last_updated":"2025-11-28T18:57:04Z","snapshot_observed_at":"2026-07-06T22:31:40.462674Z","submitted_at":"2025-10-02T14:32:45Z","title":"Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer","version":3},"cited_work":{"arxiv_id":"2510.03342","doi":"10.48550/arxiv.2510.03342","metadata_source":"pith","pith_arxiv_id":"2510.03342","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer","venue":"cs.RO","work_id":"ffe7b7f4-997b-4957-b253-03cfbebf6f9a","year":2025},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2510.03342","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:7b2f7ca72b623e35252ca2ac550eb29224e28c7e854b66c3b53f45e2a906e417","observation_id":"a3d0d134-ca94-4058-a15c-0203fe0f537c","resolution":{"observed_at":"2026-05-16T08:27:36.888636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T22:42:58.894866Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"1f8d1169-4b4f-438f-9b09-f3b07f8a3f37","year":2012},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:11be4c16a4990f99ea58394ed37cef5db0d2eb020fb8109a00b88541798a518a","observation_id":"91d45c5e-cf4a-40c6-ac8f-ad55ccccae7f","resolution":{"observed_at":"2026-05-16T08:30:46.316971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.567466Z","title":"Attention is all you need.Advances in neural information processing systems, 30","venue":null,"work_id":"751efe07-5e91-415c-b3d1-f4734aa26960","year":2017},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:ec9935a4f244bbbb474617263cc5078f01f0045abea17256cdd401ec2825f10a","observation_id":"bdc581c5-b340-44df-adf1-e1fdf4af5568","resolution":{"observed_at":"2026-05-16T08:30:46.329087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic graph cnn for learning on point clouds.ACM Transac- tions on Graphics (tog), 38(5):1–12","venue":null,"work_id":"053e2680-d74d-4548-bce4-ed61002ea316","year":2019},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:b72b255b1e40f13440bc46221f3b41548e36ae5939d0ddd8e680d675f3d7247b","observation_id":"2b6369f7-64d1-4cb9-acf8-81daf941fa6e","resolution":{"observed_at":"2026-05-16T08:30:46.300344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03045","last_updated":"2025-05-01T21:26:22Z","snapshot_observed_at":"2026-08-06T06:21:48.205081Z","submitted_at":"2025-03-04T22:51:50Z","title":"ArticuBot: Learning Universal Articulated Object Manipulation Policy via Large Scale Simulation","version":2},"cited_work":{"arxiv_id":"2503.03045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03045","snapshot_observed_at":"2026-07-03T20:38:55.343614Z","title":"Articubot: Learning universal articulated object manipulation policy via large scale simulation","venue":null,"work_id":"88f8672a-1c88-45a7-9a50-2587037783ca","year":2025},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2503.03045","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:f62ee4f525297622ff2976ac6d0f39f7d6045f9bd8bc44b1016bcdcbd8ad5a8b","observation_id":"4efc20a3-2ae3-405a-8504-20c163574875","resolution":{"observed_at":"2026-05-16T08:27:36.868328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point transformer v2: Grouped vector attention and partition-based pooling.Advances in Neu- ral Information Processing Systems, 35:33330–33342","venue":null,"work_id":"9a0479bc-7053-4fe2-90d7-9e6bf8d97550","year":2022},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:523fc252a16d783a69618d38739cc5e7da8308c84a46b7d8b93f92233c83b0b4","observation_id":"9564fece-3e91-47a7-9ed4-d50a1a55a16b","resolution":{"observed_at":"2026-05-16T08:30:46.272027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point transformer v3: Simpler faster stronger","venue":null,"work_id":"5667e1b3-21cd-4efe-a680-2981da21e6b0","year":2024},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:f47115b653c7b004283472d1af219552f9ba2ff0a5f844de534ce147555f55f0","observation_id":"dadcd612-037c-46b7-b905-6e183ca0706f","resolution":{"observed_at":"2026-05-16T08:30:46.335192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":"cd3e740f-d1b9-42c1-9111-61243e8e5155","year":null},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:4316b554b677135c396ee5f8b18c1f23a57c02c2079674b4aaefd7735f85d275","observation_id":"5b1a45c1-2f41-4ae9-a02e-5edb7aadeb9d","resolution":{"observed_at":"2026-05-16T08:30:46.319028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding","venue":null,"work_id":"80b95be4-e297-4dd3-bbc9-7044afb5bc68","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:602c1d69f1fcfb71cbefd7cbafd4ecdc2763a0d732587141ace489ed6856eb40","observation_id":"1b797f68-fc98-4ca9-9f56-2c065b47e271","resolution":{"observed_at":"2026-05-16T08:30:46.341300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ulip-2: Towards scalable multimodal pre-training for 3d under- standing","venue":null,"work_id":"8bd58f4b-9669-49a6-aa6b-d39c09081601","year":2024},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:9786f98a6924fe985bac207202fdc9d22685464108b5f3649caa5f30cd4433ed","observation_id":"d6223955-d4bb-40a1-a3bd-3df6b9f2d4af","resolution":{"observed_at":"2026-05-16T08:30:46.311923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mt5: A massively multilingual pre-trained text-to- text transformer","venue":null,"work_id":"1e83c95f-913d-45b5-b7dd-d345dc7d6a29","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:8ca0e0f679face5f46002b0b891d94f3beafe898b0b693b322dc2826e6f14e34","observation_id":"0412ddcd-303b-4be0-b8ad-99c62cd14fd1","resolution":{"observed_at":"2026-05-16T08:30:46.288796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":"2205.01917","doi":"10.48550/arxiv.2205.01917","metadata_source":"pith","pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","venue":"cs.CV","work_id":"5dd5bf10-d548-40ff-9b6c-6735129b27ee","year":2022},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:292d54e63ed6ba8ea1428db13a2256be815f21048478774180b4de489010c943","observation_id":"81c4f21a-03e5-4da7-ac7e-0cbcfa3a509a","resolution":{"observed_at":"2026-05-16T08:27:36.874628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point-bert: Pre-training 3d point cloud transformers with masked point modeling","venue":null,"work_id":"0ae5db1b-ae21-4b8d-bf8a-75e9027ce6f2","year":2022},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:0866143657a2ec55aabd719f10dd39cb2a1fd6a376c51ec8fbd4e89615e0a781","observation_id":"83e0764d-fcd2-4e59-8198-c9004deeb5c9","resolution":{"observed_at":"2026-05-16T08:30:46.286470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:7848af1dee3b2019a0e6128ef74d6640b20874e77025d22460af5768779d90d8","observation_id":"b6b04895-2c6a-4c50-93b5-db3ac162f866","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zakka, Y","venue":null,"work_id":"4a4e3dac-296c-475a-a567-55b3f781d388","year":2022},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:8b96472184d773b8cc969deea2c7c60cd378c3f0e1d2cbee2f209ef95d6232a3","observation_id":"1055e2f1-16d3-4d74-bf8f-f55a27ad9ae4","resolution":{"observed_at":"2026-05-16T08:30:46.262459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gnfactor: Multi-task real robot learning with generalizable neural feature fields","venue":null,"work_id":"b0cf21f0-a000-4d78-9c0a-3ba33e74e191","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:06545cd463ae2462f0f05d73860408575dcfdaf9d3dd6e9a593c647f6a32ad14","observation_id":"c265138a-7034-4176-ac32-fdab7a3660c2","resolution":{"observed_at":"2026-05-16T08:30:46.297944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","venue":null,"work_id":"5d08f420-2aaf-4aa9-9144-18b34db0a220","year":2024},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:6016d76fa74cf6ae31e0c73c79fc0bb7135f19d7a9f1994e5ef2625472a2bf85","observation_id":"de0ca59c-5209-4938-98fd-7dbb30b5ee02","resolution":{"observed_at":"2026-05-16T08:30:46.296116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre- training","venue":null,"work_id":"074563d8-d5c7-4b87-a34f-46417f8c7140","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:748a996fa261fe9f96ffe0d8e94d228bea38d14b37eceb4cf0a24e041c47cd5e","observation_id":"d075399b-e71e-48b7-8bb5-9d9814272f01","resolution":{"observed_at":"2026-05-16T08:30:46.283053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point- m2ae: multi-scale masked autoencoders for hierarchical point cloud pre-training.Advances in neural information processing systems, 35:27061–27074","venue":null,"work_id":"9289cbd0-63a2-486f-8ad2-7c2b89594dc1","year":2022},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:de2b6c084ca0293091addccc214ee58c015a34e2c1e1bc717c17fe91ac0f8541","observation_id":"aaaab6e4-4841-407a-a800-5e8b18750999","resolution":{"observed_at":"2026-05-16T08:30:46.309370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointclip: Point cloud understanding by clip","venue":null,"work_id":"cad32b61-cffe-4541-9ebb-2410ee638e03","year":2022},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:1f7c50a3cf403f60a7c96af00bd9d7e6fc1ca81a534239587bee301985b5bc01","observation_id":"e7b8d734-f51b-4dad-868b-37813d2d12c3","resolution":{"observed_at":"2026-05-16T08:30:46.348693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point transformer","venue":null,"work_id":"d42590e7-1672-49ca-b5b5-38261521defd","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:3e157c8eedcf02cb1f0c0d36787322bfd6d890ede70b1857696640e819083b48","observation_id":"37679273-1e9a-4aed-9842-c65850b31bec","resolution":{"observed_at":"2026-05-16T08:30:46.265785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn","venue":null,"work_id":"cc9b09de-f6c1-4263-93f0-fbf8811cd998","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:d923ac0b315e29b4bcaaf1ef75bde1d7f612c37bc25798965e58e8fbd715c71d","observation_id":"240dbbd1-21ee-443c-a10b-8f49fcc8796f","resolution":{"observed_at":"2026-05-16T08:30:46.337356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13126","last_updated":"2024-10-17T01:29:49Z","snapshot_observed_at":"2026-08-05T13:44:48.719708Z","submitted_at":"2024-10-17T01:29:49Z","title":"ALOHA Unleashed: A Simple Recipe for Robot Dexterity","version":1},"cited_work":{"arxiv_id":"2410.13126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13126","snapshot_observed_at":"2026-07-04T19:30:08.155799Z","title":"Aloha unleashed: A simple recipe for robot dexterity","venue":null,"work_id":"db13f99b-32b7-4745-adc2-d4cfb5799638","year":2024},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2410.13126","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:4092183d3febbc74d82b73ada9b282893b4877cda7dba28b41b99c5b38f0046c","observation_id":"1306913b-d59c-460d-98df-8b5cf4445037","resolution":{"observed_at":"2026-05-16T08:27:36.894779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-05T16:12:03.689396Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":"2310.06773","doi":"10.48550/arxiv.2310.06773","metadata_source":"pith","pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uni3d: Exploring unified 3d representation at scale","venue":"cs.CV","work_id":"90d21cdb-25b2-450c-8f61-7abddbbcf7e3","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:4930a4b08062b8ab10f11c18fb7659f1960372a00869a69c4561ba0f426e579f","observation_id":"2c0ae73b-0ed9-48cf-9a57-8d00a38fbc54","resolution":{"observed_at":"2026-05-16T08:27:36.901002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03942","last_updated":"2024-07-15T03:49:48Z","snapshot_observed_at":"2026-07-06T15:24:04.050068Z","submitted_at":"2023-05-06T05:55:27Z","title":"HACMan: Learning Hybrid Actor-Critic Maps for 6D Non-Prehensile Manipulation","version":5},"cited_work":{"arxiv_id":"2305.03942","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.03942","snapshot_observed_at":"2026-07-04T06:59:38.342960Z","title":"Hacman: Learning hybrid actor-critic maps for 6d non-prehensile manipulation","venue":null,"work_id":"0076f5e0-218c-42f9-8ef1-1679c7d2b639","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2305.03942","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:302e99b19be01dc0cc28bbea1b2d66ebdf80d029c5d50b808345a505656b0d84","observation_id":"2236030c-0b3a-4e13-a079-1b2f3693d493","resolution":{"observed_at":"2026-05-16T08:27:36.871516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointclip v2: Prompting clip and gpt for pow- erful 3d open-world learning","venue":null,"work_id":"3e79a39b-73c4-4a05-b965-b92fc70377a5","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:742a810f4c0fba8cd85f8bbe7693123461a5feae820ca92956dd05ecd14b95db","observation_id":"75a99ab3-edf2-4b00-a637-e63254ad936d","resolution":{"observed_at":"2026-05-16T08:30:46.326983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If the point cloud contains more than 0.3M points, we randomly subsample to 0.3M; otherwise, we pad with points at the origin (0,0,0) to reach 0.3M points","venue":null,"work_id":"43aef3d4-5617-4040-bd87-f32753a2d4a4","year":2048},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:9cb08ec3b036f57743be246cddabbda5ec3dc76ce0a1aff65b7c511bedc2583b","observation_id":"9e492f3f-2473-4608-bb71-4fef5b056a1d","resolution":{"observed_at":"2026-05-16T08:30:46.277798Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"40e92831-f913-4b99-9394-26533a665f9c","year":null},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:1909bd80b91608045f06a2cd6e655ac96abef934cf9dd0e7de4a806cfc631552","observation_id":"63f85e20-4e0d-4abf-8ee1-8b102953c8b9","resolution":{"observed_at":"2026-05-16T08:30:46.333204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":19,"verified_fuzzy":50},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 1 inbound Pith citation observation for arXiv:2602.00937."}