{"as_of":"2026-08-07T08:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87a9fd85ee6cbaabb7b8398a0a8d807afd5f00a7de8ca6af9c0c1e11b89e0801","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:55:09.062349Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:48:33.666343Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T20:16:29.394437Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"cited_work":{"arxiv_id":"2510.01711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01711","snapshot_observed_at":"2026-07-09T20:16:29.394437Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","venue":"cs.RO","work_id":"8ab18945-a30f-40f1-8802-799bfa80248a","year":2025},"citing_paper":{"arxiv_id":"2605.24642","last_updated":"2026-05-23T16:18:41Z","snapshot_observed_at":"2026-07-30T07:41:42.487489Z","submitted_at":"2026-05-23T16:18:41Z","title":"Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T13:40:59.330788Z"},"links":{"cited_paper":"/paper/2510.01711","citing_paper":"/paper/2605.24642"},"observation_digest":"sha256:bd28c40b63182eb100df8412b67d9ba7e7e126aa258031f9bbecf61007f0a5de","observation_id":"f656816d-568a-4ff6-9255-f2bae2644b94","resolution":{"observed_at":"2026-06-30T13:44:40.679199Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"cited_work":{"arxiv_id":"2510.01711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01711","snapshot_observed_at":"2026-07-09T20:16:29.394437Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","venue":"cs.RO","work_id":"8ab18945-a30f-40f1-8802-799bfa80248a","year":2025},"citing_paper":{"arxiv_id":"2605.24890","last_updated":"2026-06-08T07:28:33Z","snapshot_observed_at":"2026-08-04T02:11:27.874111Z","submitted_at":"2026-05-24T06:28:53Z","title":"QuoVLA: Quotient Space for Vision-Language-Action Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T12:09:12.124995Z"},"links":{"cited_paper":"/paper/2510.01711","citing_paper":"/paper/2605.24890"},"observation_digest":"sha256:b02b3aa6479a89ab27ab33aff9e81431978294c50b6ad1d6b1fc884429676be7","observation_id":"284162fa-9d21-4585-b7a7-56e799c22527","resolution":{"observed_at":"2026-06-30T12:34:39.477553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"cited_work":{"arxiv_id":"2510.01711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01711","snapshot_observed_at":"2026-07-09T20:16:29.394437Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","venue":"cs.RO","work_id":"8ab18945-a30f-40f1-8802-799bfa80248a","year":2025},"citing_paper":{"arxiv_id":"2605.29577","last_updated":"2026-05-28T08:22:49Z","snapshot_observed_at":"2026-08-03T20:05:45.014502Z","submitted_at":"2026-05-28T08:22:49Z","title":"Mitigating State Aliasing in Vision-Language-Action Models via Inverse Dynamics Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T08:28:37.970450Z"},"links":{"cited_paper":"/paper/2510.01711","citing_paper":"/paper/2605.29577"},"observation_digest":"sha256:247d054cdc7e9adbc24c2584b7f95f314cc191412f29e98d794f35de18a98b32","observation_id":"9e6b5330-20e8-4f91-ad74-8b56879c6d8c","resolution":{"observed_at":"2026-06-29T08:33:15.410905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"cited_work":{"arxiv_id":"2510.01711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01711","snapshot_observed_at":"2026-07-09T20:16:29.394437Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","venue":"cs.RO","work_id":"8ab18945-a30f-40f1-8802-799bfa80248a","year":2025},"citing_paper":{"arxiv_id":"2606.08653","last_updated":"2026-06-07T14:41:22Z","snapshot_observed_at":"2026-08-04T00:03:13.925320Z","submitted_at":"2026-06-07T14:41:22Z","title":"FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T18:41:51.839543Z"},"links":{"cited_paper":"/paper/2510.01711","citing_paper":"/paper/2606.08653"},"observation_digest":"sha256:20a0ed79213a40602cf4d5291367529810d2d94de34ff4a6b358540c875137c3","observation_id":"49449ac5-7ac0-458d-9085-1d1aff007f73","resolution":{"observed_at":"2026-07-02T22:37:26.694558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"cited_work":{"arxiv_id":"2510.01711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01711","snapshot_observed_at":"2026-07-09T20:16:29.394437Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","venue":"cs.RO","work_id":"8ab18945-a30f-40f1-8802-799bfa80248a","year":2025},"citing_paper":{"arxiv_id":"2606.17256","last_updated":"2026-06-15T20:00:20Z","snapshot_observed_at":"2026-08-01T18:51:15.199353Z","submitted_at":"2026-06-15T20:00:20Z","title":"Contrastive Action-Image Pre-training for Visuomotor Control","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T03:16:33.702802Z"},"links":{"cited_paper":"/paper/2510.01711","citing_paper":"/paper/2606.17256"},"observation_digest":"sha256:e00f112eb31169fb73e94aa5b0b835416dc6db00efbbf68bf72b16db860f3903","observation_id":"24f9ca34-e0ed-414f-9595-1f9cc1826962","resolution":{"observed_at":"2026-07-03T18:08:46.886682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"cited_work":{"arxiv_id":"2510.01711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01711","snapshot_observed_at":"2026-07-09T20:16:29.394437Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","venue":"cs.RO","work_id":"8ab18945-a30f-40f1-8802-799bfa80248a","year":2025},"citing_paper":{"arxiv_id":"2607.07101","last_updated":"2026-07-08T07:37:27Z","snapshot_observed_at":"2026-08-03T16:50:48.978034Z","submitted_at":"2026-07-08T07:37:27Z","title":"GeoProp: Grounding Robot State in Vision for Generalist Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T20:12:59.778086Z"},"links":{"cited_paper":"/paper/2510.01711","citing_paper":"/paper/2607.07101"},"observation_digest":"sha256:4abc604c3a99d6d9733c7e1b6ab12d0864f0f7e38a3972c92d49973a9b7b4e6d","observation_id":"891ec8fd-1fe0-4561-b352-77ea4a9bb78a","resolution":{"observed_at":"2026-07-09T20:16:29.395716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.01711","snapshot_observed_at":"2026-08-02T04:48:33.666343Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13597","last_updated":"2026-07-18T04:17:04Z","snapshot_observed_at":"2026-08-06T11:55:58.549467Z","submitted_at":"2026-07-15T08:45:15Z","title":"Semantic Anchoring for Robotic Action Representations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T04:48:33.666343Z"},"links":{"cited_paper":"/paper/2510.01711","citing_paper":"/paper/2607.13597"},"observation_digest":"sha256:b15fcb2f4c0c335b4713edb276d2e0ec35fdad05d19a1d969364913c25ec4f32","observation_id":"8aca349e-d11e-48ff-a233-a54667a6fffb","resolution":{"observed_at":"2026-08-02T04:48:33.666343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.01711/citation-record","integrity":"/paper/2510.01711/integrity","json":"/paper/2510.01711/citation-record.json","paper":"/paper/2510.01711"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-04T12:55:07.188067Z","title":"Cosmos-Reason1: From physical common sense to embodied reasoning.arXiv preprint arXiv:2503.15558,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.188067Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:ba045011d7308aa914bafb4b913ad9fec91a959b1f734ce048ee85c429607a2c","observation_id":"5bce5ec1-0743-4d7c-8548-6566d4ba1f11","resolution":{"observed_at":"2026-08-04T12:55:07.188067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-04T12:55:07.363486Z","title":"GR00T-N1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.363486Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:b42dc22277911599764fda23c389040e4aabc414a81d3587b38cdcdfab797c74","observation_id":"b7286cbf-518e-4ace-96dd-24a59d2fd82b","resolution":{"observed_at":"2026-08-04T12:55:07.363486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:07.447591Z","title":"π0.5: A vision-language-action model with open-world generalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.447591Z"},"links":{"citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:e51e7c7ec5db7d520342e4baa5ff5465f494fc8826328b01fcb387a715e08ab3","observation_id":"c6bea193-1965-4835-8961-8034b8ffadd5","resolution":{"observed_at":"2026-08-04T12:55:07.447591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-04T12:55:07.702040Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success.arXiv preprint arXiv:2502.19645,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.702040Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:456c8a95c010fda353cbc2b0b64a458715438ebaa87e9499430a343c8394456a","observation_id":"a6aa2bef-5345-46b2-bf97-04435c4764aa","resolution":{"observed_at":"2026-08-04T12:55:07.702040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-04T12:55:07.770243Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.770243Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:7b34b418e6357dc82ca349d6dac990e6d3f9aecef424e4e67e9d3e08fe91ad6a","observation_id":"e592b8ee-39dd-44e2-8d92-2ef177885807","resolution":{"observed_at":"2026-08-04T12:55:07.770243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14577","last_updated":"2022-09-29T06:37:26Z","snapshot_observed_at":"2026-08-02T10:38:01.750409Z","submitted_at":"2022-09-29T06:37:26Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14577","snapshot_observed_at":"2026-08-04T12:55:07.859469Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.859469Z"},"links":{"cited_paper":"/paper/2209.14577","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:784fa2a85ad8b3e041087a858b7adac2ccd8509ce3b67ae1da5acbd01d57d175","observation_id":"c93a65da-8c90-463e-ae33-75d26468fd64","resolution":{"observed_at":"2026-08-04T12:55:07.859469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-04T12:55:07.985254Z","title":"Representation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.985254Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:5e1cff02ea18ebe7698afa70450adfb7b92c4eeb9073a061b11ebf6e31198731","observation_id":"37d05fd4-08c9-4391-b1e0-188528c9210e","resolution":{"observed_at":"2026-08-04T12:55:07.985254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T12:55:08.056099Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.056099Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:ed7a19c34c8fe3b460cfcc0a72d3d9c9d5614166639566a9eee3e548bc1cc387","observation_id":"ebc4c4b4-72dd-4335-bef4-e9d2bf973cff","resolution":{"observed_at":"2026-08-04T12:55:08.056099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-06T20:38:11.691093Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-04T12:55:08.254972Z","title":"Robobrain 2.0 technical report.arXiv preprint arXiv:2507.02029,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.254972Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:a8792c46b9156c2297e4959ef4f53b0a7dc08f9f80fdfe544891bb30cc672a76","observation_id":"721b8a4e-f81f-432b-8093-86e6492b33a4","resolution":{"observed_at":"2026-08-04T12:55:08.254972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-04T12:55:08.295168Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.295168Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:2dea8cd169898f152d7ac468f6ab0f714b8b42bf41cc80b5d47ef1e405eddb9f","observation_id":"66231df5-5a33-4d02-bc12-78ed3707f785","resolution":{"observed_at":"2026-08-04T12:55:08.295168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:08.305121Z","title":"Instructvla: Vision-language-action instruction tuning from understanding to manipulation.arXiv preprint arXiv:2507.17520,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.305121Z"},"links":{"citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:5a9b1b73830f8520d6456f4d99bf90de93873399d0fdbc890dc3b03ef492b1b8","observation_id":"1f739e7e-dcb6-4c8a-88cf-b8d7f6607c8d","resolution":{"observed_at":"2026-08-04T12:55:08.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14420","last_updated":"2025-02-21T07:28:36Z","snapshot_observed_at":"2026-07-06T20:39:43.403470Z","submitted_at":"2025-02-20T10:16:18Z","title":"ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14420","snapshot_observed_at":"2026-08-04T12:55:08.357317Z","title":"Chatvla: Unified multimodal understanding and robot control with vision-language-action model.arXiv preprint arXiv:2502.14420,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.357317Z"},"links":{"cited_paper":"/paper/2502.14420","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:38c8b84229391d7b7d6b1e90b6928ac7b8d82fd00fbc92c5f15bde7714730e86","observation_id":"81a5e571-eef7-4a7d-8bfe-cc1b12e59f34","resolution":{"observed_at":"2026-08-04T12:55:08.357317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:08.409915Z","title":"Under review","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.409915Z"},"links":{"citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:7cdc094fb20216a3cae2c39039f81f4fd77bc27426a50538ad8a4b65513f20cb","observation_id":"141c18cf-8d78-4b88-9872-44c05f7541eb","resolution":{"observed_at":"2026-08-04T12:55:08.409915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:08.523523Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.523523Z"},"links":{"citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:c33cdb5115c5088e891b5867099990c02e2a138fded30f42b9df2cb51b118340","observation_id":"a2303cfd-1190-4784-bf84-05fd52a4410f","resolution":{"observed_at":"2026-08-04T12:55:08.523523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:08.565336Z","title":"We omit the use of future tokens (Zheng et al., 2025), as they are beyond the scope of this work","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.565336Z"},"links":{"citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:c4454b2048679214c4b5bc43d03abf64535fd6dce9bd45bf2c98daa3caa1ad09","observation_id":"a8de92d7-c11c-49e5-9e85-06084d552415","resolution":{"observed_at":"2026-08-04T12:55:08.565336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:08.790131Z","title":"We randomly sample 10 trajectories per task in RoboCasa-Kitchen, totaling 240 trajectories","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.790131Z"},"links":{"citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:452615605130caa3a62ebbf8ca9b5e73965267312fa47eaf11f8b2b4edc3a5e0","observation_id":"4d0239ec-050a-4031-b824-e62640eeb580","resolution":{"observed_at":"2026-08-04T12:55:08.790131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:08.964633Z","title":"This result indicates the effectiveness of our proposed training framework, together with the augmen- tation strategyview cutoff","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.964633Z"},"links":{"citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:377c1abcdee3a5362f7f2e07e7abfbbdfe235c8df75dd0a10378f86c967d79ff","observation_id":"0b036cb1-3a6b-42d5-be7d-10a50ea3bbea","resolution":{"observed_at":"2026-08-04T12:55:08.964633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:09.062349Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:09.062349Z"},"links":{"citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:fea5fa82afc6923a22723371440b90e517c89d504711dcb1ec91261159db3ad5","observation_id":"c3485f25-d6a6-4468-9a50-ec903283213a","resolution":{"observed_at":"2026-08-04T12:55:09.062349Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:08.622522Z","title":"At inference, we use an action horizonH= 16and execute all actions without re-planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.622522Z"},"links":{"citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:7e958024af370e3bd9bba79993270a16a6a485e43159e8bd6728666950227f00","observation_id":"ffc5700d-2524-4e39-9e9d-3313b1a8dde0","resolution":{"observed_at":"2026-08-04T12:55:08.622522Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13818","last_updated":"2020-10-23T03:19:58Z","snapshot_observed_at":"2026-07-06T09:59:41.727913Z","submitted_at":"2020-09-29T07:08:35Z","title":"A Simple but Tough-to-Beat Data Augmentation Approach for Natural Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13818","snapshot_observed_at":"2026-08-04T12:55:08.140544Z","title":"A simple but tough- to-beat data augmentation approach for natural language understanding and generation.arXiv preprint arXiv:2009.13818,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.140544Z"},"links":{"cited_paper":"/paper/2009.13818","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:f1f017a3e646d927ccd6f49188e0818ddc4c002c99ac9f9f3447cce4661fc197","observation_id":"aacef3bc-9217-40d9-8880-a3d3eea812f0","resolution":{"observed_at":"2026-08-04T12:55:08.140544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-04T12:55:08.214906Z","title":"Smolvla: A vision- language-action model for affordable and efficient robotics.arXiv preprint arXiv:2506.01844,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.214906Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:a70e19381e32570dd0deebb22894952933e75548fc42f91b85378b12f36b34d6","observation_id":"b7ed0226-df83-4acc-85f7-de7d50c3feaf","resolution":{"observed_at":"2026-08-04T12:55:08.214906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10782","last_updated":"2023-04-21T07:19:33Z","snapshot_observed_at":"2026-08-06T20:54:24.180728Z","submitted_at":"2023-04-21T07:19:33Z","title":"Contrastive Language, Action, and State Pre-training for Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10782","snapshot_observed_at":"2026-08-04T12:55:08.104076Z","title":"Contrastive language, action, and state pre-training for robot learning.arXiv preprint arXiv:2304.10782,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.104076Z"},"links":{"cited_paper":"/paper/2304.10782","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:0effda98646dad9630913d5e17260886b8241f3b580dad68b800f377f6351681","observation_id":"bf66936f-26c3-413e-b8b7-75197fa61bb3","resolution":{"observed_at":"2026-08-04T12:55:08.104076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-07-06T21:34:00.849404Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-04T12:55:07.932813Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces.arXiv preprint arXiv:2506.00123,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.932813Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:769f7dd8564aebc829992f85f2b93e8d85a8ac37be2e23b074a652a6d56c0267","observation_id":"8684ed19-c732-44f0-b64a-6561ec1fe91b","resolution":{"observed_at":"2026-08-04T12:55:07.932813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23705","last_updated":"2025-05-29T17:40:09Z","snapshot_observed_at":"2026-08-04T23:25:15.750324Z","submitted_at":"2025-05-29T17:40:09Z","title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23705","snapshot_observed_at":"2026-08-04T12:55:07.537700Z","title":"Knowledge insulating vision-language- action models: Train fast, run fast, generalize better.arXiv preprint arXiv:2505.23705,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.537700Z"},"links":{"cited_paper":"/paper/2505.23705","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:86fcdab66456374f257735038ab7aa946d767035cd47d83971d117f3a4613de6","observation_id":"0b27409a-ab77-4523-ae8d-7674f4300620","resolution":{"observed_at":"2026-08-04T12:55:07.537700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-04T12:55:07.638645Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.638645Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:61c470af9c010e2ffec550754980cbcf047c4f530173b5888cc160ce0cec6f99","observation_id":"4efb3bb9-9d4e-4e97-bfc3-f181a9694406","resolution":{"observed_at":"2026-08-04T12:55:07.638645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T12:55:07.264544Z","title":"Qwen2.5-VL technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.264544Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:ddf497333bd2e286995ab7cb1c832a58d5c494e27fcf9164447e287fb064eb4c","observation_id":"83b67c86-3d92-4be5-8a20-d3e8ea4aec3c","resolution":{"observed_at":"2026-08-04T12:55:07.264544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:08.488375Z","title":"Layer Spatial Object Goal Long Avg","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":2048,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.488375Z"},"links":{"citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:9a6b48a5b2cceae59b2e62200d6c5a39aade55532e218c6bc2c0a19359bcf957","observation_id":"f32c699b-454d-47a1-bcb8-988ae78d1607","resolution":{"observed_at":"2026-08-04T12:55:08.488375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","latest_version":4,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 7 inbound Pith citation observations for arXiv:2510.01711."}