Pith. sign in

Paper Citation Record · LEDGER

Colosseum V2: Benchmarking Generalization for Vision Language Action Models

As of 12 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2605.27759.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.27759 v1

Coverage vector

measured 48 of 48 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-29T16:32:32.885345Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T06:10:33.754125Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

48 of 48 outbound references displayed

  • verified exact17
  • verified fuzzy0
  • unresolved29
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cbe8b940-f904-47cc-a9f7-093dc2d361d9 · outbound

This paper cites ChatGPT: Optimizing language models for dialogue,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models ChatGPT: Optimizing language models for dialogue,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:dcbb6669fbc5f07465133ef1220edc6d8750de2f7aeb91d06c1f499b954bd584

Observation 7ef84ecb-c270-465e-ad73-4d5150abf36e · outbound

This paper cites SAM 2: Segment Anything in Images and Videos.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models SAM 2: Segment Anything in Images and Videos

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-06-29T16:33:38.637300Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:6840fca75cee4a3ad2d0771c9e94a595cfebf9bf3301d30b25d0320ded248358

Observation 871f02dd-90ea-4e65-8f78-18aaf8dfe943 · outbound

This paper cites Rlbench: The robot learning benchmark and learning environment,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Rlbench: The robot learning benchmark and learning environment,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:256cbb395d8852933e734a8fa16178a35ef73e8c148cab80dad29457bded62c7

Observation 007ad77f-bb6e-4cb2-a361-d0c19f0da85f · outbound

This paper cites Pyrep: Bringing v- rep to deep robot learning,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Pyrep: Bringing v- rep to deep robot learning,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:358afb36586414e965836378dc8a1fda7ebcb1532e8fdf64728327f8bd70f7b0

Observation bee08941-b285-4b45-94ee-9ec22ae7e100 · outbound

This paper cites Coppeliasim robot simulator,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Coppeliasim robot simulator,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:f8eac9ca04964c0ce721566171e216442e3d900a2d5d36059bf20b53179b1828

Observation 96ded4e1-af25-442d-b617-452f495d1a1b · outbound

This paper cites The colosseum: A benchmark for evaluating generalization for robotic manipulation,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models The colosseum: A benchmark for evaluating generalization for robotic manipulation,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:c1ecf769eb3ab4f1a4e218072901ef08aff6a98526adf22ea51f4076efeafb41

Observation 305a473a-f0a0-469a-b9a9-ae0c7d4bcce6 · outbound

This paper cites Libero: Benchmarking knowledge transfer for lifelong robot learning,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Libero: Benchmarking knowledge transfer for lifelong robot learning,

Reference 7

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:dccfaae80dbd7cd8b1fb96cc35a1c4329f4b3d0feba8e2f727e38119d3c93941

Observation a7b5cba4-ef93-4676-bf50-d2d78382f044 · outbound

This paper cites Libero-para: A diagnostic benchmark and metrics for paraphrase robustness in vla models,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Libero-para: A diagnostic benchmark and metrics for paraphrase robustness in vla models,

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-06-29T16:33:38.646882Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:6622d0d1943cb587d8971d4dbb225b8afb8b4713471e99c3d2a5e6375e9c17ec

Observation 97244e5d-e855-4cd6-9e75-f0cfefbbe4e2 · outbound

This paper cites Roboverse: Towards a unified platform for robotic manipulation,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Roboverse: Towards a unified platform for robotic manipulation,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:677b6b64f59b95d9749fd5dfae6e8479657aba092f59a1671ed67bef6210f1a4

Observation fadeaf97-ce4f-4859-83fa-3559ad2d939d · outbound

This paper cites Roboarena: Distributed real-world evaluation of generalist robot policies,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Roboarena: Distributed real-world evaluation of generalist robot policies,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:1c5da111c1ffaa09a0343cc1d1b4ad08fe8efd848f0eb9d8383be217833a8887

Observation a810712b-3d35-4a88-9818-311295004413 · outbound

This paper cites Robotwin: A platform for scalable robot learning,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Robotwin: A platform for scalable robot learning,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:8a3017a8c871fff165600b66fb276782a787ca6ab82ce17a4ce19f425b407336

Observation 9c008b7f-7035-4f78-8166-1ca8716c9fb4 · outbound

This paper cites Bimanual manipulation benchmark,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Bimanual manipulation benchmark,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:74f000cb68514985e79fbdb82dad6fc18800e81cca19fc92f19b47ef32d2031b

Observation f2fae33f-3283-4603-937b-b5b101451653 · outbound

This paper cites Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:01f030fd7d7410a4f31a6c7f0a0fc1774dff8332565d2219786c44cd6df51dc1

Observation ed0293e3-433d-4eaf-91e9-64e563944e18 · outbound

This paper cites VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-06-29T16:33:38.665724Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:48817434b4de07db4da1c1a1a7fdd7fb134b3afca7e96a93658ef9b8afe13d6f

Observation 9018405c-5ecd-4b40-a2ca-d5eb26d4301e · outbound

This paper cites VLMbench: A Compositional Benchmark for Vision-and-Language Manipulation.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models VLMbench: A Compositional Benchmark for Vision-and-Language Manipulation

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-06-29T16:33:38.671017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:ac29aef1991856f921c1bb4b5817d4cc4178f2f77a45cc77bd35c437178dd4e3

Observation dc307761-1811-4e52-954e-bd759c6ee3f8 · outbound

This paper cites ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-06-29T16:33:38.663024Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:5b49caf8440de1b395ad945ec7d5da5f3fb8a98aeb0b4dd6cb588ffba47c5c60

Observation b6cf6b50-5057-467f-a215-4c54461ed9ed · outbound

This paper cites R3m: A universal visual representation for robot manipulation,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models R3m: A universal visual representation for robot manipulation,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:65b378234272c3a5a545dcf25b642c8346f38954c8f5662b47ae60c291522a77

Observation 24c839a1-4e12-4702-b24e-314a64b00d40 · outbound

This paper cites Mvp: Multi-view pretraining for vision-language robotics,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Mvp: Multi-view pretraining for vision-language robotics,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:4c8f34003f090bd6dd565227eb86c3b51ac209afa1c1d910507d40361233c5f6

Observation 5d886665-2f5b-4bcd-af67-2ca6bfc621d6 · outbound

This paper cites VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-06-29T16:33:38.671502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:a75f74128c94169295a035f8f635e9a1fd3c7bbe3cb2fea07014fe6915262c56

Observation ddeea52c-adce-41ad-bd81-3064d602b1b4 · outbound

This paper cites Cliport: What and where pathways for robotic manipulation,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Cliport: What and where pathways for robotic manipulation,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:82e0f93a9fb63f416c6feaa0070991d7544d2fd53f05dc8144ff32177ff2a0fe

Observation 7edb617b-9c80-4cb8-b47a-e3e9de1a8977 · outbound

This paper cites V oxposer: Composable 3d value maps for robotic manipulation with language models,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models V oxposer: Composable 3d value maps for robotic manipulation with language models,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:61cdb632c769699e246e31aef6f08fabb58f6483afb247d4212fdf109e3d3efb

Observation 4d008cbd-7351-4fe6-949d-36c226da8d61 · outbound

This paper cites C2farm: Coarse-to-fine imitation learning for manipu- lation,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models C2farm: Coarse-to-fine imitation learning for manipu- lation,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:cb2f8e84dcdcfb70356a5a32e9830991cd3cb0f7e50a0d4e8d0e8dca37657266

Observation 46af9365-c207-41fe-bcba-f9fa6c0ca0d7 · outbound

This paper cites Kite: Keyframe imitation for task execution,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Kite: Keyframe imitation for task execution,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:7a80a7406995911418a2c5abdd3c9fde32cefbebd2c0dd2d3443a81c0955ffa7

Observation fc441fa5-ed95-4bb0-b60c-8f8a177c9bc2 · outbound

This paper cites Learning fine-grained bimanual manipulation with act,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Learning fine-grained bimanual manipulation with act,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:350cd80eec6deb67da38bdb400e1a8a56bb6473c824e39102787125cfddb3cd3

Observation e2519e6b-d901-4b7b-971c-c5c0b1c9c898 · outbound

This paper cites Peract: Perceiver-actor for 6-dof manipulation,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Peract: Perceiver-actor for 6-dof manipulation,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:6897cc3825d9029ea19ad51559ba0f2250d5324784bde64afee5f106a93de3f7

Observation 7214ea25-e6eb-44db-899d-0178760cdb31 · outbound

This paper cites Rvt: Robotic vision transformer for manipulation,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Rvt: Robotic vision transformer for manipulation,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:a1bc7280ab7ec369b79fa6fb0516e3b384460119767119859a66554cbcc4f0e6

Observation ed9aae14-7382-4577-b9f5-01be80caea64 · outbound

This paper cites Rvt-2: Scaling vision transformers for robot manipulation,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Rvt-2: Scaling vision transformers for robot manipulation,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:bb9e02fe409e11f3a62627c0fdaa504ec9bf964588b0e55b41bb0f6a30b74a8e

Observation 16acdf44-8564-4078-80e8-7a29ff69cfc8 · outbound

This paper cites Act3d: 3d feature fields for manipulation policies,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Act3d: 3d feature fields for manipulation policies,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:5be7d5c56a35e31a895aba35d5f1df98bdf4b13debd2b58dc8265955ee14740e

Observation 9e66fd3f-cc8a-41ff-a4a6-07fc83cb5798 · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models PaLM-E: An Embodied Multimodal Language Model

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-06-29T16:33:38.666511Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:ad25e5583415a4c9becc8d3b9a276783ccad43b5d7eed9961a8d6c434539e3f0

Observation eda6ce01-dac8-4d17-8859-a9f0d804c420 · outbound

This paper cites RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-06-29T16:33:38.643866Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:2cec02d5d438afec23cb66d7ac73bfdf6958b04a8d1dacd0a2218a1b06372262

Observation 04dd3932-b846-4a2e-8a09-cbe562287af1 · outbound

This paper cites OpenVLA: An Open-Source Vision-Language-Action Model.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models OpenVLA: An Open-Source Vision-Language-Action Model

Reference 31

Resolution
verified exact
local_arxiv, observed 2026-06-29T16:33:38.640816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:12d978388a7a7aacac89c9dbe4b7be8408b5b2f4e95bf441165564564970fc2b

Observation 6939e931-bf43-420f-9f91-22b8b7d5a64f · outbound

This paper cites Provable Preconditioned Plug-and-Play Approach for Compressed Sensing MRI Reconstruction.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Provable Preconditioned Plug-and-Play Approach for Compressed Sensing MRI Reconstruction

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-06-29T16:33:38.660427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:219806073acf92557738314c5aad46b6ae9e5bab9bf4651a4bf32b6bd3f1621e

Observation b9efcf2f-556f-4d20-afa6-7d120d273d23 · outbound

This paper cites AgentNet: A scalable framework for multi-step agent trajectory generation.arXiv preprint arXiv:2501.00000.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models AgentNet: A scalable framework for multi-step agent trajectory generation.arXiv preprint arXiv:2501.00000

Reference 33

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T16:33:38.649454Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:46bd0b1d4eda9220f0841e0182b77f7fa90dedda90ad80f168dbfdbc2d160983

Observation 8935a05d-cb8a-408a-ab8c-58eae96e8d62 · outbound

This paper cites π0.5: Vision-language-action models for open-world robotics,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models π0.5: Vision-language-action models for open-world robotics,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:0c47de64589d0b088e0dc5a834275ac98da2addb1bee6a9973efd40fcd50e09f

Observation db2112e6-6e00-4320-881c-d048ee87d685 · outbound

This paper cites Open x-embodiment: Robotic learning datasets and rt-x models,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Open x-embodiment: Robotic learning datasets and rt-x models,

Reference 35

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:e4a419e4b5ea619343363c9d2df9572acd1666824426d6c8c84694f5f64da025

Observation edd948c0-0bc0-432a-8d09-e6cd64e37bf6 · outbound

This paper cites Lerobot: State-of-the-art machine learning for real-world robotics in pytorch,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Lerobot: State-of-the-art machine learning for real-world robotics in pytorch,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:42fbc6556abbf458b9bbcb75283e225773d02a03807f0e48fce88ca13a865de7

Observation 52a26050-24c8-49f5-9ef1-9193e4f087f0 · outbound

This paper cites Maniskill3: Gpu parallelized robotics simulation and rendering for generalizable embodied ai,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Maniskill3: Gpu parallelized robotics simulation and rendering for generalizable embodied ai,

Reference 37

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:c51a4cde7152acfd845263f82ecd892dbe472abcd87c146d267286e2f67f2d59

Observation b4c5cdd1-3ccc-4880-ae85-c69912764229 · outbound

This paper cites Learning Transferable Visual Models From Natural Language Supervision.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Learning Transferable Visual Models From Natural Language Supervision

Reference 38

Resolution
verified exact
local_arxiv, observed 2026-06-29T16:33:38.673807Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:9dcb613741b8fb8997a086dc0559b17f3aa7386f87fb0d430c8e0018e62619cc

Observation 05b17789-7c24-4604-abf9-714219389994 · outbound

This paper cites Sigmoid Loss for Language Image Pre-Training.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Sigmoid Loss for Language Image Pre-Training

Reference 39

Resolution
verified exact
local_arxiv, observed 2026-06-29T16:33:38.676519Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:6051702700c36f93cdb8a19e4e15b8b3e28bd35a2ba2483a13e93a030a254589

Observation e9b8fb3b-eeaf-4144-861f-f26d0d872b66 · outbound

This paper cites Deep residual learning for image recognition,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Deep residual learning for image recognition,

Reference 40

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:04734711065865842be648d8eb98ab771c85d1fda24452fe025aa9d6600f8dd1

Observation a9cb44e3-7f76-4668-8ac2-4b1608b3ed26 · outbound

This paper cites MolmoAct: Action Reasoning Models that can Reason in Space.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models MolmoAct: Action Reasoning Models that can Reason in Space

Reference 41

Resolution
verified exact
local_arxiv, observed 2026-06-29T16:33:38.663952Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:9100b59b089005ae589ff8366fa1eb3490f784161c32cd3a1147a19b4fb9360f

Observation 835a08be-64b7-4fc1-9347-eb9d519d2e45 · outbound

This paper cites VIMA: General Robot Manipulation with Multimodal Prompts.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models VIMA: General Robot Manipulation with Multimodal Prompts

Reference 42

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T16:33:38.668159Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:db0d2b9f3dfed60002e7d0f2fbab3898353865a5e91d007b88c916d3bbcf1184

Observation a5df6c8f-ac0b-452e-a79c-4c60d8b2a9cc · outbound

This paper cites Learning an actionable discrete diffusion policy via large-scale actionless video pre- training,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Learning an actionable discrete diffusion policy via large-scale actionless video pre- training,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:cb9f879c8dbe7b8f4ed84e917c8c82737078ccde7b7cdb2fff6ba74c0bb758d2

Observation a001da23-370f-4b61-b88d-9d130fae1590 · outbound

This paper cites Unified Video Action Model.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Unified Video Action Model

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-06-29T16:33:38.669066Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:7aa9904847c1826604595ca622cb2e528b86c21e7f2d9ade5bc399996f096b2f

Observation 71a90fad-2969-478f-b485-6e1d027a3a2d · outbound

This paper cites Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets,.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets,

Reference 46

Resolution
unresolved
no resolver link, observed 2026-06-29T16:32:32.885345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:4b3ec220068696c8ff62dfb2626ad682273f880ecb1e5112b6ca0a1038eedf46

Observation 7fd864f6-be9f-47d9-8fe7-65fd4d9e7605 · outbound

This paper cites Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-06-29T16:33:38.661283Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:ebdddf8918fa6e0fcc0f6d3191842bd9a4a264f7702719085f74bce202334957

Observation ba119abb-c646-4ed6-90bf-fe89c6db2a7f · outbound

This paper cites Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-06-29T16:33:38.657675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:142e06dfbe0886d6b3b115e9820ac632c502e357439176fc4860ffcba8012068

Observation 51944ed5-f013-4f5a-a327-7100e862b164 · outbound

This paper cites Contrast Sets for Evaluating Language-Guided Robot Policies.

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Contrast Sets for Evaluating Language-Guided Robot Policies

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-06-29T16:33:38.635208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T16:32:32.885345Z digest=sha256:2a5ab8d310ac006d1513bc0aaee6eb1e942dd86e96edbbbec39b447471db9623

Pith citing papers

Observation 9fc87436-d7ab-4b77-bd4e-777affaf6790 · inbound

See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models cites this paper.

See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models Colosseum V2: Benchmarking Generalization for Vision Language Action Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-14T05:11:57.092685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T05:11:57.092685Z digest=sha256:4a349de6ac767f8ac87def02375b855797e112e6cf9412a7b02ffc37f8ee8042

Observation 926ecd5d-215c-4b2e-bbaf-d13d5fa8c494 · inbound

Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models cites this paper.

Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models Colosseum V2: Benchmarking Generalization for Vision Language Action Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T06:10:33.754125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T06:10:33.754125Z digest=sha256:e7c42da39451f5f106e504a59eeeb564fd8c0f70cefd602453c74f300bb8bc04