Pith. sign in

Paper Citation Record · LEDGER

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence

As of 13 August 2026, this Paper Citation Record lists 100 of 152 outbound references and 0 inbound Pith citation observations for arXiv:2608.06756.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.06756 v1

Coverage vector

measured 100 of 152 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T21:18:34.990563Z

measured 100 of 100 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

100 of 152 outbound references displayed

  • verified exact6
  • verified fuzzy0
  • unresolved94
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 86fa4e9e-bea2-4d0e-bafb-9151c55c7ede · outbound

This paper cites Learning transferable visual models from natural language supervision.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Learning transferable visual models from natural language supervision

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.427180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.427180Z digest=sha256:bdc883fd501c9e02b785dd2a05f577a6b2e2b10a2b05aa78c512000a6043cf64

Observation 1b686d8d-8975-4482-80e0-a87d317f2e8d · outbound

This paper cites Flamingo: a visual language model for few-shot learning.Advances in Neural Information Processing Systems (NeurIPS), 2022.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Flamingo: a visual language model for few-shot learning.Advances in Neural Information Processing Systems (NeurIPS), 2022

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.508527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.508527Z digest=sha256:6dbfe8641218eea6868f4065f94045db39abe1f8b90090d6c03cb051414d4d3d

Observation 9558b71e-665b-4a39-81e4-c7be360f62ec · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.550014Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.550014Z digest=sha256:fe6799f49d9e473fac182d9952c7f38b1c39a0c8650fde1806f776cb6ffb795c

Observation dd610574-b780-475c-8b93-737ddcbab4ae · outbound

This paper cites Instructblip: Towards general-purpose vision-language models with instruction tuning.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Instructblip: Towards general-purpose vision-language models with instruction tuning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.555035Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.555035Z digest=sha256:02039c6e6eb33c65a5e762972ec1cc2e229012ae20a399bed145316f806fcfc0

Observation a1ce5d4f-fff2-4c7f-9659-dbf2835af667 · outbound

This paper cites Visual instruction tuning.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Visual instruction tuning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.560003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.560003Z digest=sha256:334f5ffc90fc84f356cd0b2c45fcb5dec2677bfd4d7052991b761fcb83d6f21b

Observation 8c9e1efe-c2f4-413e-8834-fd4ec95c0b55 · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.564957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.564957Z digest=sha256:c331932e585cff8457e551d9f5970a46518e68df034d5a402fa18c2301ed4bdc

Observation 03b4107f-aab0-430a-a07c-e806c9b72ab6 · outbound

This paper cites Qwen2.5-VL Technical Report.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Qwen2.5-VL Technical Report

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.571389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.571389Z digest=sha256:5df9ed29a08c70043ea00f9ee32027dd8655517b6aa8b5ef1fa865e1b3739226

Observation ef7ecffc-478c-4a73-9003-862bf182fa39 · outbound

This paper cites Do As I Can, Not As I Say: Grounding Language in Robotic Affordances.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Do As I Can, Not As I Say: Grounding Language in Robotic Affordances

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.575729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.575729Z digest=sha256:3dc6b0ad2f0070f5fca12e721790a3ee610c260fdf31057d1a2c76d4e51a0371

Observation 6128c3a3-393b-43dd-afa6-abb521a80b06 · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence PaLM-E: An Embodied Multimodal Language Model

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.628607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.628607Z digest=sha256:eb4dd0e8bc138e9393697b95582ebcfa65ae434eb5a067a5d45c86e516679a5e

Observation 0aefddd6-7be9-4181-b512-9e4dea5b8264 · outbound

This paper cites Code as Policies: Language Model Programs for Embodied Control.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Code as Policies: Language Model Programs for Embodied Control

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.705999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.705999Z digest=sha256:415629c893ff957acaf0f836d73efffd699ee68b130c9e1fdcd88951d180d524

Observation cc13936a-121e-42ec-afe3-48b8ee51cafa · outbound

This paper cites VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.752781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.752781Z digest=sha256:6be1a2bd3ff47d7b51d5d4ef59a126392c5c9fa9b8fc5200bcfd9a78f5ed2e23

Observation 13aa88af-1dcc-432a-9a86-1f8f00e72e8d · outbound

This paper cites Gemini Robotics: Bringing AI into the Physical World.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Gemini Robotics: Bringing AI into the Physical World

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.841005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.841005Z digest=sha256:6611c4e1d6e758b3484d341f2f31bc40c6e714763bc9b798130824b35de0f63b

Observation 6bb8a24e-72ac-4260-b6c5-6e26a666a9a2 · outbound

This paper cites RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.953272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.953272Z digest=sha256:df1717aa98f0a960af7f31b877be3dfaac31cb0e639c20dcbda0b05451aaf533

Observation 5666ebd1-4296-40d0-b628-97027be56e0f · outbound

This paper cites RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.957799Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.957799Z digest=sha256:1ef63da71cbbf8807d8b643035796901affb01ce212c0096d9ee6ffcce77a6d7

Observation d8e06185-f056-48cb-acf6-b044c6e7f7cd · outbound

This paper cites Robobrain 2.5: Depth in sight, time in mind.arXiv preprint arXiv:2601.14352, 2026.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Robobrain 2.5: Depth in sight, time in mind.arXiv preprint arXiv:2601.14352, 2026

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.962774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.962774Z digest=sha256:9d37aa68aed17e649ca7d3f1d3fdd109d4662e1e0310472935888b6d44641447

Observation 6dbc5041-6eaf-442d-9b12-5593da0039ea · outbound

This paper cites Rynnbrain: Open embodied foundation models.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Rynnbrain: Open embodied foundation models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.966568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.966568Z digest=sha256:9a77d32215745854e9b18507d3bc48d407c3d89eb4028044fca5971f3443e8b2

Observation 162a4f34-dbd6-4735-a7cb-c240bb768c4b · outbound

This paper cites Hy-Embodied-VLM-1.0: Efficient Physical-World Agents.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-08-10T21:18:37.637598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T21:18:32.978898Z digest=sha256:16e657ac95249b409ab3b8be236b18231779e1b4c91cab38b4b85f07a866b0ad

Observation f8b0690c-20b7-4e47-9f58-65448b0824d2 · outbound

This paper cites Cosmos 3: Omnimodal World Models for Physical AI.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Cosmos 3: Omnimodal World Models for Physical AI

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:32.991114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:32.991114Z digest=sha256:6596a3832cbc460ad3d4107386f1676c9e83e381087bf5a088cccab9d87ef3f5

Observation 144621a8-978e-4ce9-85a6-2f52b3fead21 · outbound

This paper cites MiMo-Embodied: X-Embodied Foundation Model Technical Report.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence MiMo-Embodied: X-Embodied Foundation Model Technical Report

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.096528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.096528Z digest=sha256:d5c905e65c0b275e7b56dc925ad966050577b60a6633153761eea800aeb2df36

Observation e1a0f103-d737-4b61-a4bb-243c9b4052bf · outbound

This paper cites Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.155569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.155569Z digest=sha256:ae1c3850378174d7333bb9f6bae79223f658deb6073a185e6710bd9a6848a60f

Observation f05fbe3c-af8b-4870-84d2-0542e86cb1fb · outbound

This paper cites Vesta: A Generalist Embodied Reasoning Model.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Vesta: A Generalist Embodied Reasoning Model

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-08-10T21:18:37.541187Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T21:18:33.160307Z digest=sha256:ad4553f7073f7f5775ee16e208930a0cc0831a2eea6c8c8a3cf755b17f4e3cdd

Observation 7f6474f4-f9c4-455f-9091-189374bf72e2 · outbound

This paper cites ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-08-10T21:18:37.517943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T21:18:33.164594Z digest=sha256:904af8d9948d3abd9337371b862655caf3ed03208cfc36392f1e050d5330d660

Observation 92858ee1-ad6a-492e-9752-bfa56571f301 · outbound

This paper cites EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.169445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.169445Z digest=sha256:0d888f3d7015928a03af02f386bc38f981fdfd876c79f035d9287d7ed62a242b

Observation c68e0c8e-7b94-4b0c-97be-348dbf7ff35e · outbound

This paper cites Towards embodied agentic ai: Review and classification of llm-and vlm-driven robot autonomy and interaction.arXiv preprint arXiv:2508.05294, 2025.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Towards embodied agentic ai: Review and classification of llm-and vlm-driven robot autonomy and interaction.arXiv preprint arXiv:2508.05294, 2025

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.249748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.249748Z digest=sha256:f701fe8c6543add9e12599d6196bbabe71724ca44a2a7ef738e1d5445a3baff1

Observation 33640b2c-5173-4717-a65f-a80b96a4e93f · outbound

This paper cites Behavior-1k: A benchmark for embodied ai with 1,000 everyday activities and realistic simulation.Conference on Robot Learning (CoRL), 2023.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Behavior-1k: A benchmark for embodied ai with 1,000 everyday activities and realistic simulation.Conference on Robot Learning (CoRL), 2023

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.279788Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.279788Z digest=sha256:8b372bea3c505bcc395f5045dc3b9c0294803a03816e1d4d9a4156c7a2f42fb0

Observation d089a960-b2e9-4632-bf07-7fa6250fedd9 · outbound

This paper cites MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.285071Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.285071Z digest=sha256:7dbdf281317374bc8cae599ee7853ad30a4d76256aa3a0a2133453beed8fe980

Observation fdf9a712-d270-4e65-9028-fbeea8192e53 · outbound

This paper cites To mix or to merge: Toward multi-domain reinforcement learning for large language models.arXiv preprint arXiv:2602.12566, 2026.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence To mix or to merge: Toward multi-domain reinforcement learning for large language models.arXiv preprint arXiv:2602.12566, 2026

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.332402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.332402Z digest=sha256:933a0014e954df6eebe18bae53388562588f9416629089935b30c698555c5dbf

Observation d008e851-84b8-4f50-9a8f-ce16372ed5d0 · outbound

This paper cites TIES-Merging: Resolving Interference When Merging Models.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence TIES-Merging: Resolving Interference When Merging Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.474080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.474080Z digest=sha256:fb99dd427b6e3657e8e5970bd82008217529ac22640ca1b981e07e18a495e5d4

Observation 91755aff-dbcc-4616-982a-abbdcaf6c7fe · outbound

This paper cites Qwen3.6-35B-A3B: Agentic coding power, now open to all, April 2026.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Qwen3.6-35B-A3B: Agentic coding power, now open to all, April 2026

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.478764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.478764Z digest=sha256:ee8ebf970da50f56f4ce6455f316829d72398e4fe606c670a076737513395116

Observation c92e48b1-89bd-47a5-9d7d-306aaa57feb6 · outbound

This paper cites Qwen3.5: Towards native multimodal agents, February 2026.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Qwen3.5: Towards native multimodal agents, February 2026

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.484070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.484070Z digest=sha256:dbc378c50d732ba06daeabc40da8bdd31cf6010e1b4f2ef89c0f00791dff6225

Observation 4b70de19-d3b2-4d1b-a254-93af939ef572 · outbound

This paper cites Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents

Reference 31

Resolution
verified exact
local_arxiv, observed 2026-08-10T21:18:37.153623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T21:18:33.489323Z digest=sha256:078d12f8a6c84f39881ce5b1bb7b0ff1e31507b220227662096dd6451d0e8236

Observation 49450709-1715-47a5-92fb-5aa070fb0f64 · outbound

This paper cites Spatial intelligence in vision-language models: A comprehensive survey.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Spatial intelligence in vision-language models: A comprehensive survey

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.493556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.493556Z digest=sha256:e129e50e3ad880e31fcb0328ad170ba2bb90cff2371c268f6e62dc7c429af557

Observation ac357ebb-62a5-4f01-a8bc-6f133836dfbb · outbound

This paper cites Scaling spatial intelligence with multimodal foundation models.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Scaling spatial intelligence with multimodal foundation models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.595378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.595378Z digest=sha256:2dd0a8fb2dda43a0025e83e4885629731dfb2773a8c6a203fb4dc90dc21496b7

Observation 0e8ac789-c608-44cd-9679-15df91d82e69 · outbound

This paper cites Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.681742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.681742Z digest=sha256:e0eaaf34f1585328390c281dd24b7d9de54aebaed599a539c2736460a2d841ed

Observation 48f5a9d4-5ba1-46ac-9242-143276a5bb77 · outbound

This paper cites Mindcube: Spatial mental modeling from limited views.arXiv preprint arXiv:2506.21458, 2025.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Mindcube: Spatial mental modeling from limited views.arXiv preprint arXiv:2506.21458, 2025

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.686415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.686415Z digest=sha256:abebe3a76b530a486e26743635b001da1b1e1cae11661eef74987e9bf3d87d1d

Observation ed101fe9-12c4-4e51-9dc3-2a8c2c769b54 · outbound

This paper cites EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.691153Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.691153Z digest=sha256:f0c7589cac5b536350258b9eb39d1979fc243a510982a1f2b09f024f78ee424a

Observation 15588c70-3e8d-42c5-b43b-e8105dab5da8 · outbound

This paper cites CLEVRER: CoLlision Events for Video REpresentation and Reasoning.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence CLEVRER: CoLlision Events for Video REpresentation and Reasoning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.697230Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.697230Z digest=sha256:09d95e3c7aa01069cda3a6785c89ccfb5b57c5c6e75b6e941343fd68a0b29700

Observation 52943f18-0a9c-492e-a782-7b40631aba5b · outbound

This paper cites Next-qa: Next phase of question- answering to explaining temporal actions.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Next-qa: Next phase of question- answering to explaining temporal actions

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.742687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.742687Z digest=sha256:8ef6702842f2d7599e49b8d0198db8594857c781f3e78f9407c37de024feeb83

Observation 7e34d14b-8972-44f2-8160-102057ebd74e · outbound

This paper cites Perception test: A diagnostic benchmark for multimodal video models.Advances in Neural Information Processing Systems, 36: 42748–42761, 2023.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Perception test: A diagnostic benchmark for multimodal video models.Advances in Neural Information Processing Systems, 36: 42748–42761, 2023

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.806130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.806130Z digest=sha256:962fc63567de5f8a63cfa529dd08f16df85236f665eeb303f179df1ca3c6650d

Observation 21664cc2-0118-4b40-a07f-dec0158dd4de · outbound

This paper cites STAR: A Benchmark for Situated Reasoning in Real-World Videos.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence STAR: A Benchmark for Situated Reasoning in Real-World Videos

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.811024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.811024Z digest=sha256:1220e8d8f4cf9fb970a4ca4f83f48e30f67a2d4cb0476978e1773fc40b6c34e6

Observation 50b4cbe8-816b-4771-bd03-26e64f07a985 · outbound

This paper cites LLaVA-Video: Video Instruction Tuning With Synthetic Data.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence LLaVA-Video: Video Instruction Tuning With Synthetic Data

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.815978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.815978Z digest=sha256:2f7a0a4e6d56aa144c2fe369c75cf5ee2fef66a1ab440ece978a5db77d46a915

Observation 9a915b03-7cc8-4b4c-9167-2d8e39b2fad8 · outbound

This paper cites Scaling rl to long videos.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Scaling rl to long videos

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.820656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.820656Z digest=sha256:11706a91494694fd91687b3fa65fdb17b2ca0a53bb28b7807872e0f28cdf5618

Observation 83b37b98-f0f9-4a27-b8fc-3630fc025293 · outbound

This paper cites Sigurdsson, Gul Varol, Xiaolong Wang, Ali Farhadi, Ivan Laptev, and Abhinav Gupta.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Sigurdsson, Gul Varol, Xiaolong Wang, Ali Farhadi, Ivan Laptev, and Abhinav Gupta

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.963434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.963434Z digest=sha256:14016798b31a5221770d5ddc7b21cab310c160c40ae00fb02e9dd3eb7a39f72c

Observation 2092ae7e-27ce-46de-8f73-cfb520dd1326 · outbound

This paper cites Localizing moments in video with natural language.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Localizing moments in video with natural language

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:33.967117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:33.967117Z digest=sha256:720e582557bc89efad6f0fe76da2a0133930f5fb4b40a6b88484c6835266da08

Observation e239d02d-f01f-4552-8eea-1acabe332c49 · outbound

This paper cites Hierarchical video-moment retrieval and step-captioning.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Hierarchical video-moment retrieval and step-captioning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.035589Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.035589Z digest=sha256:708d432fc5241623537e7a5ac850ef812581c25718ae0ed4fb7c0f972da6d0c0

Observation eee2537f-48ac-4f0c-a942-aee7a7f2a935 · outbound

This paper cites Queryd: A video dataset with high-quality text and audio narrations.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Queryd: A video dataset with high-quality text and audio narrations

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.097731Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.097731Z digest=sha256:9caa268d519d41bc092d35b6e0779baeeb87efee23845b4249cc34ac359f4871

Observation 4a3cba58-04d7-4264-a127-c786019291ed · outbound

This paper cites LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.103487Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.103487Z digest=sha256:c433197abff8bd6cc38716d56fd5437e3e3c0f04e06d3707a18d149fd62d1688

Observation 581d0e6d-922b-493d-957d-1ec240bfe891 · outbound

This paper cites ShareGPT4Video: Improving Video Understanding and Generation with Better Captions.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence ShareGPT4Video: Improving Video Understanding and Generation with Better Captions

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.108407Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.108407Z digest=sha256:ed3e9de15f6391302680b0989d01db67b18339f368aabbb023d739b3c0f8bf4c

Observation a9271ed1-8430-4575-b124-4d6abe3a7614 · outbound

This paper cites Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.141816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.141816Z digest=sha256:1f231a07cb98eb96ca92f20f6114e46a3ef1ab020430a2ddb6fd5ca3ad2866eb

Observation 5134f1df-a2ad-4d25-a522-232b9379943d · outbound

This paper cites Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.146624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.146624Z digest=sha256:c2555a4cb235a67b0e4bf7460a03bfdfbc7cbf5b72da2bbedbe56519f5beacba

Observation c77499d7-845c-43eb-8b61-5b6eb9cc16a7 · outbound

This paper cites Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.152165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.152165Z digest=sha256:2d5a2dc74e9d9f02613c75a5808d0d0166687ba09b7460dc5ac94bff8a503a3e

Observation a475d797-c9c9-496f-be8d-66ef66f0f527 · outbound

This paper cites DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.157336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.157336Z digest=sha256:e4534f8525fdb689adc19039a34fd68a2a5668be52e131de3c706ea2a6fccf90

Observation d7cec257-041a-42a8-b470-45aa21c02dc3 · outbound

This paper cites AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.161372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.161372Z digest=sha256:49aba6a4aa9e8424a64572c18ebaa0f0c0cc7141b45873bd53ab6cdf3a53293c

Observation 7685dd33-d366-4b69-aa92-7fa57addc942 · outbound

This paper cites Robomind 2.0: A multimodal, bimanual mobile manipulation dataset for generalizable embodied intelligence.arXiv preprint arXiv:2512.24653, 2025.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Robomind 2.0: A multimodal, bimanual mobile manipulation dataset for generalizable embodied intelligence.arXiv preprint arXiv:2512.24653, 2025

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.165396Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.165396Z digest=sha256:e399adf47e654b015f0b6b3237a58c3e938aa70bdbeba385364200044c7ecfc3

Observation cfeac7ad-05ee-473a-ba1f-c75afb3ad17e · outbound

This paper cites From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.169970Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.169970Z digest=sha256:f40f53e3f4c368e6496412b21b922a4c6c03e47c8cefb26f62425e9106a569ef

Observation ea4dbfdc-93a9-4a2e-a591-a17284b2caad · outbound

This paper cites RoboVQA: Multimodal Long-Horizon Reasoning for Robotics.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence RoboVQA: Multimodal Long-Horizon Reasoning for Robotics

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.174958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.174958Z digest=sha256:64c16df5224ca08fc8ee15bb6c268880117d95adf165815e24cf5e732877d084

Observation 2b0413ca-47bc-4422-a25a-fed4ca82253d · outbound

This paper cites Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.179159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.179159Z digest=sha256:91629dff5a13bf907767fc1336ae8b81be3292196426b48d45815f4d6a80d64f

Observation 28ab7762-b38e-4f95-b268-f111e381a36c · outbound

This paper cites Roboafford++: A generative ai-enhanced dataset for multimodal affordance learning in robotic manipulation and navigation.arXiv preprint arXiv:2511.12436, 2025.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Roboafford++: A generative ai-enhanced dataset for multimodal affordance learning in robotic manipulation and navigation.arXiv preprint arXiv:2511.12436, 2025

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.269327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.269327Z digest=sha256:71de5f8b28b0f3a7f2c152a2b379fd5adf5caa0064a71809650e62557ec14c76

Observation ae3bc33e-e223-41ac-bcf5-b6e32a498d83 · outbound

This paper cites From flatland to space: Teaching vision-language models to perceive and reason in 3d.arXiv preprint arXiv:2503.22976, 2025.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence From flatland to space: Teaching vision-language models to perceive and reason in 3d.arXiv preprint arXiv:2503.22976, 2025

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.348952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.348952Z digest=sha256:c5874a91bd65848c8d289dc24935320c8646ff00e008901556d69a0293881d13

Observation 2ac471f3-3385-4990-b3f4-0f97783f9428 · outbound

This paper cites OneThinker: All-in-one Reasoning Model for Image and Video.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence OneThinker: All-in-one Reasoning Model for Image and Video

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.360274Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.360274Z digest=sha256:4c27d9ed60755dfa44678fcd231ea8bc287bb633a00bf0a096950d4d7eb1f752

Observation 7c7f7a20-bed4-4527-abc6-eecd1df2401c · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.364746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.364746Z digest=sha256:5617f6b9f1ee7047fe9ad1aa228add9dfe6ff41152fcd095d93f79ae4421708a

Observation c7902afc-23c1-4703-971f-b8c6c196d616 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.371034Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.371034Z digest=sha256:6d314e7b8fe285e994d7d09d9923bb19d04f59e9154a8f3fd077f74e92a3375a

Observation da04dddd-e6f9-4246-83c3-73792ffe8c6d · outbound

This paper cites Thinking with visual primitives.Technical report, 2026.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Thinking with visual primitives.Technical report, 2026

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.375958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.375958Z digest=sha256:f5fa805e9cc58146be8771a872a47dbf0ad5bfbcd1b5c394105e1f8cbfcad785

Observation 16b43f36-a6d6-4399-b2f8-b37f383835c5 · outbound

This paper cites Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.422610Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.422610Z digest=sha256:2cbc2f1516ba8e5b690c5a783a15bb4b2917e072e4cb4b7acaeeb6437ddb5d89

Observation c0505013-0f33-46c6-9863-ed86be8aca6b · outbound

This paper cites Computing discrete fréchet distance.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Computing discrete fréchet distance

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.467999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.467999Z digest=sha256:c80a6dc3cf67abb0322b050207765737e08253dddce6c6f6946f666673314084

Observation 66a70d7f-1737-4421-a885-58eda448e264 · outbound

This paper cites Editing models with task arithmetic.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Editing models with task arithmetic

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.519320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.519320Z digest=sha256:d69bfa2a3581bb21aacef3d0f45de6fb5cc7abbc0c73ec1478fa67c8519b2c7a

Observation b3e6ddeb-108c-43ba-8aaa-8f31591712ce · outbound

This paper cites On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.522970Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.522970Z digest=sha256:23887c00ead91b692d6574e0ae336801e6b691fcd769698e49ef4b632ac54cc3

Observation 9240bcc3-d422-4ac5-b089-cfa9a1000620 · outbound

This paper cites Cambrian-1: A fully open, vision-centric exploration of multimodal llms.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Cambrian-1: A fully open, vision-centric exploration of multimodal llms

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.527373Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.527373Z digest=sha256:9cb6947047db5d01b0c93c49ce5077fbf9b53b8c87e109cc6f6c7f26df465025

Observation c2b34af9-5341-4fc5-b015-cbd3944e1baa · outbound

This paper cites Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models.arXiv preprint arXiv:2506.03135, 2025.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models.arXiv preprint arXiv:2506.03135, 2025

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.531761Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.531761Z digest=sha256:65a732ed3be78e880ca49969aee30d77e37f626e041f58fab5abf9acfad47587

Observation 95287c8b-3854-4d03-bffc-13c3dcd6c0b9 · outbound

This paper cites Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics.arXiv preprint arXiv:2411.16537, 2024.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics.arXiv preprint arXiv:2411.16537, 2024

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.535818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.535818Z digest=sha256:7d48f434cdc6021fe8acfd69dfd32a390935fa1958a73bc4d2eaef5161223f0c

Observation 919792d0-af6c-420c-908a-63c095ce76b0 · outbound

This paper cites Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.554776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.554776Z digest=sha256:eef1f8293b305082d956bd252a46e6352b6793d5bac7f8801d67c455f7abc4bf

Observation 398ecf40-eb65-45f4-905d-5072113e88ba · outbound

This paper cites Openeqa: Embodied question answering in the era of foundation models.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Openeqa: Embodied question answering in the era of foundation models

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.579247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.579247Z digest=sha256:8260f15341271352c9968baf26215d2d1a11715598e35949efda83b4123e8110

Observation 4fd7c8d5-a0d7-4fa5-90c2-3f5c95f42a2b · outbound

This paper cites Omnia de egotempo: Benchmarking temporal understanding of multi-modal llms in egocentric videos.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Omnia de egotempo: Benchmarking temporal understanding of multi-modal llms in egocentric videos

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.626969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.626969Z digest=sha256:d68a50c7cca983c8277575ba683fe6723d0d7284f11db543d4a829ae119ad39d

Observation 8322d1ec-0c1b-41f0-9e61-bb31e74c71f9 · outbound

This paper cites Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.631324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.631324Z digest=sha256:fd1a8b5846714b6396a69ad31eece88cfc3fd5940670bc363a039524e8998e0b

Observation bd18a110-790c-4eee-bddb-ff6638e71253 · outbound

This paper cites MVBench: A Comprehensive Multi-modal Video Understanding Benchmark.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence MVBench: A Comprehensive Multi-modal Video Understanding Benchmark

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.635521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.635521Z digest=sha256:c5e8c9d2b25e8d7ac4a67dbf00f25a61cfd5f003e32298aeba78b91194d8fc08

Observation d88f57ac-3e11-4f7a-b937-26d411effd17 · outbound

This paper cites LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.640153Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.640153Z digest=sha256:4c4a001f57fdbcc8d11933a6e2a4f4aae99f2a412c19971192783bcb64f70dc6

Observation 9b8217a6-8b99-4e16-b871-02f201571e3e · outbound

This paper cites Timelens: Rethinking video temporal grounding with multimodal llms.arXiv preprint arXiv:2512.14698, 2025.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Timelens: Rethinking video temporal grounding with multimodal llms.arXiv preprint arXiv:2512.14698, 2025

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.644370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.644370Z digest=sha256:a2e35aedb9760fff1b5c9d20d16b6f753da263aa20fe8098afc5265917eec59b

Observation 40616467-1d5b-42e1-ad5a-19fd41f99973 · outbound

This paper cites VL-Grasp: a 6-Dof Interactive Grasp Policy for Language-Oriented Objects in Cluttered Indoor Scenes.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence VL-Grasp: a 6-Dof Interactive Grasp Policy for Language-Oriented Objects in Cluttered Indoor Scenes

Reference 78

Resolution
verified exact
local_arxiv, observed 2026-08-10T21:18:36.252207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T21:18:34.648497Z digest=sha256:b349b3d3f63093b34a745ae5a2b4f2f1da01c92be5eaa9e1ba9d2e890dec1d04

Observation 4f568cba-cfae-46ec-905e-d54e13e39fab · outbound

This paper cites Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.676111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.676111Z digest=sha256:1438971dbfbbcdd62290c5b3a18f6a4d1d853bb38c88eda5152c1e8bf5d34c08

Observation 27cbe886-8340-4e8e-af68-7b37eaf1ebf1 · outbound

This paper cites Point-it-out: Benchmarking embodied reasoning for vision language models in multi-stage visual grounding.arXiv preprint arXiv:2509.25794, 2025.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Point-it-out: Benchmarking embodied reasoning for vision language models in multi-stage visual grounding.arXiv preprint arXiv:2509.25794, 2025

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.719268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.719268Z digest=sha256:810b3fd6ce645f187e6efdf2fc6e9d81677b4cebd199edef3665b9604759b682

Observation 71d4f895-b6d9-4a10-bc89-7c27ae3ce6bb · outbound

This paper cites Navitrace: Evaluating embodied navigation of vision- language models.arXiv preprint arXiv:2510.26909, 2025.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Navitrace: Evaluating embodied navigation of vision- language models.arXiv preprint arXiv:2510.26909, 2025

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.744188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.744188Z digest=sha256:62f944e74d1492a0376d8283e7f081350e03275e8c7e9457683b6862a45eaa64

Observation d7558b24-56da-4a40-869e-fc62c065f7c0 · outbound

This paper cites an unresolved cited work.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Unresolved cited work

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.749228Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.749228Z digest=sha256:29f70c3a25d1309e8b3cc98ab6dffc6b3a800c32cad2109b5abbee7711c48b02

Observation c5273e05-751c-4c42-bcde-3cca43a00d34 · outbound

This paper cites MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.753811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.753811Z digest=sha256:5f7977cad8404be299cd4dbd07b4ef13fb0201a63afc9012ecfb2e3193505787

Observation ca55d428-8b33-4f4a-b722-7ec2ef0e057e · outbound

This paper cites Grok-1.5 vision preview and realworldqa.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Grok-1.5 vision preview and realworldqa

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.758326Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.758326Z digest=sha256:8af75245a1bf01a75bae8bff89b62d4b1050626cf54c1e2664fe053a3cf67327

Observation 4e99aed2-a855-4603-85e5-e2604a61e274 · outbound

This paper cites MMBench: Is Your Multi-modal Model an All-around Player?.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence MMBench: Is Your Multi-modal Model an All-around Player?

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.762841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.762841Z digest=sha256:e7de797470a56be2472b018f8eb52bb2e94f77d7c41852f42e826163ddfdc267

Observation 7f21dbfd-f9ab-4a8e-b851-747d9f020d6c · outbound

This paper cites Instruction-Following Evaluation for Large Language Models.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Instruction-Following Evaluation for Large Language Models

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.767697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.767697Z digest=sha256:295cc1cd9d8d16704fdcd6d906dddc8b79518142b7f06269aca6431d9270a021

Observation 0d32e7c7-a8aa-43a4-967e-aa660d459f69 · outbound

This paper cites MMLU-Pro: A more robust and challenging multi-task language understanding benchmark.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence MMLU-Pro: A more robust and challenging multi-task language understanding benchmark

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.773055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.773055Z digest=sha256:aba4b46ebc8af19831fdbf0f3260ed4bb6f401ef6909eda94b56035e2c1f0e29

Observation 085afeb7-cc38-4aa6-89b7-a271d3b69cc2 · outbound

This paper cites Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, and Joseph E.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, and Joseph E

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.777235Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.777235Z digest=sha256:b3ff644690142ecc75a42c3b6782a859b47504e8acb3d93bd62daa6dd124f7fb

Observation 4fc0a1cc-53b9-41f7-be0a-3015c08d04e7 · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.781389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.781389Z digest=sha256:e8cf34f58e8069b34c76e56f0e606f794f8db9098a6cfe28826b2552aa9acfbb

Observation 8f25946d-13b1-45f8-bec8-487fea92ac0d · outbound

This paper cites DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack

Reference 90

Resolution
verified exact
local_arxiv, observed 2026-08-10T21:18:35.961548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T21:18:34.803552Z digest=sha256:8564bcbcddc0962319f7cb2bfaf4fce7ebcb7d19171eb36c8ce91b8bbd070510

Observation 75ba6374-2fd7-4256-900b-3abf96f374ab · outbound

This paper cites Qwen3-VL Technical Report.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Qwen3-VL Technical Report

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.858442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.858442Z digest=sha256:bd1fff5391a01bab02fe69d4a9ace9d191d59482ac621dffdb3b8e2d892a66f0

Observation 40d43281-44b5-4d7c-9c6e-d0f7b39db8b8 · outbound

This paper cites AI2-THOR: An Interactive 3D Environment for Visual AI.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence AI2-THOR: An Interactive 3D Environment for Visual AI

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.918689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.918689Z digest=sha256:c445f4c055254b97f9d50d096f5536940fef4b2541d66620f7dc0b4192316a0a

Observation 3a4aafdf-5e88-4e14-be9a-8312c51e3e0f · outbound

This paper cites Procthor: Large-scale embodied ai using procedural generation.Advances in Neural Information Processing Systems (NeurIPS), 2022.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Procthor: Large-scale embodied ai using procedural generation.Advances in Neural Information Processing Systems (NeurIPS), 2022

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.954091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.954091Z digest=sha256:944d103d30840a9b2910cc8f901bf3feed1e6fd306bd48fad424fe14869d0e27

Observation 245f033b-dc99-4955-b21a-bbbd6393cd3a · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence HybridFlow: A Flexible and Efficient RLHF Framework

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.958615Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.958615Z digest=sha256:b25a708b09d3fb2067a29729abee754943d9295ef3c629578a32a348fab0ac2e

Observation 143c72bf-dc07-436f-8035-c98e13d32153 · outbound

This paper cites Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.963819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.963819Z digest=sha256:fa32d8d35850aafa75a065171c79bf81848436664d0feee78a6a4db57c4421fd

Observation 20da74c3-02f5-482f-a03e-a66a0670e512 · outbound

This paper cites bbox_2d": [x1, y1, x2, y2],.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence bbox_2d": [x1, y1, x2, y2],

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.969726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.969726Z digest=sha256:5085b8d656f670cb3cb6539ae727f4331fbac56e524d3d9aafe3d27ba61e08d2

Observation 6d543b52-9bfc-4277-9c69-ab14ab36e936 · outbound

This paper cites The left hand is holding a green lighter.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence The left hand is holding a green lighter

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.976635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.976635Z digest=sha256:457631d1aec3f3678d7a25cdd10e7e1c96d0af5c03ec5a2b32db633ec6e439b2

Observation 8531c9ee-2c0b-4f8a-97d7-3d689f2ad37c · outbound

This paper cites The top of the lighter is now glowing red/orange, indicating it’s hot or just used, but crucially, there is no flame coming out of it.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence The top of the lighter is now glowing red/orange, indicating it’s hot or just used, but crucially, there is no flame coming out of it

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.981728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.981728Z digest=sha256:5d5a37dc6f3de7a6815542fef7b2dacd968aa6e567d31b003d79f792c36d193f

Observation 39cffba3-a8fb-4858-ae55-44c03298c32e · outbound

This paper cites Based on observations, is the lighter on or off?.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence Based on observations, is the lighter on or off?

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.985997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.985997Z digest=sha256:6ca0b4e5bb4cd3f0b814b1e9cebb23e47868962b775527fb8a03eca8e2246d87

Observation e5b9aa84-f903-4067-a1e5-8c134fc50d35 · outbound

This paper cites * The club sandwich must be inside the packing box.

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence * The club sandwich must be inside the packing box

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:34.990563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T21:18:34.990563Z digest=sha256:074e7e20010d4981ee21bcc9558e0a8df4fd05a14d691a0b046d506ae16ad3b1

Pith citing papers

No inbound Pith citation observations are available.