Pith. sign in

Paper Citation Record · LEDGER

RhinoVLA Technical Report

As of 5 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2606.07383.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2606.07383 v4

Coverage vector

measured 47 of 47 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-02T12:15:09.566913Z

measured 47 of 47 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

47 of 47 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved46
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f85d9cd5-eaf8-471d-be86-915be5b74006 · outbound

This paper cites Qwen3-VL Technical Report.

RhinoVLA Technical Report Qwen3-VL Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.336165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.336165Z digest=sha256:3ad8cbe62a8f4ff934b0b6e55bc30bbc96b82b54addd999cfe5b934104f49cc3

Observation 1b157492-8518-4b89-bf36-4685b1381a01 · outbound

This paper cites PaliGemma: A versatile 3B VLM for transfer.

RhinoVLA Technical Report PaliGemma: A versatile 3B VLM for transfer

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.342615Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.342615Z digest=sha256:e71e266d01af2465d8b86acc6faa1617dce3e8816662f39f8c088d46cc2005b5

Observation 46a570ac-7d0e-491d-beaf-f2b860e3eab1 · outbound

This paper cites GR00T N1: An Open Foundation Model for Generalist Humanoid Robots.

RhinoVLA Technical Report GR00T N1: An Open Foundation Model for Generalist Humanoid Robots

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.347896Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.347896Z digest=sha256:a8c58950d5f9d66972f3bf2b38c02f7e821d0d72b16c8fc6e2671c62a3aba62f

Observation 8549f908-e22e-421b-a437-af7d6c251d48 · outbound

This paper cites $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control.

RhinoVLA Technical Report $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.353004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.353004Z digest=sha256:771a9b5f749996f5367d18a29a41fbec1d6db1caa29732eb02458cbde1601e8e

Observation 6754a7fa-62c6-48af-9237-55f9fb5d6db2 · outbound

This paper cites RT-1: Robotics Transformer for Real-World Control at Scale.

RhinoVLA Technical Report RT-1: Robotics Transformer for Real-World Control at Scale

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.358086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.358086Z digest=sha256:3863edf29d5707195394934e35c6a9ec872fe5d480cdced08471baaddda3940f

Observation c18b988e-134b-42da-8089-190817262859 · outbound

This paper cites AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems.

RhinoVLA Technical Report AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.364085Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.364085Z digest=sha256:691ed0395c3f06e3148c356cfaf386ec07d2af5b7159b12c0e2dea81f4a39802

Observation c62a179b-494d-401b-b76a-9b98accf7cc2 · outbound

This paper cites Internvla-a1: Unifying understanding, generation and action for robotic manipulation.arXiv preprint arXiv:2601.02456, 2026.

RhinoVLA Technical Report Internvla-a1: Unifying understanding, generation and action for robotic manipulation.arXiv preprint arXiv:2601.02456, 2026

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.369485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.369485Z digest=sha256:19d2717beb662b341f9cbe4460e889f853d1176cb882973fdd460ca4e174fb26

Observation fdecfc6a-8e6a-446d-91dc-00b6eef637f6 · outbound

This paper cites WorldVLA: Towards Autoregressive Action World Model.

RhinoVLA Technical Report WorldVLA: Towards Autoregressive Action World Model

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.374191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.374191Z digest=sha256:0cc8f3cfa0a26d1bcf5a0b7e367f983f3ff0db1647aa1b675c1ea5459441583d

Observation 0339165c-18b8-4ff8-8641-4a542d32d281 · outbound

This paper cites PaLI-X: On Scaling up a Multilingual Vision and Language Model.

RhinoVLA Technical Report PaLI-X: On Scaling up a Multilingual Vision and Language Model

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.379092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.379092Z digest=sha256:938f43a8f535d812ebdb16e7ffa8805de6a87aa3985faa9a6729dee5c542e5d7

Observation 6a27a30d-93ac-4229-834c-5fcf5b8ecad6 · outbound

This paper cites Diffusion policy: Visuomotor policy learning via action diffusion.

RhinoVLA Technical Report Diffusion policy: Visuomotor policy learning via action diffusion

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.384064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.384064Z digest=sha256:99d1654a721d67a7ac4162ac96948252c71e4865d6086067735aed552dbd2390

Observation b8c65e87-b356-4689-a999-e81c2cbeef2c · outbound

This paper cites Agibot world colosseum.

RhinoVLA Technical Report Agibot world colosseum

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.389043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.389043Z digest=sha256:8c5d6dc2f100d3868773ceb6f95c752d6861cce4b71b591ca3cfa77f06a71b8b

Observation 5890a996-870d-490c-b5fe-700d87489b7a · outbound

This paper cites Flashattention: Fast and memory-efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344–16359, 2022.

RhinoVLA Technical Report Flashattention: Fast and memory-efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344–16359, 2022

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.393726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.393726Z digest=sha256:75958de8309c2d030cf7d49eaa3f62cb3243f3daf3805d96f5f8af8460b61f37

Observation 62a74055-419e-4ad4-a31c-10404268722a · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

RhinoVLA Technical Report PaLM-E: An Embodied Multimodal Language Model

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.398034Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.398034Z digest=sha256:dfe962313fe89790c6ede9598aeca17c0139c4ba1528e1fb05fe0761717c45e1

Observation 4add70e0-04da-46d8-820b-255e1a8d653b · outbound

This paper cites Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, et al.

RhinoVLA Technical Report Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, et al

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.402606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.402606Z digest=sha256:6f63ccf128aaecf36e22a80d1a35727bb6e1f1a2c2606a2f2c1df9cca95d7818

Observation 66daa49f-ac12-4508-84db-78194d6698bf · outbound

This paper cites NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks.

RhinoVLA Technical Report NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.406859Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.406859Z digest=sha256:12afa1248a1caf4fe24f19e3ee4562a9d9b366e4c54f90703724deba930de32d

Observation e3b952a0-8099-4706-a7a4-3be18757e86a · outbound

This paper cites Bc-z: Zero-shot task generalization with robotic imitation learning.

RhinoVLA Technical Report Bc-z: Zero-shot task generalization with robotic imitation learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.411816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.411816Z digest=sha256:0afd00b68d6290d557b79cddfa8b17cc8237b15a4eeaeecba99786bf880ba4ed

Observation 9c8428fd-7ae8-4c9a-b3c1-9509c7ceccdc · outbound

This paper cites Openvla: An open-source vision- language-action model.

RhinoVLA Technical Report Openvla: An open-source vision- language-action model

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.417028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.417028Z digest=sha256:c087284576c79580791576087b4a6b0671982ee23032ff225dfae4860c3806d6

Observation eb234e85-e580-44b9-9b56-f51854879b04 · outbound

This paper cites Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models.

RhinoVLA Technical Report Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.422092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.422092Z digest=sha256:499d50ac95dadda249e21bc4157858249f15a25698d4f5c3e2c5f6cf81da3e48

Observation cdb3f463-5f6e-4c87-844e-7ade4e4864f0 · outbound

This paper cites Visual Instruction Tuning.

RhinoVLA Technical Report Visual Instruction Tuning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.427135Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.427135Z digest=sha256:841049a7e521ccc5e852f6f43d8189f5f4a439946562dcefb3f11e8dfff52794

Observation ed6e6823-5d97-4d9a-b30a-861c6559d724 · outbound

This paper cites RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation.

RhinoVLA Technical Report RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.433525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.433525Z digest=sha256:b6234f064d87ad47a34a0349d221a89dd61404c931080747fbb112368464bd62

Observation c6a2d310-74ff-4307-8a45-c20c6507ef3b · outbound

This paper cites Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning.

RhinoVLA Technical Report Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.439410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.439410Z digest=sha256:f741ffa9370945cc7dc687987427a915ab4f3f849ae9e7a4a2e30b29f3c82b29

Observation 4b9bfe49-bb9e-415a-8f43-f7ed64646af8 · outbound

This paper cites GeForce RTX 4090: Graphics cards for gaming.

RhinoVLA Technical Report GeForce RTX 4090: Graphics cards for gaming

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.444510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.444510Z digest=sha256:3cb23fe78554eff745c043cd470fc3e64d40cd3bc6e83a13c000393462ac16ec

Observation 1eb1fcb2-4d47-4ccf-a0cc-5f45a7074578 · outbound

This paper cites Nvidia jetson agx orin series technical brief.

RhinoVLA Technical Report Nvidia jetson agx orin series technical brief

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.454578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.454578Z digest=sha256:020908f7a1458b6248b92092ccfee68e5d4ca0061f9e69f2037cc9a7dc857ac3

Observation b7541855-c7be-4084-93e1-2b54a7f338ed · outbound

This paper cites GeForce RTX 5090: Graphics cards for gamers and creators.

RhinoVLA Technical Report GeForce RTX 5090: Graphics cards for gamers and creators

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.459345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.459345Z digest=sha256:df7cdbd8cee0132a04e94579f0ec87f15892727d4bcc845bd56b6d47b95063a6

Observation c800819b-e533-4eee-94f9-ac8f0fe95c51 · outbound

This paper cites Nvidia jetson thor series modules data sheet.

RhinoVLA Technical Report Nvidia jetson thor series modules data sheet

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.464938Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.464938Z digest=sha256:aff281d96f2dd297627c5aa482be01602f93bd9e29214e42daf3c92b875670c5

Observation f045e71a-6319-43bc-bb6f-a073ec597521 · outbound

This paper cites Octo: An open-source generalist robot policy.

RhinoVLA Technical Report Octo: An open-source generalist robot policy

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.469816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.469816Z digest=sha256:1c6d474acf90ee8606db901d91c9675d685c316ae37dabe180561cb3ad9442ab

Observation 753a2d10-196a-44dd-8c9a-070a7bd7ce75 · outbound

This paper cites Open X-Embodiment: Robotic Learning Datasets and RT-X Models.

RhinoVLA Technical Report Open X-Embodiment: Robotic Learning Datasets and RT-X Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.474592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.474592Z digest=sha256:6c0b4cecdfc0077f0414b02daa6ce1a02f4c12869d93cfe2ceff4f67ab2c2c0b

Observation 9fc8d728-4cd6-4b4a-a712-3af23e14269c · outbound

This paper cites DINOv2: Learning Robust Visual Features without Supervision.

RhinoVLA Technical Report DINOv2: Learning Robust Visual Features without Supervision

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.479090Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.479090Z digest=sha256:cebff33d12f16deff993c59c723bac524fef0bccddeaee6043ddbe4cc2a95496

Observation c813eb58-1f70-4a68-8403-88fc581f1e18 · outbound

This paper cites Scalable diffusion models with transformers.

RhinoVLA Technical Report Scalable diffusion models with transformers

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.484141Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.484141Z digest=sha256:c137309a3ff9e32ff9d33b3faa45c42ad3fd53e450df1e13fbc21da946fcfdb8

Observation efb80ac1-3003-44b8-991d-c9f921acb8c8 · outbound

This paper cites FAST: Efficient Action Tokenization for Vision-Language-Action Models.

RhinoVLA Technical Report FAST: Efficient Action Tokenization for Vision-Language-Action Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.488661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.488661Z digest=sha256:b0747ab47403750957c65b431b02649f91132581035734c00239c65f157d814d

Observation f84725e9-35c1-45e5-827d-1e6a84e25804 · outbound

This paper cites π0.5: A vision-language-action model with open-world generalization.

RhinoVLA Technical Report π0.5: A vision-language-action model with open-world generalization

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.493160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.493160Z digest=sha256:9e39034748a2f2e466250444e93dae13908f20cddc0a4625471ec7485a18d3cb

Observation 442ecfd3-46f5-4bc9-8d9b-a1e0360d801b · outbound

This paper cites Spatialvla: Exploring spatial representations for visual-language-action model.

RhinoVLA Technical Report Spatialvla: Exploring spatial representations for visual-language-action model

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.497561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.497561Z digest=sha256:782f70c783fec6797d8a0ad1eeef552e017b1dba015ca5ad2fe3719adaadf0ef

Observation 7d8007c3-5e28-41f6-ae83-c0baeacea111 · outbound

This paper cites Qwen2.5-VL Technical Report.

RhinoVLA Technical Report Qwen2.5-VL Technical Report

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.501965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.501965Z digest=sha256:49f85aaa14451d2074df2c3b740c4a308f596e0b9c94a1445950f9c2959a8ebd

Observation b7be3610-dc9d-4c00-b8ca-c7c833c46e58 · outbound

This paper cites Learning transferable visual models from natural language supervision.

RhinoVLA Technical Report Learning transferable visual models from natural language supervision

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.506790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.506790Z digest=sha256:791cc5d5bdbb15bc577f997d755bc10ddf62695f7d9c9f4d1ed1d3414bb9955d

Observation 64502435-484c-4f28-92d8-d365d88ab92c · outbound

This paper cites Multimodal diffusion transformer: Learning versatile behavior from multimodal goals.

RhinoVLA Technical Report Multimodal diffusion transformer: Learning versatile behavior from multimodal goals

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.511264Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.511264Z digest=sha256:79d3bd1f349d0de11b3de708f5ff85c5b6cf2b090233e86184bf5dd68eae16e1

Observation 9fce9bf0-f028-4b89-90a0-666dd13f7d32 · outbound

This paper cites SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics.

RhinoVLA Technical Report SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.516498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.516498Z digest=sha256:a636d5f4eb2cfed6ab06a04f11585d535a0e343423b7c097cb5f668c6415b562

Observation 05b0731e-5b0f-43a3-ac62-578905f6c4c5 · outbound

This paper cites Agibot world 2026.

RhinoVLA Technical Report Agibot world 2026

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.521411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.521411Z digest=sha256:e77e14180be1deefbdec6e12faf473a875415603b4fc48150ec8c65da86831a1

Observation 788afc40-a1c9-4434-8712-b536a3c37a23 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

RhinoVLA Technical Report Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.528450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.528450Z digest=sha256:aecc4642358e90cde9d033956823c5b66a37c542de2b455cbcbd23375d1c26d0

Observation dba5a7a1-9390-41cf-9a45-784138885758 · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

RhinoVLA Technical Report Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.533201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.533201Z digest=sha256:99396a87c57b25209ee1070db43d3f6202ea1aa6be92084420cd5232b87c23bb

Observation 2ced6296-28c5-4b81-8727-6fa822b89067 · outbound

This paper cites DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control.

RhinoVLA Technical Report DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.538370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.538370Z digest=sha256:3d2445fbe1c7899cf889d9d8ad00d96fc8655abe4e1c900bed4a467da8d6534b

Observation 686b84d6-eb90-48e1-924b-9ca2b66b3f81 · outbound

This paper cites A Pragmatic VLA Foundation Model.

RhinoVLA Technical Report A Pragmatic VLA Foundation Model

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.543286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.543286Z digest=sha256:128a67b8dad51c925188995544ca5a325028c8311c88d557731657f10824b8f8

Observation 4094ad08-12fa-48c1-85e5-dc2217fe5fe4 · outbound

This paper cites Sigmoid loss for language image pre-training.

RhinoVLA Technical Report Sigmoid loss for language image pre-training

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.548343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.548343Z digest=sha256:d148f88609fd522bfa656ff599f20e17a6ca10082548c57a40ddce40b5d6afce

Observation 10ec69e8-d3e5-40d6-a375-9cb4944b20f8 · outbound

This paper cites Root mean square layer normalization.Advances in neural information processing systems, 32, 2019.

RhinoVLA Technical Report Root mean square layer normalization.Advances in neural information processing systems, 32, 2019

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.552785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.552785Z digest=sha256:fefa5e8f8babaa3f48722a293e8871b3a03a58a5721ab25eab41fa548c735a83

Observation dc2be4b3-88aa-4430-8ef4-e5c852eac8fa · outbound

This paper cites Cot-vla: Visual chain-of-thought reasoning for vision-language- action models.

RhinoVLA Technical Report Cot-vla: Visual chain-of-thought reasoning for vision-language- action models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.557770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.557770Z digest=sha256:10b224be0d42a66d4c80021bb85bd35997f93c02bfd4d76cb8a8ebbd7c98f9de

Observation e85b27e7-8d09-44e7-999b-2b25b546de2f · outbound

This paper cites Tracevla: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies.

RhinoVLA Technical Report Tracevla: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.562074Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.562074Z digest=sha256:76fcf8dae1fffdf40f8cab4609af7f754a0fa4a496ef20cd1f30ed0c10b275bf

Observation 707fd63c-029b-419f-af74-9a6a6d1d247f · outbound

This paper cites Rt-2: Vision-language-action models transfer web knowledge to robotic control.

RhinoVLA Technical Report Rt-2: Vision-language-action models transfer web knowledge to robotic control

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-02T12:15:09.566913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.566913Z digest=sha256:291d76a319e18c442f3fb9df5db53bb5e21afa9d1c0584e9cca4c49bd8155792

Observation 3d824208-7385-4a3b-bbdc-39c9492e8242 · outbound

This paper cites an unresolved cited work.

RhinoVLA Technical Report Unresolved cited work

Reference 2022

Resolution
parse uncertain
no resolver link, observed 2026-08-02T12:15:09.450087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:15:09.450087Z digest=sha256:0fbb7e9048ad84703c889f1e460ad4621dc7d37103be94dbd31300390f3e9478

Pith citing papers

No inbound Pith citation observations are available.